TRL: SFT, DPO, GRPO, RLOO reward modeling for LLM RLHF.
TRL: SFT, DPO, GRPO, RLOO reward modeling for LLM RLHF. A reusable SKILL.md agent skill by NousResearch.
NousResearch
cli
free