Agent skill · nousresearch

fine-tuning-with-trl

TRL: SFT, DPO, GRPO, RLOO reward modeling for LLM RLHF.

Reference it in any coding agent with:

@skills nousresearch/fine-tuning-with-trl

Browse the @skills marketplace