Agent skill · nousresearch
fine-tuning-with-trl
TRL: SFT, DPO, GRPO, RLOO reward modeling for LLM RLHF.
Reference it in any coding agent with:
@skills nousresearch/fine-tuning-with-trlAgent skill · nousresearch
TRL: SFT, DPO, GRPO, RLOO reward modeling for LLM RLHF.
Reference it in any coding agent with:
@skills nousresearch/fine-tuning-with-trl