Agent skill · davila7
fine-tuning-with-trl
Fine-tune LLMs using reinforcement learning with TRL - SFT for instruction tuning, DPO for preference alignment, PPO/GRPO for reward optimization, and rewa
Reference it in any coding agent with:
@skills davila7/fine-tuning-with-trl