Agent skill · zechenzhangagi
fine-tuning-with-trl
Fine-tune LLMs using reinforcement learning with TRL - SFT for instruction tuning, DPO for preference alignment, PPO/GRPO for reward optimization, and rewa
Reference it in any coding agent with:
@skills zechenzhangagi/fine-tuning-with-trl