Agent skill · zechenzhangagi

fine-tuning-with-trl

Fine-tune LLMs using reinforcement learning with TRL - SFT for instruction tuning, DPO for preference alignment, PPO/GRPO for reward optimization, and rewa

Reference it in any coding agent with:

@skills zechenzhangagi/fine-tuning-with-trl

Browse the @skills marketplace