Agent skill · omer-metin
reinforcement-learning
Use when implementing RL algorithms, training agents with rewards, or aligning LLMs with human feedback - covers policy gradients, PPO, Q-learning, RLHF, a
Reference it in any coding agent with:
@skills omer-metin/reinforcement-learning