Agent skill · davila7

openrlhf-training

High-performance RLHF framework with Ray+vLLM acceleration. Use for PPO, GRPO, RLOO, DPO training of large models (7B-70B+). Built on Ray, vLLM, ZeRO-3. 2×

Reference it in any coding agent with:

@skills davila7/openrlhf-training

Browse the @skills marketplace