openrlhf-training

仓库创建 2025年11月3日最近提交 1 个月前SkillHot 收录 21 天前
▸ 精选理由

适合大模型的分布式RLHF训练与GPU资源共享场景。

▸ 风险提示

通常需Docker、NVIDIA GPU与复杂集群配置才可运行。

这个 Skill 做什么

基于Ray和vLLM的高性能分布式RLHF训练框架,支持PPO/GRPO/DPO等。

用于大模型的高性能分布式 RLHF 训练框架,基于 Ray 和 vLLM 加速,支持 PPO、GRPO、RLOO、DPO 等算法,适合 7B–70B+ 模型的训练。需要对资源密集型训练、策略优化和大规模并行训练场景时使用,能显著缩短训练时间。特色在于分布式架构、GPU 资源共享与 ZeRO-3 优化,实际速度比 DeepSpeedChat 有明显优势。

▸ 展开 SKILL.md 英文原文

High-performance RLHF framework with Ray+vLLM acceleration. Use for PPO, GRPO, RLOO, DPO training of large models (7B-70B+). Built on Ray, vLLM, ZeRO-3. 2× faster than DeepSpeedChat with distributed architecture and GPU resource sharing.

研究检索RLHF分布式vLLM通用
1.1w
Stars
817
Forks
40
仓库内 Skill
+704
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/main/06-post-training/openrlhf/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/main/06-post-training/openrlhf/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# OpenRLHF - High-Performance RLHF Training

## Quick start

OpenRLHF is a Ray-based RLHF framework optimized for distributed training with vLLM inference acceleration.

**Installation**:
```bash
# Launch Docker container
docker run --runtime=nvidia -it --rm --shm-size="10g" --cap-add=SYS_ADMIN \
  -v $PWD:/openrlhf nvcr.io/nvidia/pytorch:25.02-py3 bash

# Uninstall conflicts
sudo pip uninstall xgboost transformer_engine flash_attn pynvml -y

# Install OpenRLHF with vLLM
pip install openrlhf[vllm]
```

**PPO Training** (Hybrid Engine):
```bash
ray start --head --node-ip-address 0.0.0.0 --num-gpus 8

ray job submit --address="http://127.0.0.1:8265" \
  --runtime-env-json='{"working_dir": "/op
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有