fine-tuning-with-trl

仓库创建 2025年11月3日最近提交 1 个月前SkillHot 收录 21 天前
▸ 精选理由

面向 RLHF 的全流程工具链,适合需要偏好对齐与奖励优化的团队。

▸ 风险提示

需要大量 GPU 资源并可能涉及 HuggingFace 权限与模型权重下载。

这个 Skill 做什么

用 TRL 对语言模型进行 SFT/DPO/PPO 等后训练调优与奖励模型训练。

在 HuggingFace 生态里用 TRL 做后训练:SFT 用于指令微调,DPO 做偏好对齐,PPO/GRPO 做基于奖励的优化,并能训练奖励模型。当你要做 RLHF、把模型对齐到用户偏好或用人类反馈微调时就会用到它。特点是把多种微调与强化方法集成,能直接在开源模型上跑并接入常见训练工具链。

▸ 展开 SKILL.md 英文原文

Fine-tune LLMs using reinforcement learning with TRL - SFT for instruction tuning, DPO for preference alignment, PPO/GRPO for reward optimization, and reward model training. Use when need RLHF, align model with preferences, or train from human feedback. Works with HuggingFace Transformers.

研究检索强化学习微调RLHF通用
1.1w
Stars
817
Forks
40
仓库内 Skill
+704
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/main/06-post-training/trl-fine-tuning/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/main/06-post-training/trl-fine-tuning/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# TRL - Transformer Reinforcement Learning

## Quick start

TRL provides post-training methods for aligning language models with human preferences.

**Installation**:
```bash
pip install trl transformers datasets peft accelerate
```

**Supervised Fine-Tuning** (instruction tuning):
```python
from trl import SFTTrainer

trainer = SFTTrainer(
    model="Qwen/Qwen2.5-0.5B",
    train_dataset=dataset,  # Prompt-completion pairs
)
trainer.train()
```

**DPO** (align with preferences):
```python
from trl import DPOTrainer, DPOConfig

config = DPOConfig(output_dir="model-dpo", beta=0.1)
trainer = DPOTrainer(
    model=model,
    args=config,
    train_dataset=preference_dataset,  # chosen/rejected 
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有