huggingface-accelerate

仓库创建 2025年11月3日最近提交 1 个月前SkillHot 收录 20 天前
▸ 精选理由

将分布式训练抽象为少量改动,极大降低上手与工程成本。

▸ 风险提示

需正确配置集群与资源,错误设置可能导致性能或稳定性问题。

这个 Skill 做什么

将 PyTorch 脚本快速转换为多后端分布式训练的轻量工具。

把任意 PyTorch 脚本用四行代码改造成分布式训练,统一支持 DeepSpeed/FSDP/Megatron/DDP,自动做设备放置和混合精度(FP16/BF16/FP8)。适合想快速把单机训练扩到多卡/多机并利用 HuggingFace 生态配置启动的场景,省掉繁琐的分布式细节。

▸ 展开 SKILL.md 英文原文

Simplest distributed training API. 4 lines to add distributed support to any PyTorch script. Unified API for DeepSpeed/FSDP/Megatron/DDP. Automatic device placement, mixed precision (FP16/BF16/FP8). Interactive config, single launch command. HuggingFace ecosystem standard.

开发编程分布式训练简化迁移HF 生态通用
1.1w
Stars
817
Forks
40
仓库内 Skill
+704
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/main/08-distributed-training/accelerate/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/main/08-distributed-training/accelerate/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# HuggingFace Accelerate - Unified Distributed Training

## Quick start

Accelerate simplifies distributed training to 4 lines of code.

**Installation**:
```bash
pip install accelerate
```

**Convert PyTorch script** (4 lines):
```python
import torch
+ from accelerate import Accelerator

+ accelerator = Accelerator()

  model = torch.nn.Transformer()
  optimizer = torch.optim.Adam(model.parameters())
  dataloader = torch.utils.data.DataLoader(dataset)

+ model, optimizer, dataloader = accelerator.prepare(model, optimizer, dataloader)

  for batch in dataloader:
      optimizer.zero_grad()
      loss = model(batch)
-     loss.backward()
+     accelerator.backward(loss)
      optimizer.step()
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有