huggingface-accelerate

仓库创建 2026年3月17日最近提交 2 个月前SkillHot 收录 22 天前
▸ 精选理由

极简改造即可在多卡/多机环境运行,降低分布式训练门槛。

▸ 风险提示

需要安装外部依赖并访问 GPU/集群资源,可能涉及权限与兼容性问题。

这个 Skill 做什么

为 PyTorch 提供统一分布式训练 API,少量改动即可启用多卡/混精度训练。

对现有 PyTorch 脚本只需几行改动就能启用多卡分布式与混合精度训练,统一兼容 DeepSpeed、FSDP、Megatron、DDP 等后端。想把单卡训练扩展到多卡或启用 FP16/BF16/FP8 时用,启动配置也很友好。特点是自动设备分配、交互式配置和一键启动,和 HuggingFace 生态紧密集成。

▸ 展开 SKILL.md 英文原文

Simplest distributed training API. 4 lines to add distributed support to any PyTorch script. Unified API for DeepSpeed/FSDP/Megatron/DDP. Automatic device placement, mixed precision (FP16/BF16/FP8). Interactive config, single launch command. HuggingFace ecosystem standard.

开发编程分布式训练PyTorch加速通用
1.5k
Stars
102
Forks
16
仓库内 Skill
+0
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/OpenRaiser/NanoResearch/main/skills/vendor-ai-research/accelerate/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/OpenRaiser/NanoResearch/main/skills/vendor-ai-research/accelerate/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# HuggingFace Accelerate - Unified Distributed Training

## Quick start

Accelerate simplifies distributed training to 4 lines of code.

**Installation**:
```bash
pip install accelerate
```

**Convert PyTorch script** (4 lines):
```python
import torch
+ from accelerate import Accelerator

+ accelerator = Accelerator()

  model = torch.nn.Transformer()
  optimizer = torch.optim.Adam(model.parameters())
  dataloader = torch.utils.data.DataLoader(dataset)

+ model, optimizer, dataloader = accelerator.prepare(model, optimizer, dataloader)

  for batch in dataloader:
      optimizer.zero_grad()
      loss = model(batch)
-     loss.backward()
+     accelerator.backward(loss)
      optimizer.step()
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有