nemo-curator

仓库创建 2025年11月3日最近提交 1 个月前SkillHot 收录 20 天前
▸ 精选理由

大规模爬取数据快速清洗与高质量构建训练集的利器。

▸ 风险提示

依赖NVIDIA GPU与专有库,安装与运行需高权限和显卡支持。

这个 Skill 做什么

基于GPU的多模态训练数据治理与过滤,支持模糊/语义去重和PII/NSFW检测。

用 GPU 把训练用的大语料快速清洗与治理,支持文本/图片/视频/音频的模糊去重和语义去重,以及 PII 屏蔽和 NSFW 检测等质量过滤。适合从 Common Crawl 等网页抓取的数据做去重、去噪和敏感信息处理,以准备高质量训练集。特色是基于 RAPIDS 在多 GPU 上大幅加速(例如比 CPU 快很多)并提供丰富的质量检测规则。

▸ 展开 SKILL.md 英文原文

GPU-accelerated data curation for LLM training. Supports text/image/video/audio. Features fuzzy deduplication (16× faster), quality filtering (30+ heuristics), semantic deduplication, PII redaction, NSFW detection. Scales across GPUs with RAPIDS. Use for preparing high-quality training datasets, cleaning web data, or deduplicating large corpora.

数据与抓取数据清洗去重多模态通用
1.1w
Stars
817
Forks
40
仓库内 Skill
+704
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/main/05-data-processing/nemo-curator/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/main/05-data-processing/nemo-curator/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# NeMo Curator - GPU-Accelerated Data Curation

NVIDIA's toolkit for preparing high-quality training data for LLMs.

## When to use NeMo Curator

**Use NeMo Curator when:**
- Preparing LLM training data from web scrapes (Common Crawl)
- Need fast deduplication (16× faster than CPU)
- Curating multi-modal datasets (text, images, video, audio)
- Filtering low-quality or toxic content
- Scaling data processing across GPU cluster

**Performance**:
- **16× faster** fuzzy deduplication (8TB RedPajama v2)
- **40% lower TCO** vs CPU alternatives
- **Near-linear scaling** across GPU nodes

**Use alternatives instead**:
- **datatrove**: CPU-based, open-source data processing
- **dolma**: Allen AI's da
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有