nemo-curator
仓库创建 2025年11月3日最近提交 1 个月前SkillHot 收录 20 天前
▸ 精选理由
大规模爬取数据快速清洗与高质量构建训练集的利器。
▸ 风险提示
依赖NVIDIA GPU与专有库,安装与运行需高权限和显卡支持。
这个 Skill 做什么
基于GPU的多模态训练数据治理与过滤,支持模糊/语义去重和PII/NSFW检测。
用 GPU 把训练用的大语料快速清洗与治理,支持文本/图片/视频/音频的模糊去重和语义去重,以及 PII 屏蔽和 NSFW 检测等质量过滤。适合从 Common Crawl 等网页抓取的数据做去重、去噪和敏感信息处理,以准备高质量训练集。特色是基于 RAPIDS 在多 GPU 上大幅加速(例如比 CPU 快很多)并提供丰富的质量检测规则。
▸ 展开 SKILL.md 英文原文
GPU-accelerated data curation for LLM training. Supports text/image/video/audio. Features fuzzy deduplication (16× faster), quality filtering (30+ heuristics), semantic deduplication, PII redaction, NSFW detection. Scales across GPUs with RAPIDS. Use for preparing high-quality training datasets, cleaning web data, or deduplicating large corpora.
1.1w
Stars
817
Forks
40
仓库内 Skill
+704
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/main/05-data-processing/nemo-curator/SKILL.md或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/Orchestra-Research/AI-Research-SKILLs/main/05-data-processing/nemo-curator/SKILL.md"SKILL.MD 节选查看完整文件 ↗
# NeMo Curator - GPU-Accelerated Data Curation NVIDIA's toolkit for preparing high-quality training data for LLMs. ## When to use NeMo Curator **Use NeMo Curator when:** - Preparing LLM training data from web scrapes (Common Crawl) - Need fast deduplication (16× faster than CPU) - Curating multi-modal datasets (text, images, video, audio) - Filtering low-quality or toxic content - Scaling data processing across GPU cluster **Performance**: - **16× faster** fuzzy deduplication (8TB RedPajama v2) - **40% lower TCO** vs CPU alternatives - **Near-linear scaling** across GPU nodes **Use alternatives instead**: - **datatrove**: CPU-based, open-source data processing - **dolma**: Allen AI's da
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有