dataset-doctor

仓库创建 2026年7月27日最近提交 13 小时前SkillHot 收录 4 小时前
▸ 精选理由

安全的默认 dry-run 与隔离机制,适合训练前全面检查和修复

▸ 风险提示

会修改本地数据(需 --apply 才执行),执行前应确认并备份

这个 Skill 做什么

训练前对 LoRA 数据集做结构与标注体检并提供可回退的修复命令

上线训练前给 LoRA 数据集做一轮结构与标注体检:检查图片数量、重复、分辨率分桶、坏图/非 RGB、空 captions、标签频率等,并输出 PASS/WARN/FAIL 报告。会生成按优先级的修复命令(使用 fix_dataset.py),默认先 dry-run 并把改动文件移到 _quarantine,绝不直接删除,只有你确认才真正应用。

▸ 展开 SKILL.md 英文原文

Audit and repair a kohya-style LoRA dataset before training. Use when the user asks to check, validate, inspect, fix, clean, 体检, or 修 a dataset, captions, or tags. Inspect image count, repeats and step budget, resolution and aspect buckets, duplicates, corrupt or non-RGB images, missing or empty captions, trigger consistency, and tag-frequency hygiene. Return a structural PASS, WARN, or FAIL report and apply only confirmed fix_dataset.py actions, dry-run first with displaced originals quarantined.

数据与抓取LoRA数据数据体检自动修复通用
2
Stars
0
Forks
3
仓库内 Skill
积累中
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/Rinne414/lora-training-skill/main/dataset-doctor/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/Rinne414/lora-training-skill/main/dataset-doctor/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# dataset-doctor — LoRA 数据集 / caption 体检 + 修复

在训练前对 LoRA 数据集与标注做**结构/卫生预检**,给出 **PASS / WARN / FAIL** 结论和按优先级排序的修复建议;PASS 不代表图像与 caption 的语义已经人工验证。确认后用 `fix_dataset.py` 一行命令执行修复。**体检只读**;修复**默认 dry-run**,加 `--apply` 才动文件,且**从不删除**——被移除的文件全部进数据集内的 `_quarantine/`(体检与训练都会忽略它),随时可还原。任何 `--apply` 都必须先得到用户确认。

底层针对 `lora-scripts-next`(SD-Trainer)的数据集约定:`train_data_dir` 下放 `<repeats>_<concept>` 子文件夹(如 `7_zkz` = 重复 7 次、概念 `zkz`),caption 是与图同名的 sidecar `.txt`——**单行**、逗号分隔、可在末尾用「`. `」接自然语言(已验证格式见 `../references/caption-guide.md`)。Anima `.json` caption 仅是 UI 宣称的可选项,训练端 v2.7.0 未发现读取实现,不要依赖。

## 默认职责

接收一个数据集路径,运行体检脚本,解读 JSON/报告,向用户说明问题与修复顺序;用户确认后用 `fix_dataset.py` 执行修复并重检。trainer 本身**只检查目录是否存在、有没有图**,不
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有