dataset-doctor
安全的默认 dry-run 与隔离机制,适合训练前全面检查和修复
会修改本地数据(需 --apply 才执行),执行前应确认并备份
训练前对 LoRA 数据集做结构与标注体检并提供可回退的修复命令
上线训练前给 LoRA 数据集做一轮结构与标注体检:检查图片数量、重复、分辨率分桶、坏图/非 RGB、空 captions、标签频率等,并输出 PASS/WARN/FAIL 报告。会生成按优先级的修复命令(使用 fix_dataset.py),默认先 dry-run 并把改动文件移到 _quarantine,绝不直接删除,只有你确认才真正应用。
▸ 展开 SKILL.md 英文原文
Audit and repair a kohya-style LoRA dataset before training. Use when the user asks to check, validate, inspect, fix, clean, 体检, or 修 a dataset, captions, or tags. Inspect image count, repeats and step budget, resolution and aspect buckets, duplicates, corrupt or non-RGB images, missing or empty captions, trigger consistency, and tag-frequency hygiene. Return a structural PASS, WARN, or FAIL report and apply only confirmed fix_dataset.py actions, dry-run first with displaced originals quarantined.
帮我安装这个 skill:https://raw.githubusercontent.com/Rinne414/lora-training-skill/main/dataset-doctor/SKILL.mdcurl -fsSL "https://raw.githubusercontent.com/Rinne414/lora-training-skill/main/dataset-doctor/SKILL.md"# dataset-doctor — LoRA 数据集 / caption 体检 + 修复 在训练前对 LoRA 数据集与标注做**结构/卫生预检**,给出 **PASS / WARN / FAIL** 结论和按优先级排序的修复建议;PASS 不代表图像与 caption 的语义已经人工验证。确认后用 `fix_dataset.py` 一行命令执行修复。**体检只读**;修复**默认 dry-run**,加 `--apply` 才动文件,且**从不删除**——被移除的文件全部进数据集内的 `_quarantine/`(体检与训练都会忽略它),随时可还原。任何 `--apply` 都必须先得到用户确认。 底层针对 `lora-scripts-next`(SD-Trainer)的数据集约定:`train_data_dir` 下放 `<repeats>_<concept>` 子文件夹(如 `7_zkz` = 重复 7 次、概念 `zkz`),caption 是与图同名的 sidecar `.txt`——**单行**、逗号分隔、可在末尾用「`. `」接自然语言(已验证格式见 `../references/caption-guide.md`)。Anima `.json` caption 仅是 UI 宣称的可选项,训练端 v2.7.0 未发现读取实现,不要依赖。 ## 默认职责 接收一个数据集路径,运行体检脚本,解读 JSON/报告,向用户说明问题与修复顺序;用户确认后用 `fix_dataset.py` 执行修复并重检。trainer 本身**只检查目录是否存在、有没有图**,不