paper-digger-experiment

仓库创建 2026年7月27日最近提交 2 天前SkillHot 收录 2 天前
▸ 精选理由

把实验结果系统化入证据库,有利于可复现与早停决策。

▸ 风险提示

会执行本地批处理/脚本并写入证据库,需注意运行权限与数据保密。

这个 Skill 做什么

按计划执行实验、记录有凭证的指标并做对抗性验证与早停判断。

按照既定的实验计划去跑真实实验,把有凭证的指标和产物汇入 evidence bank,并做对抗性验证与早停判断。用在已经批准、按步骤执行的实验(research runs)场景,先做最小验证再按评价节点决定是否继续或 kill-early。特点是以证据为准、强调可复现和对抗验证,而不是随意跑几次就结论。

▸ 展开 SKILL.md 英文原文

Use when executing an approved experiment plan, recording artifact-backed metrics, and verifying evidence. Triggers on 跑实验, 执行实验, run experiments, evidence bank.

研究检索实验执行证据库可验证通用
0
Stars
0
Forks
7
仓库内 Skill
+0
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/Iu1ky/paper-digger/main/plugins/paper-digger/skills/paper-digger-experiment/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/Iu1ky/paper-digger/main/plugins/paper-digger/skills/paper-digger-experiment/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# Paper Digger Experiment — 实验执行(Phase 5a)

读 `state.experiments`(由 `paper-digger-plan` 种入,status=`planned`)+ `04_plan/research_plan.md` 的执行顺序,逐个执行,把结果汇入 evidence bank 并**对抗式验证**。**先跑最小验证 → 评价节点② → kill-early**。(SSH 远程算力本版不接,后续 plan 再加。)

## 运行时与宿主适配

定位同级 `paper-digger` skill,并把它的 `scripts/` 加入 Python import path 后调用 `paper_digger.*`。默认用批处理脚本执行同构 runs;只有需要独立改代码或分析且 effort 预算允许时才委托隔离 agent/worktree。任何宿主都必须保留真实命令、退出状态、指标文件和 verifier 结论。

## 三模式(按每个实验的 `mode`)
- **dry(计算型)**:把同构重复实验交给一个可复现批处理脚本;不要为每个 seed/arm 启动 agent。每个单元都要**真写真跑**,回报 `{command, metrics, success, notes}`。
- **wet(物理/湿/人类受试)**:不亲自跑 —— 产出 protocol + 对照/power + pre-registration + **分析流水线脚本**;用户执行回传数据后再分析。
- **theory**:转交 `paper-
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有