experiment-queue

仓库创建 2026年3月10日最近提交 5 天前SkillHot 收录 20 天前
▸ 精选理由

适合大规模离线实验的自动排队与异常处理

▸ 风险提示

运行守护调度器并需 SSH 权限,能执行远程代码,存在风险

这个 Skill 做什么

基于 SSH 的实验队列,支持多 seed、多配置与重试。

通过 SSH 管理大批实验的排队和调度,支持多 seed、多配置、出 OOM 后重试并清理陈旧的 screen。需要跑 10+ 个联动作业、网格搜索或批量 sweep 时用,能把多次实验组织成波次执行。特点是自带服务器端调度(波次/依赖/重试),方便过夜可视化状态,不需要再加一层外部轮询调度。

▸ 展开 SKILL.md 英文原文

SSH job queue for multi-seed/multi-config ML experiments with OOM-aware retry, stale-screen cleanup, and wave-transition race prevention. Use when user says "batch experiments", "队列实验", "run grid", "multi-seed sweep", "auto-chain experiments", or when /run-experiment is insufficient for 10+ jobs that need orchestration.

开发编程任务队列多配置SweepOOM重试通用
1.4w
Stars
1.2k
Forks
40
仓库内 Skill
+844
7 日增星
安装 / 使用
给你的 Agent 一句话(通用)
帮我安装这个 skill:https://raw.githubusercontent.com/wanshuiyin/Auto-claude-code-research-in-sleep/main/skills/experiment-queue/SKILL.md
或 curl 直取 SKILL.md
curl -fsSL "https://raw.githubusercontent.com/wanshuiyin/Auto-claude-code-research-in-sleep/main/skills/experiment-queue/SKILL.md"
SKILL.MD 节选查看完整文件 ↗
# Experiment Queue

> ⏱ **External cadence: visibility only.** This skill already runs its own
> detached server-side scheduler (60s poll + `depends_on` + wave transitions).
> Use its status output for overnight visibility (N done / N running / N
> pending); do **not** wrap it in a second `/loop` / `CronCreate` poll — that
> duplicates the scheduler on an uncoordinated clock and races the
> wave-transition logic it was built to prevent. See
> [`shared-references/external-cadence.md`](../shared-references/external-cadence.md)
> ("don't duplicate an existing scheduler").

Orchestrate large batches of ML experiments on SSH remote GPU servers with proper state tracking, OOM retry, stale cleanup,
via SKILL·HOT · 数据来自 GitHub 公开信息 · 原文版权归作者所有