全部收录

相关性达标的全量 Skills(含未精选长尾)· 共 417

bootstrap

在无标注与评测集时构建初始评估体系与 v0 分级器。

▸ 推荐理由快速把空白项目变为可验证的初步评测流程,便于迭代。
研究检索冷启动评估数据标注评测搭建通用Skill.md ↗

prompt-regression

用严格统计方法对比两版提示,报告置信区间并校正位置偏倚。

▸ 推荐理由强制置信区间与去偏方法,适合需要严谨验证提示改动效果的工程化场景。
研究检索提示对比A/B 测试统计检验通用Skill.md ↗

rag-eval

把检索与生成问题分离,诊断 RAG 系统并定位是检索还是生成导致错误。

▸ 推荐理由能快速定位 RAG 故障来源,帮助针对性优化检索或生成模块。
研究检索RAG 评估检索诊断生成分析通用✓ ClawHubSkill.md ↗

eval-report

汇总多项评测结果,生成综合分析报告、趋势与优先整改建议。

▸ 推荐理由把分散的评测信号综合成可执行的高层结论和优先级,便于决策。
研究检索评估报告成熟度评估优先级建议通用Skill.md ↗

align-human

评估自动评判器与人工标注的一致性,检测系统性偏差并规划人力替代路径。

▸ 推荐理由有严格门控条件,有助于安全且可验证地降低人工审核比例。
研究检索人机对齐一致性分析偏差检测通用Skill.md ↗

metric-design

选择、配置并组合评测打分器,生成可用于自动评估的度量与代码。

▸ 推荐理由输出可执行的 GradingRunner 代码,便于将多种评估器整合到管道中。
▸ 风险提示需要安装并依赖 py-openjudge 等外部 SDK
研究检索指标设计打分器配置评估管道通用Skill.md ↗

eval-design

为 LLM/agent 设计高质量评测数据、测试用例与分层样本并输出可用数据集。

▸ 推荐理由能产出可直接用于自动评测(如 OpenJudge)的评测集,节省人工设计成本。
研究检索评测数据测试用例分层采样通用Skill.md ↗

meta-eval

指导从零构建 LLM/agent 评估体系并推荐后续评测路径与工具。

▸ 推荐理由适合想搭建或改进评估管线的团队,覆盖从数据到工具的决策点。
研究检索评估流程测评策略入门引导通用Skill.md ↗

paper-review

对学术论文进行安全、正确性、创新性等多阶段自动审阅

▸ 推荐理由支持多学科与 LaTeX/PDF,便于自动化初审与筛查
▸ 风险提示自动审稿结果需人工复核,可能存在误判
研究检索论文审阅多阶段评估PDF解析通用Skill.md ↗

bib-verify

将 .bib 文件逐条核对 CrossRef、arXiv 与 DBLP 并报告字段不匹配的技能。

▸ 推荐理由自动发现伪造或错误引用,节省人工核对参考文献的时间。
▸ 风险提示需访问外部学术数据库,涉及网络请求与可能的速率限制。
研究检索参考文献BibTeX验证学术通用Skill.md ↗

auto-arena

自动生成测试用例、收集模型响应并用判定模型生成排行胜率的对比框架技能。

▸ 推荐理由端到端对比多模型、自动化生成评测标准,适合模型选择与研究对比。
▸ 风险提示会调用外部模型端点并需 API 密钥,可能产生费用或泄露输入数据。
研究检索模型评估自动对比基准测试通用Skill.md ↗

page-analysis

分析网页内容与结构,输出页面组成、要点与交互元素说明。

▸ 推荐理由快速理解复杂页面结构,利于后续信息抽取或自动化决策。
▸ 风险提示会访问外部网页用于抓取与分析
研究检索页面解析结构化摘要交互元素识别通用Skill.md ↗

deep-research

跨多源调研并生成带引用的 Markdown 报告与结构化 JSON。

▸ 推荐理由适合需要系统化、可引用的深度调查与报告自动化。
▸ 风险提示会访问外部网站并在本地写入研究文件
研究检索网页调研多源引用报告生成通用Skill.md ↗

wr3-editorial-bench

定期收集并分析顶级媒体与竞品的视频编辑样板与趋势报告。

▸ 推荐理由自动化竞品与行业样板研究,帮助内容策略与风格定位决策。
▸ 风险提示抓取外部媒体与样板可能涉及版权、反爬或访问限制风险。
研究检索竞争调研样板收集月度任务通用Skill.md ↗

research

为代码库出具不带承诺的预决策调研包,评估风险与后续路径。

▸ 推荐理由专注于 repo 级别的可行性与风险评估,适合决策前分析。
研究检索调研预决策风险评估通用Skill.md ↗

model-bakeoff

让多模型在隔离工作树独立完成同一变更并对比评分合并最佳结果

▸ 推荐理由提供可复现且公平的多模型代码变更竞赛与评估流程
▸ 风险提示可能需大量计算资源并访问多个模型接口
研究检索模型评测对照竞赛合并通用Skill.md ↗
isukharev/atl067°

search-knowledge

并行检索 Confluence 与 Jira 并合成带引用的答案。

▸ 推荐理由将企业知识库交叉搜索并给出可引用的综合答复。
▸ 风险提示读取公司内部文档可能暴露敏感信息,应注意数据边界。
研究检索知识检索ConfluenceJira引用通用Skill.md ↗
isukharev/atl062°

search-knowledge

并行搜索 Confluence 与 Jira,合成带引用的答案以回答公司知识问题。

▸ 推荐理由快速定位跨系统讨论与决策证据,便于做出基于证据的回答。
▸ 风险提示需要读取权限并可能暴露敏感内部信息,注意访问控制。
研究检索知识库搜索ConfluenceJira引用答复通用Skill.md ↗
isukharev/atl066°

search-knowledge

并行搜索 Confluence 与 Jira 并汇总带引用的答案

▸ 推荐理由快速把公司文档与工单结合成有引用的回答,便于决策与共享
▸ 风险提示需要配置 atl CLI,读取公司内部文档需具备访问权限
研究检索知识检索ConfluenceJira通用Skill.md ↗

benchmark-skill

设计并运行技能的对照基准试验,生成可复现评估报告。

▸ 推荐理由适合验证技能改进是否真实带来收益。
▸ 风险提示可能调用模型或外部服务产生费用与数据外泄风险
研究检索基准测试评估实验指标通用Skill.md ↗

research

用后台代理对高信任的原始资料做调查并生成 Markdown 报告。

▸ 推荐理由适合把阅读与事实核查工作交给代理并产出可审计文档。
研究检索调研背景代理原始来源通用Skill.md ↗

ratchet-research

用 Claude 做调研并将经审核的结论作为持久知识导入 ratchet。

▸ 推荐理由把一次性研究转化为可复用的知识条目,适合长期知识管理。
研究检索知识采集研究合成ratchetClaude CodeSkill.md ↗

run-provenance

记录与追踪任务/实验运行的溯源信息,便于复现与审计。

▸ 推荐理由为研究或数据工作提供系统化的运行历史与复现证据。
▸ 风险提示可能记录敏感输入/输出,需注意数据脱敏与存储策略。
研究检索可追溯性运行日志审计通用Skill.md ↗