evaluating-llms-harness
在60+学术基准上系统评估并比较语言模型性能的基准工具。
相关性达标的全量 Skills(含未精选长尾)· 共 9642 个
在60+学术基准上系统评估并比较语言模型性能的基准工具。
用认知科学框架为 AI/CS 研究生成新颖的研究方向与点子。
提供十种结构化的 ideation 框架,帮助生成高影响力的研究方向。
为 PyTorch 提供统一分布式训练 API,少量改动即可启用多卡/混精度训练。
为 ML 论文生成架构图与数据驱动的出版级图表(matplotlib / Gemini)。
采用双环架构自动化编排整个 AI 研究项目,含实验迭代与成果合成。
汇总前期产出,自动生成完整 LaTeX 论文草稿并编译成 PDF。
从选定假设生成详细实验蓝图,指定数据集、基线与评估指标。
检索 arXiv 与 Semantic Scholar,做差距分析并生成研究假设。
根据实验蓝图生成可运行的 Python 实验代码骨架,含训练/评估/消融配置。
通过 tsx 运行 TypeScript 脚本以发起 HTTP 请求并流式返回响应。
编写 Playwright E2E 测试脚本、配置测试夹具、CI 集成与视觉回归。
按依赖波次并行派发子代理,为路标中的功能批量生成完整规格与任务。
针对单个任务实现进行对抗式审查,验证边界、需求与证据。
按 TDD 流程自动实现已批准任务并按任务派发子代理执行或手动运行。
作为新工作入门,决定最佳行动路径并通过结构化对话细化方案。
以根因优先方法调查实现失败,结合本地证据与外部文档研究。
用新鲜证据验证任务、修复或测试是否真实完成,避免误报。
在任务完成后做跨任务一致性与覆盖性验证,确保规格被满足。
分析需求与现有代码间的实现差距并建议整合策略。
交互式审查技术设计,确保可实施并发现关键问题。
维护 {{KIRO_DIR}}/steering/ 作为持续项目记忆并负责引导与同步。
为特定领域生成自定义 steering(项目指引)文档。
将需求与设计拆解为 1–3 小时的可执行实现任务并生成任务图。
展示规格当前阶段、完成度、下步行动和阻塞点。
基于项目描述与指导上下文生成符合 EARS 格式的需求文档。
支持交互或自动化模式的快速规格生成器,自动执行四阶段流程。
根据项目描述生成唯一功能名并初始化规格目录与文件结构。
将需求(WHAT)转化为可执行的技术设计(HOW),明确组件与接口。
按依赖波次并行为 roadmap 中所有功能生成完整规格与任务文件。
对完成的任务实现按规范、边界和验证证据进行对抗性审查。
基于 TDD 自动或手动实现任务,支持为每任务派生子代理并完成验收。
作为新任务入口,判断最佳行动路径并通过对话细化任务与拆解。
基于根因优先的流程诊断实现失败并调查阻塞原因。
在宣称完成前,用新证据验证任务、修复或测试是否真实通过。
在任务合并后检验跨任务一致性、测试与规范覆盖情况。
比对需求与现有代码,识别缺失能力与集成挑战。
进行交互式技术设计评审,给出 GO/NO-GO 决策与关键问题。
管理项目的 {{KIRO_DIR}}/steering/ 目录,作为持续记忆与配置来源。
为特定项目场景生成定制化 steering 文件,捕捉领域专属记忆与模式。