bootstrap
在无标注与评测集时构建初始评估体系与 v0 分级器。
相关性达标的全量 Skills(含未精选长尾)· 共 417 个
在无标注与评测集时构建初始评估体系与 v0 分级器。
生成攻击型提示并系统性评估模型/应用的安全与越狱漏洞。
用严格统计方法对比两版提示,报告置信区间并校正位置偏倚。
把检索与生成问题分离,诊断 RAG 系统并定位是检索还是生成导致错误。
汇总多项评测结果,生成综合分析报告、趋势与优先整改建议。
评估自动评判器与人工标注的一致性,检测系统性偏差并规划人力替代路径。
选择、配置并组合评测打分器,生成可用于自动评估的度量与代码。
为 LLM/agent 设计高质量评测数据、测试用例与分层样本并输出可用数据集。
指导从零构建 LLM/agent 评估体系并推荐后续评测路径与工具。
为 RL/RLHF 构造点式或对式奖励并聚合多维评分为标量
检验模型引用的文献是否真实并衡量参考文献的幻觉率
对学术论文进行安全、正确性、创新性等多阶段自动审阅
用 OpenJudge 构建 LLM 输出的自动化评估与评分流水线
将 .bib 文件逐条核对 CrossRef、arXiv 与 DBLP 并报告字段不匹配的技能。
自动生成测试用例、收集模型响应并用判定模型生成排行胜率的对比框架技能。
面向 LLM 代理的测试与基准评估工作流,含支持文件与来源信息。
用于对 LLM 代理进行行为测试与基准评估的工作流包。
实现 LLM 驱动的输出比较与评估工作流,支持配对比较与打分。
提供 LLM 作为评判者的评价流程,用于比较与评分模型输出。
提供针对特定细分行业的情报分析与知识注入(旧版)。
针对特定行业注入法规、标准与领域知识的情报工作流(v2)。
分析网页内容与结构,输出页面组成、要点与交互元素说明。
跨多源调研并生成带引用的 Markdown 报告与结构化 JSON。
定期收集并分析顶级媒体与竞品的视频编辑样板与趋势报告。
为代码库出具不带承诺的预决策调研包,评估风险与后续路径。
让多模型在隔离工作树独立完成同一变更并对比评分合并最佳结果
并行检索 Confluence 与 Jira 并合成带引用的答案。
并行搜索 Confluence 与 Jira,合成带引用的答案以回答公司知识问题。
并行搜索 Confluence 与 Jira 并汇总带引用的答案
设计并运行技能的对照基准试验,生成可复现评估报告。
单独运行 AI‑DLC 的 feasibility(可行性)阶段,生成概念验证输出。
用后台代理对高信任的原始资料做调查并生成 Markdown 报告。
检索并引用 Microsoft 官方文档,回答配置、限制与最佳实践问题。
把宽泛主题精炼为一句可用于检索与写作的研究问题。
把文献中冲突的发现映射、解释并结构化为信息。
从综述合成中定位明确且可执行的研究空白与后续研究方向。
将核心研究问题拆成3-5个清晰、基本不重叠的综述模块。
比较并论证不同研究方法能回答的问题、局限与适用场景,生成方法表格。
用 Claude 做调研并将经审核的结论作为持久知识导入 ratchet。
记录与追踪任务/实验运行的溯源信息,便于复现与审计。