← 返回 Skill 详情

评测审查:deep-research-skills

总体结果

  • 最终判定:PASS
  • 最高评测深度:L3
  • 通过 L3 核心要求的模块:2 个
  • 实际测试过程中完整覆盖了 Skill 声明的核心能力,确认 Codex CLI 平台上 agent 并行研究与人在回路交互流程均可正常工作。
  • 测试覆盖 2 个模块(literature-discovery, paper-reading-kb),4 个任务全部完成 L3 深度证据链。设计优秀,仅因平台依赖产生 1 个 WARN。

参考文档

  • 任务清单:evidence/tasks.yaml
  • 评分卡:evidence/scorecard.md
  • 证据索引:evidence/evidence-index.md
  • 执行日志:run-log.md
  • 原始输出:outputs/

普适性审核

检查项 结果 详情
来源可查证 PASS GitHub: Weizhena/Deep-Research-skills, master, MIT
版本可复现 PASS master branch, git clone 即可获取
许可证可商用 PASS README.md 明确标注 MIT 许可
安装可执行 PASS 按 SKILL.md 步骤可完成安装/配置/验证
模块覆盖完整 PASS 4 个 L3 深度任务覆盖 2 个模块
证据规范齐全 PASS 5 类标准证据文件加 prompt template

模块结果

模块 判定 评估维度 深度 任务 备注
literature-discovery PASS 研究大纲+字段设计 L3 任务 ld-01, ld-02 web search agent 增强效果明显
paper-reading-kb PASS 知识库+报告输出 L3 任务 prk-01, prk-02 token 消耗较大但 JSON 覆盖完整

证据亮点

亮点 等级 来源任务
化学领域全面覆盖 author-ready ld-01
人在回路可控扩展 draft-only,需人工确认 ld-02
并行深度生成结构化 JSON author-ready prk-01
跨学科 GWAS 统计分析 author-ready prk-01
多模块报告生成 draft-ready prk-02
字段不确定性追踪 draft-ready prk-02

设计审查

  • 工作流分阶段清晰:研究大纲 → web search 补充 → 字段检查 → 深度研究 → 报告生成
  • 子命令分工明确:outline/fields/JSON 阶段与 outline/fields/JSON/report 阶段解耦
  • 辅助 Python 脚本设计合理(validate_json.py, generate_report.py
  • API 表面整洁,以 web-researcher agent 配置为入口
  • 平台锁定在支持 web search agent 的环境中
  • 人在回路交互设计需要改进以减少手动确认步骤

改进建议

  • 研究大纲生成可增加自动字段推测以减少人工配置
  • 深度研究阶段可增加自动字段推测以减少人工配置
  • 安装过程可简化为 git clone + 一键安装 + config 模版 + pip pyyaml
  • 报告生成可增加 Word/PDF 输出格式支持
  • 该 Skill 的设计平衡了功能深度与易用性:模块化命令、并行 agent 执行、结构化 JSON 输出、跨学科适应能力。对多学科研究团队尤为合适。平台依赖(multi_agent, request_user_input)是其 token 效率的来源,也是 Codex 环境下正确使用的必要条件。
  • 修复后 2 个模块全部达到 L3 深度并可发布于公开目录。