评测审查:deep-research-skills
总体结果
- 最终判定:PASS
- 最高评测深度:L3
- 通过 L3 核心要求的模块:2 个
- 实际测试过程中完整覆盖了 Skill 声明的核心能力,确认 Codex CLI 平台上 agent 并行研究与人在回路交互流程均可正常工作。
- 测试覆盖 2 个模块(literature-discovery, paper-reading-kb),4 个任务全部完成 L3 深度证据链。设计优秀,仅因平台依赖产生 1 个 WARN。
参考文档
- 任务清单:
evidence/tasks.yaml - 评分卡:
evidence/scorecard.md - 证据索引:
evidence/evidence-index.md - 执行日志:
run-log.md - 原始输出:
outputs/
普适性审核
| 检查项 | 结果 | 详情 |
|---|---|---|
| 来源可查证 | PASS | GitHub: Weizhena/Deep-Research-skills, master, MIT |
| 版本可复现 | PASS | master branch, git clone 即可获取 |
| 许可证可商用 | PASS | README.md 明确标注 MIT 许可 |
| 安装可执行 | PASS | 按 SKILL.md 步骤可完成安装/配置/验证 |
| 模块覆盖完整 | PASS | 4 个 L3 深度任务覆盖 2 个模块 |
| 证据规范齐全 | PASS | 5 类标准证据文件加 prompt template |
模块结果
| 模块 | 判定 | 评估维度 | 深度 | 任务 | 备注 |
|---|---|---|---|---|---|
| literature-discovery | PASS | 研究大纲+字段设计 | L3 | 任务 ld-01, ld-02 | web search agent 增强效果明显 |
| paper-reading-kb | PASS | 知识库+报告输出 | L3 | 任务 prk-01, prk-02 | token 消耗较大但 JSON 覆盖完整 |
证据亮点
| 亮点 | 等级 | 来源任务 |
|---|---|---|
| 化学领域全面覆盖 | author-ready | ld-01 |
| 人在回路可控扩展 | draft-only,需人工确认 | ld-02 |
| 并行深度生成结构化 JSON | author-ready | prk-01 |
| 跨学科 GWAS 统计分析 | author-ready | prk-01 |
| 多模块报告生成 | draft-ready | prk-02 |
| 字段不确定性追踪 | draft-ready | prk-02 |
设计审查
- 工作流分阶段清晰:研究大纲 → web search 补充 → 字段检查 → 深度研究 → 报告生成
- 子命令分工明确:outline/fields/JSON 阶段与 outline/fields/JSON/report 阶段解耦
- 辅助 Python 脚本设计合理(
validate_json.py,generate_report.py) - API 表面整洁,以 web-researcher agent 配置为入口
- 平台锁定在支持 web search agent 的环境中
- 人在回路交互设计需要改进以减少手动确认步骤
改进建议
- 研究大纲生成可增加自动字段推测以减少人工配置
- 深度研究阶段可增加自动字段推测以减少人工配置
- 安装过程可简化为 git clone + 一键安装 + config 模版 + pip pyyaml
- 报告生成可增加 Word/PDF 输出格式支持
- 该 Skill 的设计平衡了功能深度与易用性:模块化命令、并行 agent 执行、结构化 JSON 输出、跨学科适应能力。对多学科研究团队尤为合适。平台依赖(multi_agent, request_user_input)是其 token 效率的来源,也是 Codex 环境下正确使用的必要条件。
- 修复后 2 个模块全部达到 L3 深度并可发布于公开目录。