审计报告:scientific-agent-skills
总体判定
- 判定:PASS
- 证据层级:L3
- 核心 L3 已完成:是(全部 4 个模块)
- 网站推荐:推荐作为综合性科研 Agent Skill 库。单个 Skill 质量存在差异 — 使用前建议抽查。
- 理由:全部 4 个测试模块在化学、医学、物理和生物学领域均通过 L3 级别测试。Skill 库覆盖面广(147 个 Skill)是差异化优势。主要风险是外部依赖和单个 Skill 质量参差不齐。
证据来源
- 证据任务:evidence/tasks.yaml
- 证据评分卡:evidence/scorecard.md
- 证据索引:evidence/evidence-index.md
- 用例运行日志:run-log.md
- 原始输出:outputs/
通用关卡
| 关卡 | 结果 | 证据 |
|---|---|---|
| 公开来源 | PASS | GitHub: K-Dense-AI/scientific-agent-skills v2.50.0 |
| 版本固定 | PASS | v2.50.0,来自 README |
| 安装路径清晰 | WARN | 147 个 Skill,依赖各异 |
| 权限透明 | PASS | 每个 Skill 的 SKILL.md 声明权限 |
| 真实科研任务 | PASS | 8 个 L3 任务,覆盖 4 个模块 |
| 非纯营销外壳 | PASS | 147 个具体 Skill,均有 SKILL.md 文件 |
模块判定
| 模块 | 判定 | 核心声明 | 最高深度 | 证据 | 风险 |
|---|---|---|---|---|---|
| literature-discovery | PASS | 结构化搜索 + PRISMA | L3 | 任务 01-02 | BGPT MCP 依赖;需要 parallel-cli |
| paper-summary | PASS | 忠实多学科摘要 | L3 | 任务 01-02 | GWAS 因果语言风险(已缓解) |
| data-analysis | PASS | ANOVA + APA 报告 | L3 | 任务 01-02 | 小样本量提示(n=3) |
| figure | PASS | 发表级图表 | L3 | 任务 01-02 | 需要安装 matplotlib/seaborn |
输出质量
| 输出 | 质量标签 | 证据 |
|---|---|---|
| 化学文献搜索 | author-ready | task-01 |
| 医学 PRISMA 综述 | author-ready | task-02 |
| 物理方法摘要 | draft-only | task-03 |
| GWAS 摘要 | draft-only(含因果风险) | task-04 |
| ANOVA 结果 | author-ready | task-05 |
| EDA 报告 | author-ready | task-06 |
| 单面板图表 | publication-ready | task-07 |
| 多面板图表 | publication-ready | task-08 |
安全说明
- 网络:文献搜索 Skill 需要
- 本地文件:读取 CSV,写入图表/报告
- 脚本:用于分析和可视化的 Python 脚本
- API 密钥:部分 Skill(bgpt-paper-search, literature-review)可能需要密钥
- 外部服务:BGPT MCP 服务器, parallel-cli
- 数据暴露:无 — 使用合成数据和公开 DOI
网站收录说明
- 最适合:需要跨文献、分析和可视化的综合性科研工具的科研人员
- 不适合:极简用户、纯离线工作流、需要单一用途工具的用户
- 安装难度:中高(147 个 Skill,Python/uv 生态)
- 安全级别:中等(部分 Skill 需要网络 + 外部服务)
- 审核者备注:Skill 库覆盖面令人印象深刻;已测试模块表现良好;主要关注点是 147 个 Skill 意味着质量参差不齐 — 建议对特定 Skill 进行抽查。GWAS 因果语言处理和 APA 报告方面表现突出。
- 推荐边界:4 个模块的 L3 证据支持推荐。请注意单个 Skill 的质量差异。