审计报告:ai-research-skills
总体判定
- 判定:PASS
- 证据级别:L3
- 核心 L3 完成:是(全部 3 个受测模块)
- 网站推荐:推荐作为综合性 AI 研究 skill 库。 个体 skill 质量存在差异;受测模块具有代表性。
- 理由:全部 3 个受测模块在物理、化学、生物领域均通过 L3。 该库的全面覆盖(98 个 skill,23 个类别)是差异化优势。 主要风险是个体 skill 质量参差。
证据来源
- 证据任务:evidence/tasks.yaml
- 证据评分卡:evidence/scorecard.md
- 证据索引:evidence/evidence-index.md
- Case 运行日志:run-log.md
- 原始输出:outputs/
通用门槛
| 门槛 | 结果 | 证据 |
|---|---|---|
| 公开源码 | PASS | GitHub: Orchestra-Research/AI-Research-SKILLs,MIT 许可 |
| 版本固定 | WARN | main 分支(git);npm v1.1.4 可用 |
| 安装路径明确 | PASS | npm install @orchestra-research/ai-research-skills |
| 权限透明 | PASS | 每个 skill 的 SKILL.md 声明网络/文件/脚本权限 |
| 真实研究任务 | PASS | 3 项 L3 任务,覆盖物理、化学、生物 |
| 非纯营销外壳 | PASS | 98 个具体 skill,均有 SKILL.md 及参考文件 |
模块判定
| 模块 | 判定 | 核心声明 | 最高深度 | 证据 | 风险 |
|---|---|---|---|---|---|
| computational-modeling | PASS | BPE 分词器训练 | L3 | task-01 | 需要 Python 3.10+ |
| research-writing | PASS | ML 论文 Methods 起草 | L3 | task-02 | LaTeX 模板需维护 |
| literature-discovery | PASS | 多方向研究构想 | L3 | task-03 | 需要领域专业知识评估 |
输出质量
| 输出 | 质量标签 | 证据 |
|---|---|---|
| BPE 分词器配置 + 分析 | 方法可靠 | task-01 |
| GNN Methods 章节草稿 | 作者可用结构 | task-02 |
| 研究构想(4 个方向) | 发表级质量 | task-03 |
安全说明
- 网络:受测模块不需要;部分 skill 可能需要网络访问
- 本地文件:读取测试论文样本;写入 outputs/
- 脚本:用于分词训练的 Python;标准科学计算栈
- API 密钥:受测模块不需要
- 外部服务:受测模块不需要
- 数据暴露:所有测试输入均为公开开放获取论文
网站收录说明
- 最适合:需要全面、生产级 skill 库的 AI/ML 研究人员
- 不适合:AI/ML 领域外用户;寻求单一轻量工具的用户
- 安装难度:中等(npm + Python 3.10+ 生态)
- 安全级别:中等(网络/文件访问因 skill 而异)
- 评审者注:98 个 skill 的覆盖面令人印象深刻。受测模块表现良好。 主要担忧是这么大库中个体 skill 质量参差。 建议在依赖未测试 skill 前进行抽样检查。
- 推荐边界:3 个模块具有 L3 证据支持推荐。 注意个体 skill 质量差异。
摘要约束
summary.md 不得声称比本审计报告更强的推荐结论。