评测标准

评测标准:PASS / WARN / FAIL

本目录每个条目经过 AI 初筛、实测和人工科研复核。评测结论必须以具体任务、测试数据和行为证据为支撑。

评测结论

PASS

真实任务可用,安装和安全风险可接受。

  • 跨领域可用:不限定特定学科或研究方向,任何科研方向的用户都能使用并复现结果。
  • 可复现:相同输入在不同环境中产生可验证的一致输出。
  • 模型无关:不依赖特定模型的多模态能力;纯文本模型即可完成核心任务(若需要多模态则必须在边界中明确标注,并降级为 WARN)。
  • 安装透明:安装步骤清晰、无需付费服务、无隐性收费陷阱。

WARN

有价值,但存在边界、门槛或风险提示。

  • 领域特定:仅适用于特定研究方向(如 ML、计算化学),非该领域用户无法使用。
  • 模型依赖:核心功能依赖多模态模型,纯文本模型无法完成或有明显质量下降。
  • 有明显缺陷但可补救:单独使用效果不稳定,但配合其他插件/工具可满足科研需求。
  • 权限或依赖门槛:需要较高配置成本、依赖特定版本或网络环境。

FAIL

不可复现、误导、风险不透明或不适合严肃科研使用。

  • 宣称的能力无法在实际科研任务中完成。
  • 故意隐瞒安全风险、联网需求或付费模式。
  • 纯付费版清洗或销售导向,不适合严肃科研使用。

安装难度量化标准

一键安装,无需额外配置

  • 通过平台内置的 skill-installer 一键安装,或单条命令完成。
  • 不需要申请和配置第三方 API key。
  • 不需要安装额外运行时依赖(Python 包、Node 包等)。
  • 安装后无需联网即可使用核心功能。
  • 示例:纯文本润色 skill,安装后离线可用。

需要 git clone 或配置 API key 或安装依赖

  • 需要 git clone 仓库并手动复制文件到 skills 目录。
  • 或需要注册并配置第三方 API key(如 LLM 提供商)。
  • 或需要安装额外运行时依赖(pip install / npm install)。
  • 示例:需要 GitHub API token 的文献检索 skill。

需要多项配置或硬件要求

  • 需要同时满足 API key + 外部依赖 + 环境变量配置。
  • 或需要 GPU 等特定硬件。
  • 或依赖付费服务(API 按量计费、订阅制等)。
  • 示例:需要 GPU 集群和多个 API key 的自动实验 skill。

Lab 实测体系

每个 Skill 在收录前必须经过 Lab 实测。实测由两个独立维度描述:

任务深度(L0-L4)

描述单个测试任务的复杂度和验证严格程度:

  • L0 静态准入:检查来源、版本、安装、权限和依赖,不执行任何任务。
  • L1 烟测:执行最简单的操作,确认能运行并产生结构化输出。
  • L2 标准任务:完成中等规模科研子任务,验证基本功能和输出结构。
  • L3 深度任务:完成长、多步骤、可审计的真实科研任务,验证核心卖点。推荐结论必须至少有一条核心卖点的 L3 证据。
  • L4 压力测试:边界情况和极端输入,仅用于少数强候选。

学科方向

每个 Skill 的测试必须覆盖四大基础学科方向(医学、物理、化学、生物),写作类任务还需覆盖中英文两种语言。每个学科方向使用该领域的真实文献或数据作为测试输入。

任务通过率

每个任务独立评判通过/警告/失败,最终汇总为任务通过率(如 4/4 任务通过)。任务数量取决于 Skill 覆盖的能力模块和学科范围,不固定。

审核流程

  1. 候选入库:创建测试环境,记录 Skill 来源、版本和安装方式。
  2. 任务测试:按学科方向和任务深度执行真实科研任务,保存输入、输出和执行日志。
  3. 证据评分:对每个任务的每个维度独立评分(PASS/WARN/FAIL),汇总任务通过率。
  4. 审计报告:基于证据生成详细审计报告,不得超出证据范围给出结论。
  5. 推荐结论:综合任务通过率、测试深度和学科覆盖,给出最终推荐等级。

每个环节的证据均可在详情页的 Lab 实测摘要中查看,包括详细报告、运行日志和测试输出。

版本计划

  1. 当前版本:AI 实测 + 人工复核,28 个 Skill 已完成 Lab 测试。
  2. 下一步:增加更多学科覆盖和 L4 压力测试场景。
  3. 长期目标:建立持续回归测试机制,Skill 更新时自动触发重测。