评测标准
评测标准:PASS / WARN / FAIL
本目录每个条目经过 AI 初筛、实测和人工科研复核。评测结论必须以具体任务、测试数据和行为证据为支撑。
评测结论
PASS
真实任务可用,安装和安全风险可接受。
- 跨领域可用:不限定特定学科或研究方向,任何科研方向的用户都能使用并复现结果。
- 可复现:相同输入在不同环境中产生可验证的一致输出。
- 模型无关:不依赖特定模型的多模态能力;纯文本模型即可完成核心任务(若需要多模态则必须在边界中明确标注,并降级为 WARN)。
- 安装透明:安装步骤清晰、无需付费服务、无隐性收费陷阱。
WARN
有价值,但存在边界、门槛或风险提示。
- 领域特定:仅适用于特定研究方向(如 ML、计算化学),非该领域用户无法使用。
- 模型依赖:核心功能依赖多模态模型,纯文本模型无法完成或有明显质量下降。
- 有明显缺陷但可补救:单独使用效果不稳定,但配合其他插件/工具可满足科研需求。
- 权限或依赖门槛:需要较高配置成本、依赖特定版本或网络环境。
FAIL
不可复现、误导、风险不透明或不适合严肃科研使用。
- 宣称的能力无法在实际科研任务中完成。
- 故意隐瞒安全风险、联网需求或付费模式。
- 纯付费版清洗或销售导向,不适合严肃科研使用。
安装难度量化标准
低
一键安装,无需额外配置
- 通过平台内置的 skill-installer 一键安装,或单条命令完成。
- 不需要申请和配置第三方 API key。
- 不需要安装额外运行时依赖(Python 包、Node 包等)。
- 安装后无需联网即可使用核心功能。
- 示例:纯文本润色 skill,安装后离线可用。
中
需要 git clone 或配置 API key 或安装依赖
- 需要 git clone 仓库并手动复制文件到 skills 目录。
- 或需要注册并配置第三方 API key(如 LLM 提供商)。
- 或需要安装额外运行时依赖(pip install / npm install)。
- 示例:需要 GitHub API token 的文献检索 skill。
高
需要多项配置或硬件要求
- 需要同时满足 API key + 外部依赖 + 环境变量配置。
- 或需要 GPU 等特定硬件。
- 或依赖付费服务(API 按量计费、订阅制等)。
- 示例:需要 GPU 集群和多个 API key 的自动实验 skill。
Lab 实测体系
每个 Skill 在收录前必须经过 Lab 实测。实测由两个独立维度描述:
任务深度(L0-L4)
描述单个测试任务的复杂度和验证严格程度:
- L0 静态准入:检查来源、版本、安装、权限和依赖,不执行任何任务。
- L1 烟测:执行最简单的操作,确认能运行并产生结构化输出。
- L2 标准任务:完成中等规模科研子任务,验证基本功能和输出结构。
- L3 深度任务:完成长、多步骤、可审计的真实科研任务,验证核心卖点。推荐结论必须至少有一条核心卖点的 L3 证据。
- L4 压力测试:边界情况和极端输入,仅用于少数强候选。
学科方向
每个 Skill 的测试必须覆盖四大基础学科方向(医学、物理、化学、生物),写作类任务还需覆盖中英文两种语言。每个学科方向使用该领域的真实文献或数据作为测试输入。
任务通过率
每个任务独立评判通过/警告/失败,最终汇总为任务通过率(如 4/4 任务通过)。任务数量取决于 Skill 覆盖的能力模块和学科范围,不固定。
审核流程
- 候选入库:创建测试环境,记录 Skill 来源、版本和安装方式。
- 任务测试:按学科方向和任务深度执行真实科研任务,保存输入、输出和执行日志。
- 证据评分:对每个任务的每个维度独立评分(PASS/WARN/FAIL),汇总任务通过率。
- 审计报告:基于证据生成详细审计报告,不得超出证据范围给出结论。
- 推荐结论:综合任务通过率、测试深度和学科覆盖,给出最终推荐等级。
每个环节的证据均可在详情页的 Lab 实测摘要中查看,包括详细报告、运行日志和测试输出。
版本计划
- 当前版本:AI 实测 + 人工复核,28 个 Skill 已完成 Lab 测试。
- 下一步:增加更多学科覆盖和 L4 压力测试场景。
- 长期目标:建立持续回归测试机制,Skill 更新时自动触发重测。