← 中文 AI Skills 库TEST METHOD · EVIDENCE BEFORE CLAIMS
Agent Skills · Codex · Claude Code · Cursor

安装成功,
只是测试的第一公里。

一份 Skill 能被命令行找到,不代表客户端会在自然任务中自动选择它;选对了,也可能因为读取范围、输出规模或边界判断而没有完成。

01 / LEVELS

先定义你说的“兼容”是哪一层

每前进一步都需要新的证据。只跑过安装命令,最多只能支持前两层。

L1 · DISCOVERY

CLI 能发现

安装器能否识别目录、frontmatter 和 Skill 名称。

npx skills@1.5.22 add . --list
L2 · INSTALL

文件实际落盘

记录真实路径、符号链接与文件是否一致,不能只看“success”。

shasum SKILL.md
shasum ~/.agents/skills/.../SKILL.md
L3 · ACTIVATE

客户端自动选择

任务中不点名 Skill,观察是否主动读取目标说明。客户端与版本必须保留。

未点名名称的自然任务
L4 · DELIVER

最终任务完成

检查输出是否覆盖验收点、守住边界,并在约束内完成。

完成 / 部分 / 失败 / 待输入
02 / PROTOCOL

一条任务,怎样测得可重放

最好在运行前公开提示与成功门槛,避免看完结果后修改标准。

执行前

  1. 确定只测一个 Skill 与一个最小场景。
  2. 任务中不写 Skill 名称。
  3. 写下 3—5 个可观察验收点。
  4. 声明是否允许写文件、联网、运行命令。
  5. 记录客户端名称、完整版本与安装集合。

最小记录模板

客户端与版本:
Skill:
逐字任务:
是否点名 Skill:否
是否主动读取:
最终状态:完成 / 部分 / 失败 / 待输入
命中验收点:
未命中或越界:
环境错误:
不能外推:
03 / FAILURE

失败先分类,再决定归因

退出码非零不自动等于 Skill 失败。先问模型是否真正进入执行,以及错误发生在哪一层。

现象应记录为能否归因给 Skill
安装器找不到目录或 frontmatter发现失败通常可以,需保留命令与错误
文件落盘,但任务没有读取目标 Skill自动触发失败可能相关,也要记录已安装 Skill 集合与上下文预算
读对 Skill,但大任务超时或没有最终交付任务完成失败可以作为相关反例;缩小复测不能抹掉原失败
账户用量达到上限,模型没有开始输出平台或账户阻断不能记成 Skill 失败
任务按设计先问必要信息待用户输入不应机械算失败或完成计划
04 / EVIDENCE

结果证据与前瞻任务,不要混在一起

一个是已经发生过的观察,一个是下一轮准备怎样测。

历史结果

  • 保留实际客户端版本和执行日期
  • 逐字任务与摘要分级
  • 成功、失败、待输入均公开
  • 环境错误与 Skill 行为分开
  • 不能外推为准确率或官方认证
查看当前兼容性矩阵 →

前瞻队列

  • 任务和成功门槛在运行前公开
  • 状态统一写 planned
  • 任何客户端都可提交结果
  • 未运行前绝不显示“通过”
  • 失败也进入后续案例
参与 6 个待复测任务 →
05 / CASES

三种最有信息量的真实结果

下面都来自本仓库当前记录,用来说明状态分类,不代表跨客户端普遍表现。

WAITING INPUT

学习教练先校准

自动触发并完成校准,但完整两周计划与学习效果尚未验证。

看逐字任务 →
BOUNDED RETEST

完整教案未完成

大任务失败被保留;限制为 300 字时间表后复测通过,不能倒推完整教案已经通过。

看失败与缩小复测 →
ENVIRONMENT BLOCK

用量上限不是 Skill 失败

模型未进入执行时,只能记录为账户或平台阻断,不更新 Skill 的兼容性结果。

看待测任务与门槛 →
06 / MACHINE

让下一份结果能被机器检查

Issue 表单适合直接填写;PR 可以提交 JSON。两种入口使用同一组状态,不把环境阻断写成任务失败。

公开数据契约

  1. 复制基于真实复测的示例,不从“理想结果”编数据。
  2. 保留客户端版本、逐字任务和是否点名 Skill。
  3. 分别填写环境、自动触发与最终完成状态。
  4. 至少写一条不能外推的证据边界。
  5. 人工删除 Token、邮箱、私人路径和业务数据。

查看 JSON Schema · 查看已验证示例

无依赖本地校验

python3 scripts/check_compatibility_report.py \
  compatibility-reports/<id>.json

校验器检查数据结构、本仓库 Skill 名称、阻断状态矛盾和常见敏感信息。它不是完整的通用 JSON Schema 引擎,也不能代替提交者人工脱敏。

阅读贡献说明 →

07 / FAQ

常见误判

安装成功就可以写“支持 Codex / Claude Code / Cursor”吗?

不可以。安装只证明文件处理到了某一步。至少还要在对应客户端中,用未点名 Skill 的任务验证自动读取,并单独判断最终任务是否完成。

一次任务通过可以写准确率吗?

不能。单任务结果没有随机样本、重复次数和置信区间,只能写“在该客户端版本和该任务下观察到”。

缩小复测通过后,可以删除原失败吗?

不应删除。原失败说明任务规模或读取范围存在边界;缩小复测回答的是另一个、更窄的问题,两条证据都应保留。

为什么任务里不能点名 Skill?

点名只能验证客户端愿意按明确指令读取,不能验证自然任务中的自动选择。若测试目的只是执行质量,可以点名,但必须把“点名”单独记录。

复现一个,或者提交一个反例。

附客户端版本、逐字任务与脱敏输出。安装成功、自动触发和任务完成分别填写。

本地生成报告 →