CLI 能发现
安装器能否识别目录、frontmatter 和 Skill 名称。
npx skills@1.5.22 add . --list一份 Skill 能被命令行找到,不代表客户端会在自然任务中自动选择它;选对了,也可能因为读取范围、输出规模或边界判断而没有完成。
每前进一步都需要新的证据。只跑过安装命令,最多只能支持前两层。
安装器能否识别目录、frontmatter 和 Skill 名称。
npx skills@1.5.22 add . --list记录真实路径、符号链接与文件是否一致,不能只看“success”。
shasum SKILL.md
shasum ~/.agents/skills/.../SKILL.md任务中不点名 Skill,观察是否主动读取目标说明。客户端与版本必须保留。
未点名名称的自然任务检查输出是否覆盖验收点、守住边界,并在约束内完成。
完成 / 部分 / 失败 / 待输入最好在运行前公开提示与成功门槛,避免看完结果后修改标准。
客户端与版本: Skill: 逐字任务: 是否点名 Skill:否 是否主动读取: 最终状态:完成 / 部分 / 失败 / 待输入 命中验收点: 未命中或越界: 环境错误: 不能外推:
“让它做一次中文排版审查”只是摘要,无法精确重放。标点、范围、是否允许修改文件都会改变结果。若历史只剩摘要,应明确标成 summary-only,不要根据输出反推一条看似合理的“原始提示”。
退出码非零不自动等于 Skill 失败。先问模型是否真正进入执行,以及错误发生在哪一层。
| 现象 | 应记录为 | 能否归因给 Skill |
|---|---|---|
| 安装器找不到目录或 frontmatter | 发现失败 | 通常可以,需保留命令与错误 |
| 文件落盘,但任务没有读取目标 Skill | 自动触发失败 | 可能相关,也要记录已安装 Skill 集合与上下文预算 |
| 读对 Skill,但大任务超时或没有最终交付 | 任务完成失败 | 可以作为相关反例;缩小复测不能抹掉原失败 |
| 账户用量达到上限,模型没有开始输出 | 平台或账户阻断 | 不能记成 Skill 失败 |
| 任务按设计先问必要信息 | 待用户输入 | 不应机械算失败或完成计划 |
一个是已经发生过的观察,一个是下一轮准备怎样测。
planned下面都来自本仓库当前记录,用来说明状态分类,不代表跨客户端普遍表现。
自动触发并完成校准,但完整两周计划与学习效果尚未验证。
看逐字任务 →大任务失败被保留;限制为 300 字时间表后复测通过,不能倒推完整教案已经通过。
看失败与缩小复测 →模型未进入执行时,只能记录为账户或平台阻断,不更新 Skill 的兼容性结果。
看待测任务与门槛 →Issue 表单适合直接填写;PR 可以提交 JSON。两种入口使用同一组状态,不把环境阻断写成任务失败。
python3 scripts/check_compatibility_report.py \ compatibility-reports/<id>.json
校验器检查数据结构、本仓库 Skill 名称、阻断状态矛盾和常见敏感信息。它不是完整的通用 JSON Schema 引擎,也不能代替提交者人工脱敏。
不可以。安装只证明文件处理到了某一步。至少还要在对应客户端中,用未点名 Skill 的任务验证自动读取,并单独判断最终任务是否完成。
不能。单任务结果没有随机样本、重复次数和置信区间,只能写“在该客户端版本和该任务下观察到”。
不应删除。原失败说明任务规模或读取范围存在边界;缩小复测回答的是另一个、更窄的问题,两条证据都应保留。
点名只能验证客户端愿意按明确指令读取,不能验证自然任务中的自动选择。若测试目的只是执行质量,可以点名,但必须把“点名”单独记录。
附客户端版本、逐字任务与脱敏输出。安装成功、自动触发和任务完成分别填写。