运行前定门槛
把必须满足的结果写成互不重叠的检查项。不要看到输出后再挑对它有利的标准。
Agent Skill 测试失败后,先冻结原任务和成功门槛,再定位最小指令缺口。修复后仍用完全相同的任务复测,并让初次失败与新结果并列存在。
修复前至少冻结逐字任务、成功门槛、运行环境和初次输出。只有这样,后续变化才有可比较的基线。
把必须满足的结果写成互不重叠的检查项。不要看到输出后再挑对它有利的标准。
CLI 未发现、文件未安装、客户端未读取、任务没完成、账户阻断,是五种不同问题。
优先修改真正导致漏项、越界或格式漂移的 Skill 说明,不为单条测试硬编码答案。
任务文字、成功门槛和权限边界保持不变;记录新的 Skill 版本与执行环境。
初次失败是修复价值的来源,不应被新结果覆盖或从统计口径中消失。
一次 4/4 只说明这条任务在记录环境中达到门槛,不等于准确率或跨客户端认证。
两项任务和四条成功门槛都在运行前公开。修复后的复测没有换题,也没有放宽验收。
每一步都写可核验事实,不用“效果更好了”代替具体证据。
原始任务:<逐字保存,不在复测时改写> 预注册门槛:1. ... 2. ... 3. ... 4. ... 初次环境:客户端 / 版本 / 模型 / Skill commit / 权限 初次结果:通过 X / 4;未满足第 N 项 失败层级:发现 / 安装 / 自动读取 / 任务完成 / 环境阻断 根因判断:<观察到的指令缺口;与推测分开> 最小修复:<修改了哪条通用规则,为什么不是测试特例> 复测任务:与原始任务逐字相同 复测结果:通过 Y / 4;输出长度或关键证据 边界:只适用于本次记录,不外推为准确率或普遍兼容
修复是否可信,往往取决于有没有抵抗“让数字更好看”的诱惑。
原任务要求 300 字,复测改成 500 字,只能建立新案例,不能关闭原失败。
输出漏掉授权检查,就把授权从验收里删掉,会破坏预注册证据。
只留下 4/4 会丢失改动动机,也无法判断修复是否针对真实缺口。
模型尚未进入任务就遇到账户、网络或平台限制,应单列环境状态。
证据边界:这里的两条复测只证明所记录任务在所记录 Codex 环境与 Skill 版本中满足 4/4 门槛;它们不是跨客户端保证、安全认证或总体准确率。完整方法见兼容性四层测试方法,全部当前结果见前瞻复测页。
可以复制任务和门槛,也欢迎提交失败;请先移除 Token、邮箱、私人路径和业务数据。