Skip to content

附录 F:Reflection Checklists

复盘的目标不是为失败生成一个流畅解释,而是把可观察轨迹转成可证伪的候选改进,并在准入前验证其范围、冲突和副作用。本附录覆盖复盘、根因分析、经验准入和改进评估。

反思与经验边界见第 16 章,评估方法见第 17 章,回归与基准边界见第 39 章

使用边界

复盘流程或辅助工具可以整理候选证据、提出假设和建议验证,但其输出本身不能证明根因,也不能自行扩大权限、修改共享规则、改变工具策略或批准跨项目经验。涉及安全、不可逆动作、跨项目范围或责任冲突时,必须交给具名责任者。

F1:复盘启动清单

  • [ ] 已冻结原始输入、版本、轨迹、外部状态和错误,不用后续重跑覆盖首次证据。
  • [ ] 触发原因是具体偏差、失败、异常成功或重复成本,而不是“例行总结”本身。
  • [ ] 已明确复盘问题和非范围。
  • [ ] 日志经过数据最小化,不包含密钥、完整用户输入或无关个人数据。
  • [ ] 当前证据足以描述症状;不足时先标记 unknown,不急于解释。

F2:Reflection Record

markdown
# Reflection Record:<任务或事件>

- traceId / 工件版本:
- 观察证据:
- 可观察症状:
- 影响范围:
- 根因假设:
- 可推翻该假设的观察:
- 最小验证:
- 反事实:
- 候选改变及适用范围:
- 明确禁止扩大到:
- 实际验证状态:not_run / passed / failed / inconclusive
- 冲突、权限和安全审查:
- 当前决定:reject / candidate_for_validation / eligible_for_review
- 责任者和下一步:

F3:症状、根因与经验分离

层次要回答的问题合格写法常见错误
症状实际观察到了什么?可定位的状态、输出或偏差“系统理解错了”
根因假设哪个机制可能产生症状?具体且可证伪的因果机制把错误消息复述为原因
候选经验下一次最小改变是什么?有范围、触发条件和失效条件从一次事件推出全局规则
准入经验哪项改变已通过审查?有证据、责任者、回滚和版本测试一次即自动写入共享记忆

任一层无法回答时保留空缺或 unknown,不要用更抽象的措辞填满表格。

F4:根因分析清单

  1. 缩小到每个保留元素都影响失败的最小复现。
  2. 在边界处观察输入、决策、动作和外部状态,找出第一个偏离点。
  3. 列出两到三个具体假设,并为每个假设写预测和反证。
  4. 一次只改变一个变量,先检验最可能且验证成本最低的假设。
  5. 用反事实检查:若候选机制不存在,是否仍会出现同一症状?
  6. 区分直接触发、促成条件和系统性缺口,不把它们压成单一标签。
markdown
| 排名 | 假设机制 | 若为真应观察到 | 可推翻证据 | 最小检查 | 结果 |
| --- | --- | --- | --- | --- | --- |
| 1 | <具体机制> | <预测> | <反证> | <一次检查> | <结果> |

根因结论检查:

  • [ ] 有正向证据和反证检查,不是仅凭时间先后。
  • [ ] 能解释最小复现中的全部必要元素。
  • [ ] 没有把重试后成功等同于原假设成立。
  • [ ] 多因素共同作用时保留组合关系,没有强行选唯一原因。
  • [ ] 两次修复假设失败后重新审视模型;连续失败不靠继续打补丁解决。

F5:候选经验准入

候选改变通过验证,只表示它可以进入审查,不表示可以自动写入长期记忆、规则、Skill 或权限配置。

accepted 只表示具名责任者在声明范围内完成了独立准入决定;在该决定及权威位置写入完成前,自动化流程的最高状态仍是 eligible_for_review

  • [ ] 适用任务、项目、版本、环境和触发条件明确。
  • [ ] 有重复证据或足以支持当前窄范围的强证据。
  • [ ] 已主动搜索反例、失败样本和相邻任务中的不同条件。
  • [ ] 不与更高优先级指令、既有决定、Skill、权限或人工决定冲突。
  • [ ] 改变可逆,并有版本、失效条件、回滚方法和责任者。
  • [ ] 写入位置是该事实的权威位置,不会制造多个漂移副本。
  • [ ] 跨项目、安全或不可逆改变已获得人工批准。
markdown
# Lesson Admission

- 候选经验:
- 适用范围与触发条件:
- 证据及新鲜度:
- 已检查的反例:
- 与现有规则/决定的关系:
- 预期收益与可能副作用:
- 回滚和失效条件:
- 试点范围:
- 决定:reject / pilot / eligible_for_review / accepted
- 决定者和日期:

F6:改进评估

对候选改变先做有界试点,再决定是否扩大范围。

  • [ ] 基线与候选使用同一任务集、数据、环境、工具和评分规则;不同则标记 not_comparable
  • [ ] Evaluation Spec 在试点前冻结,未因结果不理想而改写成功标准。
  • [ ] 同时评估目标结果、过程合规、安全边界和资源成本。
  • [ ] 保存逐次试验记录,不只保存平均分。
  • [ ] 回归矩阵覆盖候选改变可能影响的相邻行为和硬门槛。
  • [ ] 模型评分经过校准,自我报告只作为诊断信号。
  • [ ] 线上观察只产生候选反馈,不直接改写规则或训练集。
markdown
## Improvement Evaluation

- 候选改变及版本:
- 基线及版本:
- 试点范围:
- Evaluation Spec:
- 目标结果:
- 回归与安全结果:
- 资源变化:
- 冲突/未知/不可比较项:
- 结论及限定范围:
- 扩大、回滚或补证条件:

F7:复盘质量终检

  • [ ] 事实、推论、假设和决定在记录中可区分。
  • [ ] 复盘解释能够被未来证据推翻。
  • [ ] “不知道”没有被改写为听起来完整的根因。
  • [ ] 瞬时故障、一次成功和局部偏好没有升级为永久全局规则。
  • [ ] 改进验证没有复用产生候选经验的同一套自我解释作为独立证据。
  • [ ] 被拒绝、被替代和过期经验保留原因及替代记录,而非静默删除。
  • [ ] 当前状态、责任者和唯一下一步明确。

高质量复盘的产物不是更多规则,而是更少、更窄、可验证、可撤销的改变。

从同一套 Markdown 书稿生成。