Skip to content

附录 E:Evaluation Checklists

评估不是在任务结束后补一个分数,而是在执行前声明成功条件、在执行中保存证据、在交付前处理冲突和未知。本附录把结果、过程、示例、图示与发布质量拆成可复用检查表。

评估模型见第 17 章,分层测试与基准见第 39 章,内容生产的完成定义见第 43 章。项目审查门槛以 Review Checklist 为准;本附录只是面向读者的执行视图,不替代项目规则或状态文件。

使用顺序

  1. 执行前填写 Evaluation Spec,冻结输入版本和非范围。
  2. 把每项成功标准映射到可观察证据和判定者。
  3. 执行后分别检查结果、过程、安全与资源,不用平均分抵消硬失败。
  4. 对示例和图示做工件级验证,再做章节级和发布级审查。
  5. 只报告证据支持的结论;证据冲突、陈旧或缺失时,使用 unknownnot_comparableneeds_evidence

E1:Evaluation Spec

markdown
# Evaluation Spec:<任务或交付物>

- 评估对象及版本:
- 输入、数据和环境版本:
- 适用范围:
- 非范围:
- 成功标准:
- 必须保存的证据:
- 判定规则与硬门槛:
- 允许的判定者:
- 失败出口:
- 责任者和复核者:

开始执行前检查:

  • [ ] 目标描述的是可观察结果,不是“尽量优化”或“看起来更好”。
  • [ ] 每项成功标准都有证据、范围、时效和判定方法。
  • [ ] 硬门槛与可权衡指标已分开;安全、权限和数据边界不能被平均分抵消。
  • [ ] 已声明失败、部分完成、不适用和不可比较如何记录。
  • [ ] 模型评分、自我报告或代理指标没有被当作唯一事实来源。

E2:证据矩阵

为每个标准填写一行;不要用一条泛化的“测试通过”覆盖多个不同结论。

标准证据工件判定者输入/环境版本新鲜度状态限定结论
<可观察标准><日志、状态、测试或人工记录><确定性/状态观察/人工/模型><版本><日期或失效条件>pass / fail / unknown / not_applicable<证据实际支持的范围>

证据检查:

  • [ ] 证据来自真实边界:文件内容、命令退出状态、外部状态、浏览器交互或具名人工决定;人工决定只证明决定发生及其适用范围,不证明外部结果或事实正确。
  • [ ] 运行记录包含命令、时间、输入和退出状态,而不只有结论摘要。
  • [ ] 状态观察验证了最终状态,而不只验证某个函数被调用。
  • [ ] 多个证据冲突时已保存冲突,没有挑选对结论有利的一项。
  • [ ] 动态系统、依赖和页面的证据仍在有效时间窗内。

E3:结果质量

  • [ ] 交付物存在于约定位置,名称、格式和版本正确。
  • [ ] 核心用户任务可以从入口完成到终态,而不只是局部步骤成功。
  • [ ] 正常路径、关键失败路径和恢复路径都有可观察结果。
  • [ ] 输出内容与权威来源、外部状态或独立计算一致。
  • [ ] 未完成、阻塞和非范围没有被包装为成功。
  • [ ] 结论明确区分“未发现问题”“通过已定义检查”和“已批准发布”。

结果报告至少回答:检查了什么、用什么输入、观察到什么、能得出什么、不能得出什么。

E4:过程质量

  • [ ] 输入、约束、计划和工具版本在执行前已冻结或记录。
  • [ ] 每个阶段有进入条件、输出工件、接受条件和失败出口。
  • [ ] 自动化重试、恢复和回滚动作可追踪,未用重跑掩盖首次失败。
  • [ ] 并行工作有独立所有权;共享文件和发布状态只有一个集成者。
  • [ ] 审查角色使用稳定输入,输入变化后旧审查被标为陈旧并重新执行。
  • [ ] 实际偏差、人工决定和未运行步骤已记录。

E5:示例质量

示例用于证明读者能复现一个受限结论,不用于模拟不存在的成功。

  • [ ] 说明前置环境、输入文件、权限和依赖版本。
  • [ ] 命令可复制;占位符、示例值和必须替换的值有明确标记。
  • [ ] 预期结果与本次实际结果分开书写。
  • [ ] 已实际运行的命令记录退出状态;未运行时明确写 not_run 及原因。
  • [ ] 失败示例展示可诊断信息和安全退出,而不泄露密钥、个人数据或内部地址。
  • [ ] 示例没有依赖未说明的本机状态、缓存或登录会话。
  • [ ] 测试断言面向可观察行为,且预期值不由被测实现自行推导。
markdown
## 示例验证记录

- 示例路径:
- 环境/依赖版本:
- 输入及前置状态:
- 执行命令:
- 退出状态:
- 实际输出摘要:
- 证明的结论:
- 未覆盖范围:

E6:图示质量

  • [ ] 图只回答一个明确问题,正文在图前说明读图目的。
  • [ ] Mermaid 源码保存在 diagrams/mermaid/,正文代码块与源文件一致。
  • [ ] 节点名称、状态和箭头语义与正文及术语表一致。
  • [ ] 已执行语法渲染,并检查真实导出图,而不只检查源码。
  • [ ] 图在目标阅读尺寸下无裁切、重叠、过小文字或歧义连线。
  • [ ] 正文提供读图说明和可访问替代文本。
  • [ ] 第三方图形、图标、截图和数据的许可与归属已核对。

具体语法、命名和审查流程见附录 G

E7:章节与发布质量

章节级检查:

  • [ ] 章节目标、场景、概念、示例、图示、风险和小结指向同一读者问题。
  • [ ] 本章新增事实有直接证据;与其他章节重复的内容已改为引用或补充边界。
  • [ ] 专用审查、事实核验、语言编辑和最终审查均基于当前版本。
  • [ ] Markdown、内部链接、示例测试、图示渲染和仓库规定校验均有新鲜记录。
  • [ ] 章节状态、进度和下一任务与实际工件一致。

发布级检查:

  • [ ] 所有章节完成定义均满足,硬门槛没有被整体完成率掩盖。
  • [ ] 全书目录、术语、交叉引用、全局参考文献和图示资产已由唯一集成者核对。
  • [ ] 构建产物可从已记录的源码、依赖和命令重现。
  • [ ] Publication Candidate Manifest 固定了源码版本、工具链、资产、检查结果和例外。
  • [ ] 版权、隐私、安全、发布范围和最终责任者已明确。
  • [ ] “可集成”“已集成”“可发布”和“已批准发布”没有混用。

E8:最终判定记录

markdown
# Evaluation Verdict

- 评估对象及版本:
- 通过的成功标准:
- 失败的硬门槛:
- 未知、冲突或陈旧证据:
- 不适用/不可比较项及理由:
- 当前限定结论:
- 禁止外推为:
- 下一责任者和唯一下一步:
- 复核者及日期:

只有全部硬门槛通过、关键证据新鲜且责任者完成相应决定时,才把当前对象推进到下一状态。评分、文件存在或单次成功都不能单独替代这一判定。

从同一套 Markdown 书稿生成。