外观
附录 E:Evaluation Checklists
评估不是在任务结束后补一个分数,而是在执行前声明成功条件、在执行中保存证据、在交付前处理冲突和未知。本附录把结果、过程、示例、图示与发布质量拆成可复用检查表。
评估模型见第 17 章,分层测试与基准见第 39 章,内容生产的完成定义见第 43 章。项目审查门槛以 Review Checklist 为准;本附录只是面向读者的执行视图,不替代项目规则或状态文件。
使用顺序
- 执行前填写 Evaluation Spec,冻结输入版本和非范围。
- 把每项成功标准映射到可观察证据和判定者。
- 执行后分别检查结果、过程、安全与资源,不用平均分抵消硬失败。
- 对示例和图示做工件级验证,再做章节级和发布级审查。
- 只报告证据支持的结论;证据冲突、陈旧或缺失时,使用
unknown、not_comparable或needs_evidence。
E1:Evaluation Spec
markdown
# Evaluation Spec:<任务或交付物>
- 评估对象及版本:
- 输入、数据和环境版本:
- 适用范围:
- 非范围:
- 成功标准:
- 必须保存的证据:
- 判定规则与硬门槛:
- 允许的判定者:
- 失败出口:
- 责任者和复核者:开始执行前检查:
- [ ] 目标描述的是可观察结果,不是“尽量优化”或“看起来更好”。
- [ ] 每项成功标准都有证据、范围、时效和判定方法。
- [ ] 硬门槛与可权衡指标已分开;安全、权限和数据边界不能被平均分抵消。
- [ ] 已声明失败、部分完成、不适用和不可比较如何记录。
- [ ] 模型评分、自我报告或代理指标没有被当作唯一事实来源。
E2:证据矩阵
为每个标准填写一行;不要用一条泛化的“测试通过”覆盖多个不同结论。
| 标准 | 证据工件 | 判定者 | 输入/环境版本 | 新鲜度 | 状态 | 限定结论 |
|---|---|---|---|---|---|---|
<可观察标准> | <日志、状态、测试或人工记录> | <确定性/状态观察/人工/模型> | <版本> | <日期或失效条件> | pass / fail / unknown / not_applicable | <证据实际支持的范围> |
证据检查:
- [ ] 证据来自真实边界:文件内容、命令退出状态、外部状态、浏览器交互或具名人工决定;人工决定只证明决定发生及其适用范围,不证明外部结果或事实正确。
- [ ] 运行记录包含命令、时间、输入和退出状态,而不只有结论摘要。
- [ ] 状态观察验证了最终状态,而不只验证某个函数被调用。
- [ ] 多个证据冲突时已保存冲突,没有挑选对结论有利的一项。
- [ ] 动态系统、依赖和页面的证据仍在有效时间窗内。
E3:结果质量
- [ ] 交付物存在于约定位置,名称、格式和版本正确。
- [ ] 核心用户任务可以从入口完成到终态,而不只是局部步骤成功。
- [ ] 正常路径、关键失败路径和恢复路径都有可观察结果。
- [ ] 输出内容与权威来源、外部状态或独立计算一致。
- [ ] 未完成、阻塞和非范围没有被包装为成功。
- [ ] 结论明确区分“未发现问题”“通过已定义检查”和“已批准发布”。
结果报告至少回答:检查了什么、用什么输入、观察到什么、能得出什么、不能得出什么。
E4:过程质量
- [ ] 输入、约束、计划和工具版本在执行前已冻结或记录。
- [ ] 每个阶段有进入条件、输出工件、接受条件和失败出口。
- [ ] 自动化重试、恢复和回滚动作可追踪,未用重跑掩盖首次失败。
- [ ] 并行工作有独立所有权;共享文件和发布状态只有一个集成者。
- [ ] 审查角色使用稳定输入,输入变化后旧审查被标为陈旧并重新执行。
- [ ] 实际偏差、人工决定和未运行步骤已记录。
E5:示例质量
示例用于证明读者能复现一个受限结论,不用于模拟不存在的成功。
- [ ] 说明前置环境、输入文件、权限和依赖版本。
- [ ] 命令可复制;占位符、示例值和必须替换的值有明确标记。
- [ ] 预期结果与本次实际结果分开书写。
- [ ] 已实际运行的命令记录退出状态;未运行时明确写
not_run及原因。 - [ ] 失败示例展示可诊断信息和安全退出,而不泄露密钥、个人数据或内部地址。
- [ ] 示例没有依赖未说明的本机状态、缓存或登录会话。
- [ ] 测试断言面向可观察行为,且预期值不由被测实现自行推导。
markdown
## 示例验证记录
- 示例路径:
- 环境/依赖版本:
- 输入及前置状态:
- 执行命令:
- 退出状态:
- 实际输出摘要:
- 证明的结论:
- 未覆盖范围:E6:图示质量
- [ ] 图只回答一个明确问题,正文在图前说明读图目的。
- [ ] Mermaid 源码保存在
diagrams/mermaid/,正文代码块与源文件一致。 - [ ] 节点名称、状态和箭头语义与正文及术语表一致。
- [ ] 已执行语法渲染,并检查真实导出图,而不只检查源码。
- [ ] 图在目标阅读尺寸下无裁切、重叠、过小文字或歧义连线。
- [ ] 正文提供读图说明和可访问替代文本。
- [ ] 第三方图形、图标、截图和数据的许可与归属已核对。
具体语法、命名和审查流程见附录 G。
E7:章节与发布质量
章节级检查:
- [ ] 章节目标、场景、概念、示例、图示、风险和小结指向同一读者问题。
- [ ] 本章新增事实有直接证据;与其他章节重复的内容已改为引用或补充边界。
- [ ] 专用审查、事实核验、语言编辑和最终审查均基于当前版本。
- [ ] Markdown、内部链接、示例测试、图示渲染和仓库规定校验均有新鲜记录。
- [ ] 章节状态、进度和下一任务与实际工件一致。
发布级检查:
- [ ] 所有章节完成定义均满足,硬门槛没有被整体完成率掩盖。
- [ ] 全书目录、术语、交叉引用、全局参考文献和图示资产已由唯一集成者核对。
- [ ] 构建产物可从已记录的源码、依赖和命令重现。
- [ ] Publication Candidate Manifest 固定了源码版本、工具链、资产、检查结果和例外。
- [ ] 版权、隐私、安全、发布范围和最终责任者已明确。
- [ ] “可集成”“已集成”“可发布”和“已批准发布”没有混用。
E8:最终判定记录
markdown
# Evaluation Verdict
- 评估对象及版本:
- 通过的成功标准:
- 失败的硬门槛:
- 未知、冲突或陈旧证据:
- 不适用/不可比较项及理由:
- 当前限定结论:
- 禁止外推为:
- 下一责任者和唯一下一步:
- 复核者及日期:只有全部硬门槛通过、关键证据新鲜且责任者完成相应决定时,才把当前对象推进到下一状态。评分、文件存在或单次成功都不能单独替代这一判定。
