外观
第 17 章 Research Brief:Evaluation 与可验证结果
要解决的读者问题
当 Agent 说“任务完成”时,读者如何判断它是在复述自己的输出,还是已经满足可复查的成功标准?本章把“评估”限定为:针对一个明确任务,事先写出成功标准,收集与标准关联的证据,再按可解释的规则给出接受、拒绝或补证结论。
这里不讨论第 15 章的观察点如何采集,也不讨论第 16 章怎样把失败整理为待验证候选并审查其准入,更不设计第 18 章的重试或恢复。第 17 章只消费它们提供的状态和证据,并把它们转成可审查的判定。
章节论点与边界
计划中的可归因陈述
| 陈述 | 候选来源 | 使用限制 |
|---|---|---|
| Agent 评估可由任务、试次、评分器、轨迹和结果状态组成;评估 Agent 时应考虑 Harness 与模型的组合。 | C17-REF-01 | 这是 Anthropic 工程文章的定义和经验,不能写成行业标准或其他产品行为。 |
| 基于代码、模型和人工的评分器有不同优势和限制;模型评分需要与人工判断校准。 | C17-REF-01 | 只用于说明取舍,不引用页面中的性能数字、客户案例或具体产品设置。 |
| NIST AI RMF 的 Measure 功能要求选择、应用和记录 AI 风险测量方法,并将有效性与可靠性作为需要评估的特征。 | C17-REF-02、C17-REF-03 | 这是自愿风险管理框架语境,不是 Agent 评估模板或合规结论。 |
| LLM-as-a-judge 研究报告位置、冗长和自我增强等偏差风险。 | C17-REF-04 | 只把它作为模型评判器需要独立校准的研究背景,不宣称任何评判器可靠或不可替代人类。 |
本书的工程扩展
下列结构均是本书的设计语言,不归因给任何来源:
- Evaluation Spec:把任务范围、成功标准、证据类型、评分规则、失败出口和不覆盖范围放进同一份可审查工件。
- 证据矩阵:把每项标准关联到一份证据、其采集方式、范围、状态、解释和刷新条件;教学示例只接受与任务
scope一致、满足注入freshness要求的记录。 - 质量门(Quality Gate):只根据明确规则输出
accepted、rejected、needs_evidence、needs_review或needs_spec,不把这些标签当作真实环境状态。 - 四层评估:结果、过程、安全边界与资源约束应分开评分;它们能共同影响接受结论,但不能相互替代。
已实际阅读的候选资料
2026-07-16 已读取以下原始页面或论文摘要页;完整 URL、允许用途和外推禁区见本章候选资料。
- Anthropic《Demystifying evals for AI agents》(2026-01-09):用于任务、试次、评分器、轨迹、结果、评分器类型和回归/能力评估的限定讨论。
- NIST AI RMF Core:用于 Measure 的测量、记录、有效性和可靠性语境;该在线资源显示 AI RMF 1.0 正在修订,后续改写需重新核验。
- NIST AI RMF 1.0:用于自愿风险管理框架与有效性、可靠性的背景。
- Zheng 等《Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena》:用于 LLM 评判器偏差风险的研究背景。
研究问题与写作决策
| 问题 | 本章回答方式 | 不采用的捷径 |
|---|---|---|
| 什么算“完成”? | 为任务写出可观察的成功标准、失败标准与不覆盖范围。 | 以模型说“已完成”或单一总体分数代替标准。 |
| 证据来自哪里? | 区分确定性检查、状态观察、人工复核、模型评判和自我报告。 | 将日志片段、自然语言解释或通过一次测试自动视作整体成功。 |
| 怎么处理开放式质量? | 让模型评判器只承担明确 Rubric 的一部分,并记录校准与人工抽检需求。 | 将一个未经校准的模型分数伪装成客观事实。 |
| 何时接受? | 所有必需标准都有适用、同范围、满足刷新要求且明确通过的证据;否则补证、拒绝或复核。 | 让可选质量项、成本统计或过程记录覆盖安全/结果失败。 |
计划交付物
- 原创正式章节:定义 Evaluation Spec、证据矩阵、质量门和误判处理。
- 详细 Outline:把结果、过程、评分器、测试层级、案例和相邻章节边界拆开。
- Mermaid 图:展示目标、规格、检查、证据、判定与反馈的管线,不画成真实 CI 或运行时。
- 纯内存示例:
assessEvaluationSpec只评估显式注入的教学对象,不调用 lint、链接检查、模型、文件、网络或真实评分服务。 - 事实核验和审查记录:逐条标明来源级陈述、工程扩展、动态资料和未验证范围。
风险与核验策略
- 规格歧义: 若两个领域专家会给出不同的通过/失败结论,应先修订任务或 Rubric,而不是把噪声解释为 Agent 回归。
- 评判器偏差: 模型评判器不单独作为高风险接受依据;需有校准、人工抽检或独立证据。
- 环境污染: 本章示例不接入真实环境。真实评估应另行证明环境隔离、数据版本和证据可追溯性。
- 指标替代: token、时延和步骤数是约束或诊断信号;它们不自动证明任务正确、安全或对读者有用。
阶段门
- [x] 已有可追溯的一手工程资料、标准资料和原始论文。
- [x] 已将来源陈述与本书模型分开。
- [x] 已明确与第 15、16、18 章的责任边界。
- [x] 已计划可运行示例和图示,但未把它们写成真实系统验证。
