Skip to content

第 17 章 Research Brief:Evaluation 与可验证结果

要解决的读者问题

当 Agent 说“任务完成”时,读者如何判断它是在复述自己的输出,还是已经满足可复查的成功标准?本章把“评估”限定为:针对一个明确任务,事先写出成功标准,收集与标准关联的证据,再按可解释的规则给出接受、拒绝或补证结论。

这里不讨论第 15 章的观察点如何采集,也不讨论第 16 章怎样把失败整理为待验证候选并审查其准入,更不设计第 18 章的重试或恢复。第 17 章只消费它们提供的状态和证据,并把它们转成可审查的判定。

章节论点与边界

计划中的可归因陈述

陈述候选来源使用限制
Agent 评估可由任务、试次、评分器、轨迹和结果状态组成;评估 Agent 时应考虑 Harness 与模型的组合。C17-REF-01这是 Anthropic 工程文章的定义和经验,不能写成行业标准或其他产品行为。
基于代码、模型和人工的评分器有不同优势和限制;模型评分需要与人工判断校准。C17-REF-01只用于说明取舍,不引用页面中的性能数字、客户案例或具体产品设置。
NIST AI RMF 的 Measure 功能要求选择、应用和记录 AI 风险测量方法,并将有效性与可靠性作为需要评估的特征。C17-REF-02、C17-REF-03这是自愿风险管理框架语境,不是 Agent 评估模板或合规结论。
LLM-as-a-judge 研究报告位置、冗长和自我增强等偏差风险。C17-REF-04只把它作为模型评判器需要独立校准的研究背景,不宣称任何评判器可靠或不可替代人类。

本书的工程扩展

下列结构均是本书的设计语言,不归因给任何来源:

  • Evaluation Spec:把任务范围、成功标准、证据类型、评分规则、失败出口和不覆盖范围放进同一份可审查工件。
  • 证据矩阵:把每项标准关联到一份证据、其采集方式、范围、状态、解释和刷新条件;教学示例只接受与任务 scope 一致、满足注入 freshness 要求的记录。
  • 质量门(Quality Gate):只根据明确规则输出 acceptedrejectedneeds_evidenceneeds_reviewneeds_spec,不把这些标签当作真实环境状态。
  • 四层评估:结果、过程、安全边界与资源约束应分开评分;它们能共同影响接受结论,但不能相互替代。

已实际阅读的候选资料

2026-07-16 已读取以下原始页面或论文摘要页;完整 URL、允许用途和外推禁区见本章候选资料

  1. Anthropic《Demystifying evals for AI agents》(2026-01-09):用于任务、试次、评分器、轨迹、结果、评分器类型和回归/能力评估的限定讨论。
  2. NIST AI RMF Core:用于 Measure 的测量、记录、有效性和可靠性语境;该在线资源显示 AI RMF 1.0 正在修订,后续改写需重新核验。
  3. NIST AI RMF 1.0:用于自愿风险管理框架与有效性、可靠性的背景。
  4. Zheng 等《Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena》:用于 LLM 评判器偏差风险的研究背景。

研究问题与写作决策

问题本章回答方式不采用的捷径
什么算“完成”?为任务写出可观察的成功标准、失败标准与不覆盖范围。以模型说“已完成”或单一总体分数代替标准。
证据来自哪里?区分确定性检查、状态观察、人工复核、模型评判和自我报告。将日志片段、自然语言解释或通过一次测试自动视作整体成功。
怎么处理开放式质量?让模型评判器只承担明确 Rubric 的一部分,并记录校准与人工抽检需求。将一个未经校准的模型分数伪装成客观事实。
何时接受?所有必需标准都有适用、同范围、满足刷新要求且明确通过的证据;否则补证、拒绝或复核。让可选质量项、成本统计或过程记录覆盖安全/结果失败。

计划交付物

  • 原创正式章节:定义 Evaluation Spec、证据矩阵、质量门和误判处理。
  • 详细 Outline:把结果、过程、评分器、测试层级、案例和相邻章节边界拆开。
  • Mermaid 图:展示目标、规格、检查、证据、判定与反馈的管线,不画成真实 CI 或运行时。
  • 纯内存示例:assessEvaluationSpec 只评估显式注入的教学对象,不调用 lint、链接检查、模型、文件、网络或真实评分服务。
  • 事实核验和审查记录:逐条标明来源级陈述、工程扩展、动态资料和未验证范围。

风险与核验策略

  • 规格歧义: 若两个领域专家会给出不同的通过/失败结论,应先修订任务或 Rubric,而不是把噪声解释为 Agent 回归。
  • 评判器偏差: 模型评判器不单独作为高风险接受依据;需有校准、人工抽检或独立证据。
  • 环境污染: 本章示例不接入真实环境。真实评估应另行证明环境隔离、数据版本和证据可追溯性。
  • 指标替代: token、时延和步骤数是约束或诊断信号;它们不自动证明任务正确、安全或对读者有用。

阶段门

  • [x] 已有可追溯的一手工程资料、标准资料和原始论文。
  • [x] 已将来源陈述与本书模型分开。
  • [x] 已明确与第 15、16、18 章的责任边界。
  • [x] 已计划可运行示例和图示,但未把它们写成真实系统验证。

从同一套 Markdown 书稿生成。