Skip to content

第 16 章 Research Brief:Reflection 与经验提炼

要解决的读者问题

当 Agent 的一次尝试失败时,怎样让系统从轨迹中提炼可复用改进,而不是把模型生成的一段“复盘”直接当成根因、规则或长期记忆?本章要给出一条小而可审查的路径:失败评估证据 → 反思记录 → 可证伪检查 → 候选审查 → 受控采纳。

研究结论与边界

来源实际读取日期可使用的限定陈述本章不得外推的内容
C16-REF-01,Reflexion2026-07-16论文提出以语言反馈而非更新权重来强化语言 Agent,并让反思文本进入情景记忆以影响后续尝试。不使用论文的基准数字;不把其方法、记忆结构、任务结果或“自我改进”归因给本书模型。
C16-REF-02,Self-Refine2026-07-16论文研究通过迭代反馈和精炼改善初始输出的过程,且描述单个 LLM 可承担生成、反馈与精炼角色。不写成任意任务都有效;不引用其平均改进数字;不将模型自反馈等同真实验证。
C16-REF-03,Google SRE Postmortem Culture2026-07-16页面将事后分析描述为事件、影响、缓解/处置、根因与预防行动的书面记录,并强调无责、建设性学习和跟进行动。不把 SRE 流程变为 Agent 的自动根因分析;不将 Google 的触发阈值、组织经验或效果声明外推到读者系统。
C16-REF-04,Anthropic Building Effective AI Agents2026-07-16文章将 evaluator-optimizer 描述为生成与评估反馈的循环,并限定在评估标准清楚、迭代精炼有可测价值时适用。不把产品/工程建议写成行业标准;不推断模型自评可靠,或将工作流自动用于高风险改变。

本书工程模型

以下内容是本章的原创工程设计,不归因给上述论文或实践文章:

  • Reflection Record: 把轨迹、症状、观察来源、假设、可证伪检查、反事实、候选改变和验证状态放在同一可审查工件中。
  • 层级分离: 症状不是根因,根因假设不是经验,候选通过检查也不是已采纳规则。
  • Lesson Admission: 候选检查通过后仍要做范围、证据、冲突、可撤销性和责任审查。
  • 范围守卫: 候选改变必须匹配原轨迹范围;范围扩大时阻塞或升级,不由反思器直接执行。

章节结构与相邻边界

章节本章使用的输入本章产出的接口不在本章重讲的内容
07 Memory工作/长期记忆的候选与过期边界可审查的经验候选存储、检索、隐私与跨任务读取策略
10 Workflow轨迹、状态和检查点反思后可回到工作流的候选具体状态机、重入和幂等实现
15 Observation观察来源、新鲜度和状态快照反思记录的事实输入如何采集日志、事件和快照
16 Reflection失败评估、受限轨迹和候选改变可证伪候选与审查入口不证明根因或自动更新系统
17 Evaluation评估证据与验收规格可供经验准入的检查结果评估器、质量门和证据矩阵的系统设计
18 Recovery检查失败或候选拒绝保守停止、补证或新假设重试、补偿、退避和容错策略

计划示例与验证

教学场景: 两个链接检查失败的注入轨迹。它故意保留多个可能机制,避免把虚构日志、网络或 URL 当作已观察事实。

最小函数: assessReflectionRecord 只接受 tracereflectionverification 三个注入对象,输出候选状态。函数不产生 I/O、不保存经验、不改变 Harness。

必须覆盖的出口: 缺观察证据、成功轨迹、陈旧观察、不可证伪假设、范围扩大、候选待验证、验证失败、验证通过待审查。

图示: 失败评估证据到 Reflection Record,再到可证伪检查、审查与候选经验;明确“候选不自动执行”的虚线边界。

风险与待核验项

  • TODO(verify): 若采用具体 Agent SDK、记忆库、事故平台或 evaluator API,写作当日必须重读其官方文档;本章不声明任何产品接口。
  • TODO(verify): 若给出失败率、改进幅度、记忆容量、自动采纳阈值或成本数字,必须增加针对性来源与适用条件;本章不使用这些数字。
  • TODO(verify): 候选经验如包含用户、日志、代码、密钥或生产信息,需按具体组织的数据保留与访问控制要求设计;本章只给出最小化与审查原则。

Research Brief 完成检查

  • [x] 明确读者问题、相邻章节边界和本章不解决的问题。
  • [x] 四项一手资料已实际读取,且每项有可使用陈述与外推禁区。
  • [x] 论文背景、工程实践与本书模型分层记录。
  • [x] 已规划可运行纯内存示例、图示、测试出口和风险边界。

从同一套 Markdown 书稿生成。