外观
第 16 章 Research Brief:Reflection 与经验提炼
要解决的读者问题
当 Agent 的一次尝试失败时,怎样让系统从轨迹中提炼可复用改进,而不是把模型生成的一段“复盘”直接当成根因、规则或长期记忆?本章要给出一条小而可审查的路径:失败评估证据 → 反思记录 → 可证伪检查 → 候选审查 → 受控采纳。
研究结论与边界
| 来源 | 实际读取日期 | 可使用的限定陈述 | 本章不得外推的内容 |
|---|---|---|---|
| C16-REF-01,Reflexion | 2026-07-16 | 论文提出以语言反馈而非更新权重来强化语言 Agent,并让反思文本进入情景记忆以影响后续尝试。 | 不使用论文的基准数字;不把其方法、记忆结构、任务结果或“自我改进”归因给本书模型。 |
| C16-REF-02,Self-Refine | 2026-07-16 | 论文研究通过迭代反馈和精炼改善初始输出的过程,且描述单个 LLM 可承担生成、反馈与精炼角色。 | 不写成任意任务都有效;不引用其平均改进数字;不将模型自反馈等同真实验证。 |
| C16-REF-03,Google SRE Postmortem Culture | 2026-07-16 | 页面将事后分析描述为事件、影响、缓解/处置、根因与预防行动的书面记录,并强调无责、建设性学习和跟进行动。 | 不把 SRE 流程变为 Agent 的自动根因分析;不将 Google 的触发阈值、组织经验或效果声明外推到读者系统。 |
| C16-REF-04,Anthropic Building Effective AI Agents | 2026-07-16 | 文章将 evaluator-optimizer 描述为生成与评估反馈的循环,并限定在评估标准清楚、迭代精炼有可测价值时适用。 | 不把产品/工程建议写成行业标准;不推断模型自评可靠,或将工作流自动用于高风险改变。 |
本书工程模型
以下内容是本章的原创工程设计,不归因给上述论文或实践文章:
- Reflection Record: 把轨迹、症状、观察来源、假设、可证伪检查、反事实、候选改变和验证状态放在同一可审查工件中。
- 层级分离: 症状不是根因,根因假设不是经验,候选通过检查也不是已采纳规则。
- Lesson Admission: 候选检查通过后仍要做范围、证据、冲突、可撤销性和责任审查。
- 范围守卫: 候选改变必须匹配原轨迹范围;范围扩大时阻塞或升级,不由反思器直接执行。
章节结构与相邻边界
| 章节 | 本章使用的输入 | 本章产出的接口 | 不在本章重讲的内容 |
|---|---|---|---|
| 07 Memory | 工作/长期记忆的候选与过期边界 | 可审查的经验候选 | 存储、检索、隐私与跨任务读取策略 |
| 10 Workflow | 轨迹、状态和检查点 | 反思后可回到工作流的候选 | 具体状态机、重入和幂等实现 |
| 15 Observation | 观察来源、新鲜度和状态快照 | 反思记录的事实输入 | 如何采集日志、事件和快照 |
| 16 Reflection | 失败评估、受限轨迹和候选改变 | 可证伪候选与审查入口 | 不证明根因或自动更新系统 |
| 17 Evaluation | 评估证据与验收规格 | 可供经验准入的检查结果 | 评估器、质量门和证据矩阵的系统设计 |
| 18 Recovery | 检查失败或候选拒绝 | 保守停止、补证或新假设 | 重试、补偿、退避和容错策略 |
计划示例与验证
教学场景: 两个链接检查失败的注入轨迹。它故意保留多个可能机制,避免把虚构日志、网络或 URL 当作已观察事实。
最小函数: assessReflectionRecord 只接受 trace、reflection 与 verification 三个注入对象,输出候选状态。函数不产生 I/O、不保存经验、不改变 Harness。
必须覆盖的出口: 缺观察证据、成功轨迹、陈旧观察、不可证伪假设、范围扩大、候选待验证、验证失败、验证通过待审查。
图示: 失败评估证据到 Reflection Record,再到可证伪检查、审查与候选经验;明确“候选不自动执行”的虚线边界。
风险与待核验项
TODO(verify):若采用具体 Agent SDK、记忆库、事故平台或 evaluator API,写作当日必须重读其官方文档;本章不声明任何产品接口。TODO(verify):若给出失败率、改进幅度、记忆容量、自动采纳阈值或成本数字,必须增加针对性来源与适用条件;本章不使用这些数字。TODO(verify):候选经验如包含用户、日志、代码、密钥或生产信息,需按具体组织的数据保留与访问控制要求设计;本章只给出最小化与审查原则。
Research Brief 完成检查
- [x] 明确读者问题、相邻章节边界和本章不解决的问题。
- [x] 四项一手资料已实际读取,且每项有可使用陈述与外推禁区。
- [x] 论文背景、工程实践与本书模型分层记录。
- [x] 已规划可运行纯内存示例、图示、测试出口和风险边界。
