Skip to content

第 4 章 Research Brief:构建可靠 Agent 的工程原则

任务与读者问题

第 4 章回答:当 Agent 能调用工具、修改状态并跨多步运行时,如何把“看似完成”改造成有目标、证据、失败路径、权限边界和责任人的工程交付?读者应能为一个受控任务定义可观察目标、最小可验证闭环、停止条件和升级条件。

范围与非范围

范围: 目标与验收、显式状态、可复现验证、失败可见、最小权限、渐进发布与人工升级的工程原则。

非范围: 不承诺任何 Agent 的正确率;不定义具体产品 API、安全实现或合规结论;不把一般风险框架、发布实践或厂商指南改写为 Agent 产品标准。

已核验来源与可用陈述

ID可在本章使用的陈述证据边界核验状态
REF-007NIST AI RMF 1.0 是帮助组织管理 AI 风险、促进可信与负责任开发和使用的自愿性框架。用于风险管理与可信性原则的背景,不作为 Agent 验收流程的现成处方。2026-07-15 复核 NIST 原始页面。
REF-008OpenAI 的工程指南将 Guardrails 描述为分层防御;工具风险可按只读/写入、可逆性、账户权限和财务影响评估,并可对高风险动作暂停检查或升级人工。仅归因该指南;具体产品能力和集成方式在正文当天重查。2026-07-15 复核官方页面。
REF-009Google SRE 将 Canary 定义为对部分、限时部署变更的评估,并要求有子集投放、好坏评估及将评估接入发布流程的能力。用于受控变更、观测与回滚的工程类比,不外推为 Agent 专用方法。2026-07-15 复核原始页面。
REF-001Harness 的思想背景涉及执行、上下文、工件与评估。仅作本书连续性的思想背景;原则清单由本书组织。2026-07-15 已复核原文。

本书工程扩展

本章将提出六条原创、可检查的原则:以可观察目标开始;以验证闭环结束;让状态和失败可见;以最小权限限制副作用;把高风险或不确定结果升级给人;先在小范围运行再扩大。它们是本书的组织方式,不是外部来源的逐条翻译或统一标准。

计划叙述与工件

  1. 用“自动修改配置”场景说明目标文本并不等于可接受结果。
  2. 将目标、预检、受控执行、验证、记录、恢复/升级画成可靠性闭环。
  3. 以 dry-run、备份、写入后验证、停止阈值和人工审批组织案例。
  4. 用风险矩阵区分可逆只读动作、可逆写入和不可逆高风险动作。

计划交付物:详细 Outline、Fact Check、Mermaid 闭环图、最小受控配置变更示例与 Definition of Done 检查表。

事实与版权规则

  • 正文将来源的框架、指南或发布实践与本书的 Agent 原则明确分开。
  • 任何动态产品 Guardrails、权限或人工升级行为均在正文写作当天重查官方资料;未核验时标为 TODO(verify):
  • 不复刻来源的长段落、图表或案例;以本书的配置修改教学案例重新组织。

Research 完成检查

  • [x] 读者问题、范围、非范围和相邻章节关系明确。
  • [x] 可靠性、权限、人工升级和渐进变更均有一手来源或明确的本书扩展边界。
  • [x] 已规定动态产品信息的正文当天复核要求。

从同一套 Markdown 书稿生成。