外观
第 4 章 Research Brief:构建可靠 Agent 的工程原则
任务与读者问题
第 4 章回答:当 Agent 能调用工具、修改状态并跨多步运行时,如何把“看似完成”改造成有目标、证据、失败路径、权限边界和责任人的工程交付?读者应能为一个受控任务定义可观察目标、最小可验证闭环、停止条件和升级条件。
范围与非范围
范围: 目标与验收、显式状态、可复现验证、失败可见、最小权限、渐进发布与人工升级的工程原则。
非范围: 不承诺任何 Agent 的正确率;不定义具体产品 API、安全实现或合规结论;不把一般风险框架、发布实践或厂商指南改写为 Agent 产品标准。
已核验来源与可用陈述
| ID | 可在本章使用的陈述 | 证据边界 | 核验状态 |
|---|---|---|---|
| REF-007 | NIST AI RMF 1.0 是帮助组织管理 AI 风险、促进可信与负责任开发和使用的自愿性框架。 | 用于风险管理与可信性原则的背景,不作为 Agent 验收流程的现成处方。 | 2026-07-15 复核 NIST 原始页面。 |
| REF-008 | OpenAI 的工程指南将 Guardrails 描述为分层防御;工具风险可按只读/写入、可逆性、账户权限和财务影响评估,并可对高风险动作暂停检查或升级人工。 | 仅归因该指南;具体产品能力和集成方式在正文当天重查。 | 2026-07-15 复核官方页面。 |
| REF-009 | Google SRE 将 Canary 定义为对部分、限时部署变更的评估,并要求有子集投放、好坏评估及将评估接入发布流程的能力。 | 用于受控变更、观测与回滚的工程类比,不外推为 Agent 专用方法。 | 2026-07-15 复核原始页面。 |
| REF-001 | Harness 的思想背景涉及执行、上下文、工件与评估。 | 仅作本书连续性的思想背景;原则清单由本书组织。 | 2026-07-15 已复核原文。 |
本书工程扩展
本章将提出六条原创、可检查的原则:以可观察目标开始;以验证闭环结束;让状态和失败可见;以最小权限限制副作用;把高风险或不确定结果升级给人;先在小范围运行再扩大。它们是本书的组织方式,不是外部来源的逐条翻译或统一标准。
计划叙述与工件
- 用“自动修改配置”场景说明目标文本并不等于可接受结果。
- 将目标、预检、受控执行、验证、记录、恢复/升级画成可靠性闭环。
- 以 dry-run、备份、写入后验证、停止阈值和人工审批组织案例。
- 用风险矩阵区分可逆只读动作、可逆写入和不可逆高风险动作。
计划交付物:详细 Outline、Fact Check、Mermaid 闭环图、最小受控配置变更示例与 Definition of Done 检查表。
事实与版权规则
- 正文将来源的框架、指南或发布实践与本书的 Agent 原则明确分开。
- 任何动态产品 Guardrails、权限或人工升级行为均在正文写作当天重查官方资料;未核验时标为
TODO(verify):。 - 不复刻来源的长段落、图表或案例;以本书的配置修改教学案例重新组织。
Research 完成检查
- [x] 读者问题、范围、非范围和相邻章节关系明确。
- [x] 可靠性、权限、人工升级和渐进变更均有一手来源或明确的本书扩展边界。
- [x] 已规定动态产品信息的正文当天复核要求。
