Skip to content

第 2 章事实核验清单

本清单保留正文中的陈述级核验准备,并记录 2026-07-15 完成的正文级 Fact Check。只有标为“已复核”的来源范围可作为事实或来源观点;教学场景和本书工作模型必须明确标识。Fact Check 不替代 Language Editing 或 Final Review。

ID拟使用的陈述或用途类型来源来源是否直接支持状态正文写作规则
FC-01Harness 围绕基础模型协调执行,并涉及规划、工具、上下文、工件和评估。来源观点REF-001是,页面开头给出工作描述。2026-07-15 正文级 Fact Check 已复核。使用“来源将 Harness 描述为”;不逐句翻译,也不称为标准。
FC-02LLM Agent 的系统概览可按规划、记忆和工具使用来组织。来源观点REF-003是,页面以三部分组织。2026-07-15 正文级 Fact Check 已复核。只作一种概览,不推导所有 Agent 的固定模块。
FC-03ReAct 研究交错的推理轨迹与任务动作;动作可接触外部来源或环境。论文主张REF-004是,摘要直接说明研究对象。2026-07-15 正文级 Fact Check 已复核。限于研究对象,不使用性能数据或生产效果主张。
FC-04模型、Agent、Harness、运行环境的四层责任表。本书工程模型本章原创设计不适用2026-07-15 已核验为本书工程模型。不称为通用标准、来源原话或产品架构。
FC-05只读仓库与可写测试环境的对照案例。教学假设本章原创场景不适用2026-07-15 已核验为教学假设。不写成真实仓库日志、实际故障统计或工具行为。
FC-06Sandbox、凭证、网络和文件权限的具体机制。动态或实现事实未来官方资料或项目文档否,本章不需要不纳入本章若后续需要,写作当天建立可追溯证据卡。
FC-07ReAct 摘要说明推理轨迹可帮助诱导、跟踪和更新行动计划并处理例外;任务动作可连接外部来源或环境。论文主张REF-004是,摘要直接说明。2026-07-15 增补复核。仅作为“观察回到决策”的研究背景;不将诊断卡或四层模型归因给论文。
FC-08“未证实、候选拒绝、运行环境阻塞、验证拒绝、验证接受”的结论状态词表。本书工程模型本章原创设计不适用2026-07-15 已核验为本书工程模型。不称为产品枚举、统一行业标准或论文结论;纯内存示例只实现后四条路径。
FC-09Attempt Trace 的 attempt_id、候选—请求—观察—验证关联与最小顺序关系。本书工程模型本章原创设计不适用2026-07-15 已核验为本书工程模型。不称为产品事件格式、分布式追踪标准或论文结论;当前纯内存示例不实现持久化 Trace。

正文前与审查前的复核步骤

  1. 重新打开 REF-001、REF-003 与 REF-004,确认标题、URL、页面日期和拟使用范围可追溯。
  2. 逐句标记来源观点或本书工程模型;一个来源不能支持的额外结论拆分、改写或删除。
  3. 搜索草稿中的产品名、版本、百分比、性能数字、引号和“所有/必然”等绝对词;无来源即删除或标记 TODO(verify):
  4. 审查案例与图示,确认“只读”“可写”“成功”“失败”均是设计条件,不被写成真实执行结果。
  5. 验证 Mermaid 源文件时记录实际命令与结果;缺少渲染器时只能保留为未审查范围。

明确不核验的内容

本章不报告特定产品的 Sandbox 能力、模型可靠性、权限实现、成本或延迟;这些内容既不需要,也不能用旧记忆补足。

正文级 Fact Check 执行记录

  • REF-001: 重新读取原始页面,标题为 Harness Engineering for Self-Improvement,页面日期为 2026-07-04。正文仅归因其对 Harness 围绕基础模型、编排执行、规划、工具、上下文、工件和评估的工作性描述。
  • REF-003: 重新读取原始页面,标题为 LLM Powered Autonomous Agents,页面日期为 2023-06-23。正文仅使用其系统概览中 Planning、Memory、Tool use 的组织方式,不将其写成固定架构。
  • REF-004: 重新读取 arXiv 摘要页。摘要明确研究交错的推理轨迹与任务动作,并说明动作可连接知识库或环境等外部来源;正文不使用摘要中的性能数字或生产效果结论。
  • 增补复核: 再次读取 REF-004 摘要,确认其还将推理轨迹限定为帮助诱导、跟踪和更新行动计划及处理例外。正文只用这一范围解释为何观察应回到决策;“问题—工件—判定”框架、诊断卡和增强顺序仍标为本书工程扩展。
  • 工程模型与场景: 四层责任表、结论状态词表、Attempt Trace、只读/可写对照、故障归因表和 Mermaid 图均明确为本书工作模型或教学场景,没有被写成来源文章、真实日志或产品内部架构。
  • 本仓库示例: 重新执行 npm run test:runtime-boundaries,4 项 Node 内置测试通过;重新执行 npm run example:runtime-boundaries,输出 state: "succeeded"phase: "validated"observation: "boundary verified" 与四项事件。

从同一套 Markdown 书稿生成。