外观
第 2 章事实核验清单
本清单保留正文中的陈述级核验准备,并记录 2026-07-15 完成的正文级 Fact Check。只有标为“已复核”的来源范围可作为事实或来源观点;教学场景和本书工作模型必须明确标识。Fact Check 不替代 Language Editing 或 Final Review。
| ID | 拟使用的陈述或用途 | 类型 | 来源 | 来源是否直接支持 | 状态 | 正文写作规则 |
|---|---|---|---|---|---|---|
| FC-01 | Harness 围绕基础模型协调执行,并涉及规划、工具、上下文、工件和评估。 | 来源观点 | REF-001 | 是,页面开头给出工作描述。 | 2026-07-15 正文级 Fact Check 已复核。 | 使用“来源将 Harness 描述为”;不逐句翻译,也不称为标准。 |
| FC-02 | LLM Agent 的系统概览可按规划、记忆和工具使用来组织。 | 来源观点 | REF-003 | 是,页面以三部分组织。 | 2026-07-15 正文级 Fact Check 已复核。 | 只作一种概览,不推导所有 Agent 的固定模块。 |
| FC-03 | ReAct 研究交错的推理轨迹与任务动作;动作可接触外部来源或环境。 | 论文主张 | REF-004 | 是,摘要直接说明研究对象。 | 2026-07-15 正文级 Fact Check 已复核。 | 限于研究对象,不使用性能数据或生产效果主张。 |
| FC-04 | 模型、Agent、Harness、运行环境的四层责任表。 | 本书工程模型 | 本章原创设计 | 不适用 | 2026-07-15 已核验为本书工程模型。 | 不称为通用标准、来源原话或产品架构。 |
| FC-05 | 只读仓库与可写测试环境的对照案例。 | 教学假设 | 本章原创场景 | 不适用 | 2026-07-15 已核验为教学假设。 | 不写成真实仓库日志、实际故障统计或工具行为。 |
| FC-06 | Sandbox、凭证、网络和文件权限的具体机制。 | 动态或实现事实 | 未来官方资料或项目文档 | 否,本章不需要 | 不纳入本章 | 若后续需要,写作当天建立可追溯证据卡。 |
| FC-07 | ReAct 摘要说明推理轨迹可帮助诱导、跟踪和更新行动计划并处理例外;任务动作可连接外部来源或环境。 | 论文主张 | REF-004 | 是,摘要直接说明。 | 2026-07-15 增补复核。 | 仅作为“观察回到决策”的研究背景;不将诊断卡或四层模型归因给论文。 |
| FC-08 | “未证实、候选拒绝、运行环境阻塞、验证拒绝、验证接受”的结论状态词表。 | 本书工程模型 | 本章原创设计 | 不适用 | 2026-07-15 已核验为本书工程模型。 | 不称为产品枚举、统一行业标准或论文结论;纯内存示例只实现后四条路径。 |
| FC-09 | Attempt Trace 的 attempt_id、候选—请求—观察—验证关联与最小顺序关系。 | 本书工程模型 | 本章原创设计 | 不适用 | 2026-07-15 已核验为本书工程模型。 | 不称为产品事件格式、分布式追踪标准或论文结论;当前纯内存示例不实现持久化 Trace。 |
正文前与审查前的复核步骤
- 重新打开 REF-001、REF-003 与 REF-004,确认标题、URL、页面日期和拟使用范围可追溯。
- 逐句标记来源观点或本书工程模型;一个来源不能支持的额外结论拆分、改写或删除。
- 搜索草稿中的产品名、版本、百分比、性能数字、引号和“所有/必然”等绝对词;无来源即删除或标记
TODO(verify):。 - 审查案例与图示,确认“只读”“可写”“成功”“失败”均是设计条件,不被写成真实执行结果。
- 验证 Mermaid 源文件时记录实际命令与结果;缺少渲染器时只能保留为未审查范围。
明确不核验的内容
本章不报告特定产品的 Sandbox 能力、模型可靠性、权限实现、成本或延迟;这些内容既不需要,也不能用旧记忆补足。
正文级 Fact Check 执行记录
- REF-001: 重新读取原始页面,标题为 Harness Engineering for Self-Improvement,页面日期为 2026-07-04。正文仅归因其对 Harness 围绕基础模型、编排执行、规划、工具、上下文、工件和评估的工作性描述。
- REF-003: 重新读取原始页面,标题为 LLM Powered Autonomous Agents,页面日期为 2023-06-23。正文仅使用其系统概览中 Planning、Memory、Tool use 的组织方式,不将其写成固定架构。
- REF-004: 重新读取 arXiv 摘要页。摘要明确研究交错的推理轨迹与任务动作,并说明动作可连接知识库或环境等外部来源;正文不使用摘要中的性能数字或生产效果结论。
- 增补复核: 再次读取 REF-004 摘要,确认其还将推理轨迹限定为帮助诱导、跟踪和更新行动计划及处理例外。正文只用这一范围解释为何观察应回到决策;“问题—工件—判定”框架、诊断卡和增强顺序仍标为本书工程扩展。
- 工程模型与场景: 四层责任表、结论状态词表、Attempt Trace、只读/可写对照、故障归因表和 Mermaid 图均明确为本书工作模型或教学场景,没有被写成来源文章、真实日志或产品内部架构。
- 本仓库示例: 重新执行
npm run test:runtime-boundaries,4 项 Node 内置测试通过;重新执行npm run example:runtime-boundaries,输出state: "succeeded"、phase: "validated"、observation: "boundary verified"与四项事件。
