Skip to content

第 40 章 Research Brief:成本、延迟与 Token 管理

要解决的读者问题

一个 Harness 可以得到正确结果,却仍可能因为重复携带上下文、串行等待工具、无条件重试或把所有任务都路由到同一路径而难以长期运行。相反,只追求少用 Token 或降低单次费用,也可能删掉来源、验证和失败出口,得到更便宜但不可接受的结果。

读者需要把资源限制写成任务契约的一部分:先声明哪些质量和安全条件不可降级,再记录一次任务在模型、检索、工具、验证与重试各阶段消耗了什么,最后只对有证据的瓶颈提出可回退的优化候选。本章不提供“最便宜模型”排行,也不把厂商价格、上下文窗口、缓存阈值或延迟经验值固化为跨产品结论。

研究范围与非范围

读者问题本章研究的回答本章不回答
如何知道一次任务花在哪里?建立与任务、步骤、模型/工具配置和证据版本关联的资源记录,分别记录输入、输出、缓存、检索、工具、等待、重试和验证。用一个总 Token 数解释全部成本、质量或用户等待。
Token 预算应怎样设置?将预算拆成不可省略的契约与证据、可按需加载的资料、候选输出和重试余量;超预算时给出降载、补证、批准或停止出口。跨模型通用的 Token 上限、字符换算、上下文窗口或计费公式。
延迟怎样优化?先分解排队、请求、模型处理、检索、工具、验证和重试等待,再针对关键路径选择减少请求、并行独立步骤、流式反馈或异步批处理候选。一个适用于所有任务的超时、并发数、首 Token 时间或服务级别目标。
缓存和摘要何时有用?只有输入身份、版本、权限范围、新鲜度和失效条件都可核对时,才复用稳定前缀、检索结果或结构化摘要。“命中缓存就正确”、缓存跨供应商兼容、缓存永久存在或摘要等于原始证据。
怎样选择模型或执行路径?先用固定任务集与质量门证明候选路径满足结果、安全和证据要求,再比较资源记录;不满足门槛的低成本路径不能晋级。仅凭模型名称、价格、速度宣传或单次演示自动路由。

已核验的一手资料与受限用途

本地键来源明确表达的内容允许用于本章的范围不可外推
CH40-REF-01OpenAI 的延迟优化指南把优化手段分为处理/生成 Token、输入长度、请求次数、并行、用户感知等待和非 LLM 路径等类别,并区分严格顺序步骤与可并行步骤。说明延迟不只来自模型推理,应先画出请求与依赖路径,再选择优化位置。页面中的百分比、模型大小经验、特定 API 功能、流式效果或任何跨供应商性能保证。
CH40-REF-02OpenAI Prompt Caching 文档说明缓存复用依赖相同的 Prompt 前缀,并建议将稳定内容置于前部、变化内容置于后部;响应可报告缓存相关用量。说明缓存候选需要稳定前缀身份和可观察的命中记录,不能只靠“内容相似”推断复用。当前模型清单、Token 阈值、保留时间、路由规则、价格、命中率、安全或其他供应商行为。
CH40-REF-03Anthropic Token counting 文档提供发送消息前的输入 Token 估算,并明确预估值在某些情况下可能与实际消息使用量略有差异。说明预算前检查和实际用量记录是两类证据;路由决策必须绑定目标模型/接口及当次实际返回。当前模型列表、Tokenizer 差异、系统附加 Token、计费规则、上下文窗口或跨供应商可比性。
CH40-REF-04OpenAI Batch API 指南把不要求即时响应的工作描述为异步批处理候选,并提供提交、查询状态和取回结果的产品流程。说明“交互式关键路径”和“可延后离线任务”应先分类,再决定是否批处理。当前折扣、完成窗口、限额、端点、文件格式、任务适用性或批处理一定更快、更便宜。
CH40-REF-05Anthropic 的 Context Engineering 文章讨论在有限上下文中维护高信号 Token、按需检索和长任务压缩,并提醒保留与丢弃存在取舍。说明压缩和按需加载应以任务相关性、恢复与损失检查为条件,而不是只追求更短输入。其产品实现、自动压缩、上下文能力、成本或质量结果成为跨系统保证。
CH40-REF-06Anthropic 的 Agent 评估文章将任务、试次、评分器、轨迹和结果分开,并建议在固定任务上跟踪 Token、延迟、成本和错误率等指标。说明资源比较必须绑定同一任务定义、质量标准、试次和结果证据。文章中的客户案例、模型表现、阈值、指标优先级或任意评估器的可靠性保证。
CH40-REF-07OpenAI API Pricing 页面列出当前产品计费信息。只作为正式写作、事实核验与出版前按日期读取费率的官方入口;本 Research Brief 不摘录任何价格。价格长期稳定、合同实际结算、其他平台价格、汇率、税费、折扣或未来费率。

访问日期均为 2026-07-17。CH40-REF-05 与 CH40-REF-06 分别复用全局引用 REF-068 与 REF-061;CH40-REF-01 至 CH40-REF-04、CH40-REF-07 已由主线程登记为 REF-120 至 REF-124。完整 URL、页面动态性与外推禁区见本章候选参考资料。所有产品页面在 First Draft、Technical Review、Fact Check 与出版前都必须重读。

本书工程模型

下列工件是本书为教学和审查提出的结构,不是 OpenAI、Anthropic 或其他供应商的 API、计费口径、SLA 或默认控制流。

工件最小字段解决的问题不承担的责任
资源预算(Resource Budget)任务范围、不可降级标准、阶段上限、重试余量、超限出口、费率/模型配置版本在运行前说明资源约束与必须保留的质量门。不预测真实账单、排队或 Tokenizer 结果。
资源记录(Resource Record)任务/试次标识、步骤、输入/输出/缓存用量、开始/结束观察、工具/检索/验证次数、来源与未知项把“这次很贵/很慢”拆成可追溯事实。不把缺失字段估成零,也不把 Token 自动换算为金额或质量。
延迟路径(Latency Path)阶段依赖、开始/结束时间、排队、模型、网络、工具、验证、重试与关键路径区分总时长、用户感知等待和各阶段耗时。不伪造首 Token、吞吐、并发或外部服务数据。
成本规则快照(Rate Snapshot)供应商/合同范围、产品与版本、计量单位、币种、有效时间、来源 URL、复核人/时间让金额计算可按时间和适用范围重放。不代表公开价等于合同结算,也不跨供应商统一计量。
优化候选(Optimization Candidate)基线、单一变化、预期影响、风险、失效条件、回退方案、对照任务集让摘要、缓存、批处理、路由或并行成为可验证变更。不实际修改 Prompt、调用模型、创建缓存、调度批次或切换供应商。
质量不降级门(Quality Non-regression Gate)必需结果、安全/权限边界、来源新鲜度、证据完整性、允许差异、资源比较防止成本或速度改善覆盖正确性、安全与可追溯性失败。不保证评估器正确,也不替代第 39 章 Benchmark 或第 41 章安全审计。

建议的计算边界

本章只在数据来源、单位和时间范围完整时计算派生值。所有公式都是本书的数据契约,不是厂商计费公式:

  1. 任务总资源由同一任务/试次下可归属的模型、检索、工具、验证和重试记录组成;无法归属的费用保持 unknown,不得摊平为零。
  2. 关键路径延迟来自依赖图中实际观察到的最长完成路径;并行步骤的耗时不能简单相加为用户等待。
  3. 单次结果成本只有在任务结果通过指定质量门后才用于候选比较;失败、补证与人工复核应分别保留,而不是用平均值隐藏。
  4. 缓存收益必须同时记录请求身份、稳定前缀/对象版本、命中证据和失效条件;没有命中证据时只称为缓存候选。
  5. 费率换算必须绑定 Rate Snapshot;缺少币种、有效时间、单位或合同范围时只保留原始用量。

优化优先级框架

Chapter Outline 应按以下顺序展开,而不是从“换更便宜模型”开始:

  1. 先消除没有必要的工作: 判断是否可用确定性代码、已有结果或用户界面完成;但不得绕过事实核验、安全检查和结果验证。
  2. 再减少重复工作: 识别重复请求、重复检索、重复工具输出和无条件重试;复用前检查版本、权限、新鲜度与失效条件。
  3. 缩短关键路径: 合并仅为传递中间文本的请求,并行真正独立的只读步骤,把非即时任务移出交互路径;写入、审批和有顺序依赖的步骤不因追求速度而并行。
  4. 压缩高成本载荷: 结构化摘要、指针化和按需加载须保留目标、来源、未知项和恢复入口;压缩后需重新运行质量门。
  5. 最后比较模型/执行路径: 在相同任务集、输入版本、试次策略和质量门下比较候选;低资源但未通过必需标准的候选直接拒绝。

计划案例、图示与纯内存示例

教学案例: 一个虚构的研究 Agent 每次都重新加载同一组官方资料、再次生成长摘要,然后执行事实核验。候选优化把已核验的稳定来源元数据和结构化摘要做版本化复用,只在来源更新时间、任务范围或引用主张变化时失效;事实核验步骤始终保留。案例只使用注入的教学记录,不访问网页、不调用模型、不创建真实缓存,也不报告真实 Token、延迟或金额。

计划图示: Mermaid 图应把一次任务画成 任务契约 → 模型/检索 → 工具 → 验证 → 必要时重试 的阶段流,并在下方对齐输入/输出用量、缓存、等待和重试记录,形成资源瀑布。图中需标出两条断点:资源减少 ≠ 质量通过缓存候选 ≠ 已命中;并行分支只表示依赖允许,不表示真实并发已经运行。

计划示例: Example Implementation 阶段可实现纯内存函数 assessResourceOptimization(input)。输入为注入的 budgetbaselineRecordscandidateRecordsrateSnapshotqualityGate,输出 ready_for_comparisonneeds_measurementquality_regressionrate_stalerequires_approval。测试应覆盖缺实际用量、费率过期、缓存无命中证据、并行依赖冲突、重试超预算、资源改善但质量失败,以及同范围候选可比较;不得调用模型、网络、文件、计费、缓存、批处理、时钟、并发或外部工具。

风险、失败模式与后续核验

  • 把 Token 当作统一货币: 不同模型、接口、输入类型与计费策略可能不同;原始用量、费率快照和派生金额必须分开。
  • 平均值隐藏尾部: 单一平均延迟会隐藏等待、重试和少数极慢任务;正文只解释分布和分层记录,不伪造分位数。
  • 缓存污染: 范围、来源、新鲜度、权限或配置版本不一致时,缓存复用可能把过期信息带入任务;命中记录不能代替事实核验。
  • 并行放大资源: 并行候选可能缩短关键路径,也可能增加总请求和取消浪费;必须同时观察总资源、关键路径与副作用边界。
  • 便宜路径质量退化: 路由、摘要、减少工具调用或缩短输出都可能改变结果;候选只有通过同一质量门才可接受。
  • 价格与产品漂移: 价格、模型、上下文窗口、缓存、批处理、计量字段和限额都是动态事实;本章不保存未经版本化的数值。
  • TODO(verify): First Draft、Technical Review、Fact Check 和出版前重读 CH40-REF-01 至 CH40-REF-07;若页面行为或 URL 改变,更新来源表,不保留过期模型清单、价格或阈值。
  • TODO(verify): First Draft 写作日按 REF-120 至 REF-124 的当前官方页面重新确认动态产品语义;不得沿用过期字段、数字或价格。
  • TODO(verify): Example Implementation 前确认本仓 Node 测试入口;所有示例数据都应明确为注入值,禁止把示例数值包装成供应商账单或实测延迟。

下一阶段建议

Chapter Outline 应围绕“质量底线 → 资源预算 → 资源记录 → 延迟路径 → 缓存/批处理/路由候选 → 质量不降级门”建立逐节蓝图,并把第 17、18、19、39、41、42 章的责任边界逐项写清。每一节都要区分来源明确的产品行为、本书工程模型、虚构教学数据和真实未运行范围;不得在 Outline 阶段创建代码、图源、缓存、Benchmark 或任何性能结论。

从同一套 Markdown 书稿生成。