事实边界:本文按 2026-07-31 可访问的 OpenAI 公告、Luna 模型卡与 API 价格页核验。降价不代表模型权重改变,也不能推导 OpenAI 的单位推理成本或毛利率。

Luna 降价后真正该重算的是单次成功成本

摘要

Luna Standard 短上下文输入、缓存读取、缓存写入和输出价格都降到了旧价的 20%。 所以在模型、服务层级、上下文区间和 Token 构成不变时,模型 Token 账单精确下降 80%。但 Agent 任务还包含工具调用、循环重试、长上下文阶跃、缓存失配和人工复核。 真正决定迁移价值的指标应是 cost_per_success。本文给出完整费率等式、工具成本 拐点、272K 阈值、100–500 个真实任务 A/B 和 Luna-first 条件升级方案。

一、80% 是严格等式,但有四个前提

OpenAI 官方公告:Luna Standard 四项费率同步下降

Luna Standard 短上下文四项费率向量

OpenAI 当前列示的 Luna Standard 短上下文费率为:

计费项旧价新价单位
未缓存输入1.000.20美元/百万 Token
缓存读取0.100.02美元/百万 Token
缓存写入1.250.25美元/百万 Token
输出6.001.20美元/百万 Token

设四类 Token 分别为 I、R、W、O

old = 1.00I + 0.10R + 1.25W + 6.00O
new = 0.20I + 0.02R + 0.25W + 1.20O
    = 0.20 × old

这条等式只在四个条件同时成立时有效:同一个 Luna 模型、同一服务层级、同一 上下文费率区间、同一 Token 向量。工具、区域与第三方费用不包含在等式中。

二、模型费降 80%,任务总成本为什么未必

模型费下降与任务总成本下降并不等价

Agent 任务成本至少包含:

模型 Token
+ 工具调用
+ 外部服务
+ 重试与循环
+ 人工复核

假设旧模型 Token 成本 0.10 美元,工具 0.03 美元,人工复核摊销 0.07 美元, 总成本是 0.20 美元。模型部分降 80% 后,总成本变成:

0.02 + 0.03 + 0.07 = 0.12 美元

业务总成本只下降 40%。如果 Luna 需要更多轮次、搜索或人工介入,单次调用更便宜, 单次成功任务甚至可能没有更便宜。

三、Token 便宜后,工具更早成为成本中心

OpenAI API 工具费用单独计费

一次 Web Search 固定费高于示例 Token 模型费

OpenAI 当前 Web Search 固定调用费为每 1,000 次 10 美元,即每次 0.01 美元, 搜索内容 Token 另计。

一次 20K 未缓存输入、2K 输出的 Luna Standard 请求:

20K × $0.20/M + 2K × $1.20/M = $0.0064

一次 Web Search 的固定费已经高于模型 Token 成本。这不是让 Agent 停止搜索, 而是要求团队记录 tool_calls_per_success、重复搜索、无结果搜索和搜索后的成功率 提升。该搜的证据仍要搜,失控的循环必须被 Harness 截止。

四、272K 是完整请求的离散价格阶跃

Luna 模型卡中的 272K 长上下文费率规则

272K 是完整请求的费率阶跃

Luna 支持 1,050,000 上下文,最大输出 128,000;但输入超过 272K 后,完整请求按 2 倍输入、1.5 倍输出费率计费。Standard 对应变为输入 0.40、缓存读 0.04、 缓存写 0.50、输出 1.80 美元/百万 Token。

平均上下文 200K 不能证明成本稳定。团队需要看 P50/P90/P95/P99、跨线比例以及 跨线前最后一次工具调用。可以在 240K–260K 预警并压缩已确认状态,但高风险任务 如果必须保留完整证据,就应接受长上下文费率。

五、缓存命中属于计费架构

缓存读取价格是普通输入的十分之一,但命中依赖稳定前缀。把时间戳、用户状态或 最新工具结果放在 Prompt 前部,会让后续稳定 instructions 无法复用。

更合理的顺序是:

稳定 instructions
稳定工具定义
稳定任务规则
动态用户状态
最新工具结果
当前请求

缓存写入价格高于普通输入。只有前缀会被复用时,写入才可能有收益。因此需要同时 观察读取率、写入率、前缀复用次数和写后未读比例。

六、迁移主指标:cost_per_success

先为任务定义可验收的“成功”:代码任务可要求测试、静态检查和补丁审计;检索 任务可要求关键结论带可访问来源;结构化提取可要求 schema 与抽样共同通过。

然后计算:

cost_per_success
= 所有尝试的模型费
+ 所有工具费
+ 外部服务费
+ 人工复核摊销
--------------------------------
成功任务数

对照表至少包含:

  • 首次成功率与严重错误数;
  • 单次成功成本;
  • P50/P95 端到端延迟;
  • 每次成功的重试、模型轮次、工具调用与输出 Token;
  • 缓存读取率、人工复核分钟数和升级模型分布。

七、用 100–500 个真实任务做 A/B

用真实任务和 cost_per_success 判断迁移

样本应覆盖低风险可验证、中等不确定性、高错误代价、长上下文、重工具调用和历史 尾部失败任务。在相同 Harness、工具预算和验证器下比较:

A:当前生产路由
B:Luna-first + 相同验证器 + 条件升级

通过条件不是“平均分不错”,而是成功率在容差内、P95 未超预算、 cost_per_success 稳定下降、严重错误为 0,且工具循环、人工复核和升级率没有 异常上升。

八、Luna-first,不是 Luna-only

Luna-first 的默认执行、条件升级与人工责任

低不确定性 + 可自动验证 + 高调用量
    -> Luna first

中等不确定性 + 用户可见 + 验收标准明确
    -> Luna / Terra A/B,失败时升级

高不确定性 + 高错误代价 + 难自动验证
    -> Terra / Sol 规划终审,Luna 执行可验证子任务

升级条件应能被系统观察:schema 或测试失败、来源冲突、置信不足、工具循环超限、 长上下文接近阈值且不可安全压缩,以及不可逆、财务、法律或安全风险。

九、30 天迁移节奏

  1. 第 1–3 天:导出模型、工具、重试和人工复核基线,统一成功定义。
  2. 第 4–10 天:低风险小流量对照,每日核对本地估算和真实账单。
  3. 第 11–20 天:纳入中等不确定性和长上下文,观察 P95 与尾部失败。
  4. 第 21–30 天:固化升级与回滚阈值,高风险任务保留 Terra/Sol。

任务量很小时,维护多模型路由的工程成本可能高于节省金额;继续使用单一强模型 是合理的更简单方案。自动验证器也不能替代高风险任务中的人工责任。

结论

可以精确说:同构 Luna Token 账单下降 80%。

必须通过实验回答:你的单次成功任务成本下降了多少。

Luna 的新价格让大量可验证任务具备 Luna-first 的经济性,但真正可持续的收益来自 成功定义、工具预算、上下文治理、真实任务 A/B、条件升级和可回滚的运行合同。

参考资料

  1. OpenAI:GPT-5.6 价格性能公告
  2. OpenAI Developers:GPT-5.6 Luna 模型卡
  3. OpenAI Developers:API Pricing
  4. OpenAI:GPT-5.6 效率说明