一、数字说话:性能持平,成本相差 25 倍
过去选模型,逻辑差不多是固定的。要处理长上下文,要调工具,就用旗舰,推理强度拉满,成本高一点也认了。到 GPT-5.6 这一代,这件事开始松动。Luna 和 Terra 这类成本更低的模型,加上足够的测试时计算,已经能在不少场景里追到 GPT-5.4 和 5.5 附近,花的钱却少得多。
先说两个最直接的数字。
BrowseComp 是测试模型搜索冷门事实能力的基准。GPT-5.5 在 Extra High 推理强度下拿到 84.36% 的得分,成本 33.27 美元。GPT-5.6 Luna 同样开 Extra High,得分 84.04%,成本只有 1.33 美元。性能几乎一样,成本大约差了 25 倍。而且这是降价前的数据。
另一个变化发生在 ARC-AGI-3 上。GPT-5.6 Sol 用标准评测框架跑,得分只有 13.3%。启用保留式推理和压缩之后,分数升到 38.3%,输出 token 反而减少了大约 6 倍。模型本身没有改,只是推理架构做了调整。这个结果比很多模型升级带来的收益还大,也解释了为什么这篇文章说,最实际的改变在 API 原语,而不是模型权重。
二、三大 API 原语:推理持久化、多智能体编排、程序化工具调用
OpenAI 在 Responses API 里加了三个新的原语,都指向智能体场景。
第一个是推理持久化。简单说,推理过程可以在模型轮次之间保留下来,再配合原生压缩,把长时间对话压住。好处是模型在长任务里不容易丢上下文,也不需要每轮都重建之前的状态。ARC-AGI-3 上接近三倍的提升,主要就来自这里。
第二个是原生多智能体编排。复杂且能并行的任务,可以把推理和行动拆到多个子智能体上,主智能体负责分派和汇总。Obvious 的联合创始人 Jon Bell 说,他们一次给 GPT-5.6 抛了六份规格说明,同时写作、构建和讨论,它全程都跟住了,质量没有垮。
第三个是程序化工具调用,也是最底层的改动。过去模型要对上下文窗口里的每个中间结果都推理一遍,现在它可以写 JavaScript 来编排工具,把独立的调用并行跑起来,在上下文窗口外处理输出。模型只把判断力用在该用的地方。Rogo 在金融研究场景里试过,输入 token 使用量减少了 21%。
这些变化叠加起来,模型选择的逻辑就变了。
三、场景落地:从文档提取到浏览器自动化,Luna 的性价比突围
高吞吐、延迟敏感的场景,Luna 和 Terra 足够用。长周期复杂推理,还是交给 Sol,因为架构优化空间大。文档理解和信息提取,Luna 能以大概十八分之一的成本保住 98% 的提取准确率。浏览器自动化,Luna 的任务完成率 78%,成本 14 美元,对比之下 SOTA 方案要 235 美元。代码探索和决策建模,Luna 能把成本降低 64%,响应时间缩短 90%,F1 还提升了 5%。
一个常见做法是让 Sol 负责规划和决策,Luna 去执行那些已经明确的编码、测试和评估环节。
提示词缓存也是个经常被忽略的成本优化点。缓存 TTL 现在延长到至少 30 分钟,而且可以在上下文窗口内确定性设置缓存断点。Ploy 公司给一个共享的 29000 token 提示词加了缓存断点后,未缓存输入减少了 28%。Ploy 的工程师 Lorenzo Gentile 说,30 分钟的缓存窗口意味着智能体可以在多次运行里复用同一段上下文,不用每次都从头来。
整体看下来,这篇文章真正想说的不是 GPT-5.6 有多强,而是智能体的成本结构变了。过去那些每步都要前沿模型扛着的场景,现在可以用更小的模型、不同的推理强度和更合理的架构搭出来,结果差不多,甚至更好。重点不是选最贵的那个,而是在正确的位置用正确的模型,再让架构去匹配任务。
四、被忽视的缓存优化:30 分钟 TTL 与确定性断点
过去选模型,逻辑差不多是固定的。要处理长上下文,要调工具,就用旗舰,推理强度拉满,成本高一点也认了。到 GPT-5.6 这一代,这件事开始松动。Luna 和 Terra 这类成本更低的模型,加上足够的测试时计算,已经能在不少场景里追到 GPT-5.4 和 5.5 附近,花的钱却少得多。
先说两个最直接的数字。
BrowseComp 是测试模型搜索冷门事实能力的基准。GPT-5.5 在 Extra High 推理强度下拿到 84.36% 的得分,成本 33.27 美元。GPT-5.6 Luna 同样开 Extra High,得分 84.04%,成本只有 1.33 美元。性能几乎一样,成本大约差了 25 倍。而且这是降价前的数据。
另一个变化发生在 ARC-AGI-3 上。GPT-5.6 Sol 用标准评测框架跑,得分只有 13.3%。启用保留式推理和压缩之后,分数升到 38.3%,输出 token 反而减少了大约 6 倍。模型本身没有改,只是推理架构做了调整。这个结果比很多模型升级带来的收益还大,也解释了为什么这篇文章说,最实际的改变在 API 原语,而不是模型权重。
OpenAI 在 Responses API 里加了三个新的原语,都指向智能体场景。
第一个是推理持久化。简单说,推理过程可以在模型轮次之间保留下来,再配合原生压缩,把长时间对话压住。好处是模型在长任务里不容易丢上下文,也不需要每轮都重建之前的状态。ARC-AGI-3 上接近三倍的提升,主要就来自这里。
第二个是原生多智能体编排。复杂且能并行的任务,可以把推理和行动拆到多个子智能体上,主智能体负责分派和汇总。Obvious 的联合创始人 Jon Bell 说,他们一次给 GPT-5.6 抛了六份规格说明,同时写作、构建和讨论,它全程都跟住了,质量没有垮。
第三个是程序化工具调用,也是最底层的改动。过去模型要对上下文窗口里的每个中间结果都推理一遍,现在它可以写 JavaScript 来编排工具,把独立的调用并行跑起来,在上下文窗口外处理输出。模型只把判断力用在该用的地方。Rogo 在金融研究场景里试过,输入 token 使用量减少了 21%。
五、结论:正确的位置用正确的模型,让架构匹配任务
这些变化叠加起来,模型选择的逻辑就变了。
高吞吐、延迟敏感的场景,Luna 和 Terra 足够用。长周期复杂推理,还是交给 Sol,因为架构优化空间大。文档理解和信息提取,Luna 能以大概十八分之一的成本保住 98% 的提取准确率。浏览器自动化,Luna 的任务完成率 78%,成本 14 美元,对比之下 SOTA 方案要 235 美元。代码探索和决策建模,Luna 能把成本降低 64%,响应时间缩短 90%,F1 还提升了 5%。
一个常见做法是让 Sol 负责规划和决策,Luna 去执行那些已经明确的编码、测试和评估环节。
提示词缓存也是个经常被忽略的成本优化点。缓存 TTL 现在延长到至少 30 分钟,而且可以在上下文窗口内确定性设置缓存断点。Ploy 公司给一个共享的 29000 token 提示词加了缓存断点后,未缓存输入减少了 28%。Ploy 的工程师 Lorenzo Gentile 说,30 分钟的缓存窗口意味着智能体可以在多次运行里复用同一段上下文,不用每次都从头来。
智能体的成本结构变了。过去那些每步都要前沿模型扛着的场景,现在可以用更小的模型、不同的推理强度和更合理的架构搭出来,结果差不多,甚至更好。重点不是选最贵的那个,而是在正确的位置用正确的模型,再让架构去匹配任务。