深度 · 小互解读

OpenAI 发布 GPT-5.6 构建者指南:同样的效果,账单从 33 美元降到 1.33 美元

六家线上跑 Agent 的创业公司交出实测数据;官方图表里还藏着一条没写进正文的:推理档位关到底,反而更贵。
一分钟速览
  • OpenAI 把一份给开发者的省钱手册摆了出来:同一道搜索测试考到 84 分,上一代花 33.27 美元,这一代最小的型号花 1.33 美元。
  • 六家已经把 Agent 跑在线上的公司各交了一条实测数字,输入 token 少 21%、未缓存输入少 28%、成本降到十八分之一,改的全是配置,不是模型。
  • 而官方图表里还藏着一条它自己没写进正文的:把推理档位关到底,账单不降反涨。
这是 OpenAI 自己发的材料。文中的跑分、成本和六段客户评价都由 OpenAI 提供并挑选,本文另外补读了五份官方 API 文档,把指南只写了一两句的机制补全,凡是补来的都标了出处。
开篇

OpenAI 发布了一份给开发者的 GPT-5.6 构建者指南,主题是怎么把 Agent 的账单砍下来:型号选哪个、推理档位开多大、三个新的 API 开关怎么用,全是能直接照着改的配置。六家已经把 Agent 跑在线上的创业公司,各交了一条实测数字。

它推翻的是过去搭 Agent 的默认姿势,上最贵的旗舰模型,把推理拉满。这个姿势之所以成为默认,是因为过去只有旗舰扛得住长上下文和一大堆工具调用。到了 5.6 这一代,中小型号多想一会儿就能顶到上一代旗舰的水平,价钱只是零头。

GPT-5.6 本身怎么回事,站内有发布解读
OpenAI 正式发布 GPT-5.6:综合智能跑分逼近 Claude Fable 5,成本减半,ChatGPT、Codex 合并

全篇路线图:六处能今天就动手改的地方

省钱分两层。第一层是两个旋钮:推理档位、型号,改的是参数,一行配置的事。第二层是三个架构开关,外加一个缓存断点,改的是请求本身怎么组织。下面这张表就是全文的目录,前两行对应两个旋钮,后四行对应四个开关,每一行后面都有一节展开。

#
改什么
官方给的数字
1
推理档位从默认往下调一档,但别一路关到底
低档打赢上一代高档
2
流程里机械的那一步换成小型号 Terra 或 Luna
$33.27 → $1.33同一分数带
3
长任务打开持久化推理和原生压缩
13.3% → 38.3%token 还少 6 倍
4
工具返回一堆数据时,让模型写代码在外面筛完再进来
少 21%输入 token
5
能拆开的活派给子 Agent 并行干
默认 3 个并发子 Agent
6
稳定的 prompt 前缀钉一个缓存断点
少 28%未缓存输入
前两行是选型号和调档位,后四行是架构层面的改动。每一行后面都有一节展开,含参数名和取值。
旋钮

第一个旋钮:低档打赢上一代高档

从 GPT-5 那一代起,每代模型追的是同一件事:用更少的 token 干更长的活。5.6 继续这条线,Harness(模型外面那层调度代码:怎么发请求、怎么接工具、怎么循环)一个字不改,性能更强、花钱更少。

指南里给出的最直接的一条:在 Agents' Last Exam 这个 Agent 评测上,把 Harness 完全固定不动,GPT-5.6 Sol 开「低推理」的成绩超过了 GPT-5.5 开「高推理」。档位是花钱的主要旋钮,低档位打赢上一代高档位,等于同一件事的价钱直接掉一档。这一项指南没有给出具体分值。

GPT-5.6 SolGPT-5.6 TerraGPT-5.6 LunaGPT-5.5Claude Fable 5Claude Opus 4.8Gemini 3.1 Pro Preview$0$1,000$2,000$3,000API cost (USD)4050607080Index score
官方原图。每个数据点的成本与得分逐个取自原文图表的无障碍标签(非估读),本站按原图同一坐标系、同一官方配色重绘。横轴是跑完整套评测的 API 总花费,纵轴是编程指数得分;同一条线上的点,是同一个模型的六个推理档位。GPT-5.6 那三条线全部挤在左上角,右上角那个孤零零的方块是 Claude Fable 5 顶档,花了 $3,771.84。

能自己核对的对照在两张跑分图里。下面三组都是同一张图上的真实数据点,左边是上一代,右边是这一代:

BROWSECOMP · 搜冷门事实的能力
GPT-5.5 极高档(Xhigh)
84.36 分 跑完整套 $33.27
GPT-5.6 Sol 中档(Medium)
83.41 分 跑完整套 $2.05
分数低 0.95 分,账单少 94%。这一代用中档就够到了上一代最贵那一档的位置。
编程指数 · ARTIFICIAL ANALYSIS CODING INDEX
GPT-5.5 极高档(Xhigh)
76.40 分 跑完整套 $1,714.28
GPT-5.6 Terra 顶档(Max)
77.40 分 跑完整套 $941.72
中号型号的顶档,分数反超上一代旗舰最贵那一档 1.0 分,账单少 45%。
编程指数 · 小型号对上一代旗舰
GPT-5.5 高档(High)
72.50 分 跑完整套 $939.57
GPT-5.6 Luna 顶档(Max)
74.60 分 跑完整套 $537.40
最小的型号开到顶,分数比上一代旗舰的高档还高 2.1 分,账单少 43%。

两张图的成本量级差得远:搜索评测整套跑完只要几美元,编程指数整套要几百上千美元,题量和任务复杂度不同,别把两张图的金额横着比。上面每组对照都在同一张图内部。

省下来的到底是什么?是瞎折腾的那一部分。Hex 这家做数据分析的公司把模型丢进他们现成的 Harness 里,低推理档给出了他们见过最好的结果:

我们把 GPT-5.6 丢进现有的 Harness 里,低推理档给了我们最好的结果。它知道数据什么时候就是不存在,不会追着坏线索跑,用更少的 token 就走到了正确答案。

Izzy Miller,Hex 的 AI 研究负责人

「知道数据不存在」这句是关键。旧模型查不到东西时会换个关键词接着刨,每刨一轮,工具返回的内容都要当成输入 token 计费一次。会止损的模型省的正是这些空转的轮次。

往下调有效,但关到底反而更贵

降档能省钱,那把档位一路关到底是不是最省?把官方两张图里每个数据点摊开看,答案是不。

下面这个盘可以拨:选一个推理档位,四个型号的账单和分数同时跟着变。账单条的满格是 GPT-5.5 极高档跑完整套搜索评测的 33.27 美元,所有条都按这个尺子量。

BROWSECOMP · 拨一格看四个型号怎么变
GPT-5.6 Sol旗舰
账单
$1.97
分数
69.67
账单
$0.50
分数
65.32
账单
$2.05
分数
83.41
账单
$3.48
分数
87.52
账单
$4.59
分数
88.78
账单
$6.36
分数
90.36
GPT-5.6 Terra中号
官方图上没给这一档。
账单
$0.20
分数
50.47
账单
$0.47
分数
67.38
账单
$1.53
分数
79.30
账单
$1.85
分数
81.52
账单
$3.12
分数
87.52
GPT-5.6 Luna小号
官方图上没给这一档。
账单
$0.08
分数
45.73
账单
$0.23
分数
58.85
账单
$1.03
分数
80.02
账单
$1.33
分数
84.04
账单
$1.42
分数
83.25
GPT-5.5上一代旗舰
账单
$1.42
分数
34.68
账单
$2.72
分数
57.82
账单
$18.95
分数
78.12
账单
$30.02
分数
83.89
账单
$33.27
分数
84.36
官方图上没给这一档。
拨到「极高」那一格看一眼:最下面一行的账单条拉满了整条轨道($33.27),Luna 那行细得几乎看不见($1.33),两行的分数条却一样高。这就是这份指南想让你看到的那件事。

而拨到最左边那一格,会看到跟直觉相反的东西。关掉推理并不省钱。两张图上各有一个证据:

  • 搜索评测里的 Sol:关掉推理花 $1.97 拿 69.67 分;开到最低档只花 $0.50,拿 65.32 分。也就是说,关掉推理这个动作没省下钱,反而多花了 3.9 倍,换来的是多 4.3 分。
  • 编程指数里的 Luna:关掉推理花 $123.66 拿 37.30 分;开到最低档花 $74.84,拿 42.40 分。这一组又贵又差,多花 65% 的钱,分数还低了 5.1 分。

另一头也有拐点。Luna 在搜索评测上从「极高」开到「顶格」,账单从 $1.33 涨到 $1.42,分数却从 84.04 掉到 83.25。档位开到顶,未必加分。

为什么会这样

不让模型想,它就只能靠多调工具、多绕几轮来撞答案,而每一轮工具返回的内容都要当成输入 token 计费。思考本身要花钱,但它买的是「少走弯路」,这笔账在难任务上通常是划算的。

动手处

调档位的方向是从低往上试,看着账单和分数两条线一起走,走到拐点就停;而不是从顶格往下砍。最低档往往是性价比最高的那一格,最左边那一格(完全不推理)在这两张图上都不划算。

旋钮

第二个旋钮:小型号能省 25 倍

档位这个旋钮拧完,第二个是换型号。GPT-5.6 家族有三个:Sol(旗舰)、Terra(中号)、Luna(小号)。

过去中小型号只配干边角料,原因是长上下文和大量工具调用它们扛不住,一旦任务链条拉长就掉链子。这一代变了,靠的是测试时计算。

测试时计算 test-time compute

让模型在回答之前多想一会儿,想的时间就是算力,也是钱。同一个学生交卷前多花十分钟检查,跟换一个更聪明的学生,这是两条不同的提分路子;小型号走的是前一条,模型本身没变大。

结果就是 Luna 和 Terra 常常能打到 GPT-5.4、GPT-5.5 的水平,价钱却低一大截。指南里点名的那组对照,来自 BrowseComp,一个专考「能不能搜出犄角旮旯里的冷门事实」的评测:

GPT-5.5 · 极高档 三个月前84.36 分
$33.27
GPT-5.6 Luna · 极高档 最小的那个型号84.04 分
$1.33
分数差 0.32 分,账单差 25 倍。两条都是跑完整套 BrowseComp 题目的总花费。
GPT-5.6 SolGPT-5.6 Sol UltraGPT-5.6 TerraGPT-5.6 LunaGPT-5.5Claude Mythos PreviewClaude Opus 4.8Gemini 3.1 Pro Preview$0$7$14$21$28$35API cost (USD)30%50%70%90%Score
官方原图。每个数据点的成本与得分逐个取自原文图表的无障碍标签(非估读),本站按原图同一坐标系、同一官方配色重绘。同一套图放到搜索评测上,横轴整个只有 35 美元宽。GPT-5.6 三条线全部压在最左边 7 美元以内,而上一代那条粉线一路拉到最右端。三条横向虚线是竞品成绩(图上只给了分数,没给对应成本),右上那颗星是多 Agent 的 ultra 档。