OpenAI 发布 GPT-5.6 构建者指南:同样的效果,账单从 33 美元降到 1.33 美元
- OpenAI 把一份给开发者的省钱手册摆了出来:同一道搜索测试考到 84 分,上一代花 33.27 美元,这一代最小的型号花 1.33 美元。
- 六家已经把 Agent 跑在线上的公司各交了一条实测数字,输入 token 少 21%、未缓存输入少 28%、成本降到十八分之一,改的全是配置,不是模型。
- 而官方图表里还藏着一条它自己没写进正文的:把推理档位关到底,账单不降反涨。
OpenAI 发布了一份给开发者的 GPT-5.6 构建者指南,主题是怎么把 Agent 的账单砍下来:型号选哪个、推理档位开多大、三个新的 API 开关怎么用,全是能直接照着改的配置。六家已经把 Agent 跑在线上的创业公司,各交了一条实测数字。
它推翻的是过去搭 Agent 的默认姿势,上最贵的旗舰模型,把推理拉满。这个姿势之所以成为默认,是因为过去只有旗舰扛得住长上下文和一大堆工具调用。到了 5.6 这一代,中小型号多想一会儿就能顶到上一代旗舰的水平,价钱只是零头。
全篇路线图:六处能今天就动手改的地方
省钱分两层。第一层是两个旋钮:推理档位、型号,改的是参数,一行配置的事。第二层是三个架构开关,外加一个缓存断点,改的是请求本身怎么组织。下面这张表就是全文的目录,前两行对应两个旋钮,后四行对应四个开关,每一行后面都有一节展开。
第一个旋钮:低档打赢上一代高档
从 GPT-5 那一代起,每代模型追的是同一件事:用更少的 token 干更长的活。5.6 继续这条线,Harness(模型外面那层调度代码:怎么发请求、怎么接工具、怎么循环)一个字不改,性能更强、花钱更少。
指南里给出的最直接的一条:在 Agents' Last Exam 这个 Agent 评测上,把 Harness 完全固定不动,GPT-5.6 Sol 开「低推理」的成绩超过了 GPT-5.5 开「高推理」。档位是花钱的主要旋钮,低档位打赢上一代高档位,等于同一件事的价钱直接掉一档。这一项指南没有给出具体分值。
能自己核对的对照在两张跑分图里。下面三组都是同一张图上的真实数据点,左边是上一代,右边是这一代:
两张图的成本量级差得远:搜索评测整套跑完只要几美元,编程指数整套要几百上千美元,题量和任务复杂度不同,别把两张图的金额横着比。上面每组对照都在同一张图内部。
省下来的到底是什么?是瞎折腾的那一部分。Hex 这家做数据分析的公司把模型丢进他们现成的 Harness 里,低推理档给出了他们见过最好的结果:
我们把 GPT-5.6 丢进现有的 Harness 里,低推理档给了我们最好的结果。它知道数据什么时候就是不存在,不会追着坏线索跑,用更少的 token 就走到了正确答案。
Izzy Miller,Hex 的 AI 研究负责人
「知道数据不存在」这句是关键。旧模型查不到东西时会换个关键词接着刨,每刨一轮,工具返回的内容都要当成输入 token 计费一次。会止损的模型省的正是这些空转的轮次。
往下调有效,但关到底反而更贵
降档能省钱,那把档位一路关到底是不是最省?把官方两张图里每个数据点摊开看,答案是不。
下面这个盘可以拨:选一个推理档位,四个型号的账单和分数同时跟着变。账单条的满格是 GPT-5.5 极高档跑完整套搜索评测的 33.27 美元,所有条都按这个尺子量。
而拨到最左边那一格,会看到跟直觉相反的东西。关掉推理并不省钱。两张图上各有一个证据:
- 搜索评测里的 Sol:关掉推理花 $1.97 拿 69.67 分;开到最低档只花 $0.50,拿 65.32 分。也就是说,关掉推理这个动作没省下钱,反而多花了 3.9 倍,换来的是多 4.3 分。
- 编程指数里的 Luna:关掉推理花 $123.66 拿 37.30 分;开到最低档花 $74.84,拿 42.40 分。这一组又贵又差,多花 65% 的钱,分数还低了 5.1 分。
另一头也有拐点。Luna 在搜索评测上从「极高」开到「顶格」,账单从 $1.33 涨到 $1.42,分数却从 84.04 掉到 83.25。档位开到顶,未必加分。
不让模型想,它就只能靠多调工具、多绕几轮来撞答案,而每一轮工具返回的内容都要当成输入 token 计费。思考本身要花钱,但它买的是「少走弯路」,这笔账在难任务上通常是划算的。
调档位的方向是从低往上试,看着账单和分数两条线一起走,走到拐点就停;而不是从顶格往下砍。最低档往往是性价比最高的那一格,最左边那一格(完全不推理)在这两张图上都不划算。
第二个旋钮:小型号能省 25 倍
档位这个旋钮拧完,第二个是换型号。GPT-5.6 家族有三个:Sol(旗舰)、Terra(中号)、Luna(小号)。
过去中小型号只配干边角料,原因是长上下文和大量工具调用它们扛不住,一旦任务链条拉长就掉链子。这一代变了,靠的是测试时计算。
让模型在回答之前多想一会儿,想的时间就是算力,也是钱。同一个学生交卷前多花十分钟检查,跟换一个更聪明的学生,这是两条不同的提分路子;小型号走的是前一条,模型本身没变大。
结果就是 Luna 和 Terra 常常能打到 GPT-5.4、GPT-5.5 的水平,价钱却低一大截。指南里点名的那组对照,来自 BrowseComp,一个专考「能不能搜出犄角旮旯里的冷门事实」的评测: