研究解读 · 小互解读

OpenAI 只打开两个 API 设置,GPT-5.6 Sol 在 ARC-AGI-3 的分数从 13.3% 涨到 38.3%

模型没换,换的是跑模型的那套程序:保留私有推理 + 用压缩取代删除,每局输出 token 降到约六分之一。
一分钟速览
  • OpenAI 复盘了一次自家模型「考砸」的经历:同一个 GPT-5.6 Sol、同一套评测题,只把两个 API 设置打开,ARC-AGI-3 公开题库的分数从 13.3% 涨到 38.3%。
  • 问题出在跑模型的那套程序(业内叫 harness)上:每走完一步,模型写给自己看的私有思考被整段丢掉,下一步只能从零重新理解这个游戏。
  • 第二个问题是上下文塞满就删掉最早的消息,连过去按了哪些键都在被挤出去,模型等于没有「过去」。
  • 修法就两个开关:用 Responses API 把上一次响应的 ID 传回去,推理自动留住;再开 compaction,上下文到了阈值就压成一份浓缩摘要接着跑,不删开头。
  • 省钱比涨分更夸张:最高档下每局输出 token 从 290 万降到 49 万;新程序在「高」档就拿到了旧程序拼到「最高」档的同样分数,token 差约 12 倍。
  • ARC 自己 5 月那篇分析给的是另一套解释,三种「建不起世界模型」的失败模式;而经 ARC Prize 核验过的只有旧程序下的 13.33%(公开题库)和 7.78%(半私有题库)。
⚑ 材料来自 OpenAI 官方博客,讲的是自家模型与自家接口,38.3% 这个成绩是 OpenAI 自己跑出来的。经 ARC Prize 独立核验的成绩只有官方程序下的 13.33% 与 7.78%,读数时可留意这条边界。文末列了本站另外去核的几处出处。
开场

同一个模型,同一套题,分数差了近三倍

OpenAI 发了一篇极其具体的踩坑复盘:同一个 GPT-5.6 Sol、同一套评测题,只把两个 API 设置打开,分数从 13.3% 涨到 38.3%,每局烧掉的输出 token 还降到约六分之一。如果你在用 API 跑任何多步骤的任务,这两个开关的开关状态直接决定成绩和账单。

简单来说,过去看到一个模型跑分低,第一反应是「模型能力不行」;这次给出的答案是「跑模型的那套程序把模型的记忆掐掉了」。这套程序业内叫 harness。他们拿 ARC-AGI-3 这个不给说明书的解谜游戏评测做实验,五个推理强度档位各跑一遍。

不知道 harness 是什么?
AI 自我进化,先改模型外面的外壳:Lilian Weng 讲透 harness 工程
跑模型的这套外部程序,业内叫 harness。它到底管什么、能做到什么程度,那篇讲透了。
13.3 → 38.3%ARC-AGI-3 公开题库分数,最高推理档
290 → 49 万每局输出 token,降到约六分之一
48%人类测试者平均分(OpenAI 按公开对局日志估算)

之所以说「考砸」,是因为 Sol 在别的地方不是这个样子。它解决过图论里悬了几十年的循环双覆盖猜想,打通过宝可梦火红(Pokémon FireRed,纯看画面、不给任何游戏信息),在 Codex 里通关过杀戮尖塔(Slay the Spire),还打完了 Baba Is You 的前几关。沃顿商学院的 Ethan Mollick 放出的一段记录里,它在 Codex 里赢下了《杀戮尖塔 2》的每日随机挑战,而这款游戏在 Sol 的知识截止日之后才发售。

Ethan Mollick 展示 GPT-5.6 Sol 在 Codex 里完成《杀戮尖塔 2》每日随机挑战的记录
Ethan Mollick 展示 GPT-5.6 Sol 在 Codex 里赢下《杀戮尖塔 2》的每日随机挑战。这款游戏发售于 Sol 的知识截止日之后,也就是说它没在训练数据里见过这个游戏。图片来源:OpenAI 博客引用的 Ethan Mollick 帖子。

能打这些游戏,却在 25 局 2D 解谜小游戏上只拿一成多的分。下面这段左右对照的录像是同一款游戏(编号 cd82)、同一个 Sol:左边跑官方程序,右边跑 OpenAI 用 Responses API 重写的程序。这局游戏一共六关,在排行榜上没有任何前沿模型能过第一关;换了程序之后,六关全过。

加速播放的对局录像。左边是官方程序,右边是保留推理并开启压缩的 Responses API 程序,模型同为 GPT-5.6 Sol、最高推理档。两侧各带三个计数器:走了多少步、过了几关、烧了多少输出 token。视频来源:OpenAI。
两个分数别看混:7.78% 和 13.33% 都是官方程序、最高推理档下的成绩,差别只在考的题库不同:7.78% 出自半私有题库,13.33% 出自公开题库,两个数都经过 ARC Prize 核验。本文后面拿来对比的 38.3%,跑的是公开题库,所以对应的基准是 13.33%。
考试规则

这考试不给说明书,分数也不是「做对了几道题」

ARC-AGI-3 是 ARC Prize 做的评测,一共 135 个手工搭出来的小游戏环境,公开放出 25 个 demo,谁都能上 arcprize.org 自己玩。这个评测有一条设定贯穿始终:不给说明书。没有物件列表、没有规则说明、没有目标描述,也没有中间奖励分。

模型每走一步,收到的东西就下面这么点:一张 64×64 的格子图,每格是一个 0 到 15 的颜色编号;加一份能按的键,一共七个。

它看到的
一张 64×64 的格子图,每格是一个 0 到 15 的颜色编号
它能按的
RESET
重开一局
ACTION1
ACTION2
ACTION3
ACTION4
ACTION5
确认 / 删除
ACTION6
点某个坐标(x、y 各 0–63)
本站画的示意图。左边格子是随手排的色块示意,不是真实关卡;右边七个键的名称和作用照抄 ARC 开源实现里的定义。每个游戏用得上哪几个键也不告诉模型,得自己试出来。