OpenAI 只打开两个 API 设置,GPT-5.6 Sol 在 ARC-AGI-3 的分数从 13.3% 涨到 38.3%
- OpenAI 复盘了一次自家模型「考砸」的经历:同一个 GPT-5.6 Sol、同一套评测题,只把两个 API 设置打开,ARC-AGI-3 公开题库的分数从 13.3% 涨到 38.3%。
- 问题出在跑模型的那套程序(业内叫 harness)上:每走完一步,模型写给自己看的私有思考被整段丢掉,下一步只能从零重新理解这个游戏。
- 第二个问题是上下文塞满就删掉最早的消息,连过去按了哪些键都在被挤出去,模型等于没有「过去」。
- 修法就两个开关:用 Responses API 把上一次响应的 ID 传回去,推理自动留住;再开 compaction,上下文到了阈值就压成一份浓缩摘要接着跑,不删开头。
- 省钱比涨分更夸张:最高档下每局输出 token 从 290 万降到 49 万;新程序在「高」档就拿到了旧程序拼到「最高」档的同样分数,token 差约 12 倍。
- ARC 自己 5 月那篇分析给的是另一套解释,三种「建不起世界模型」的失败模式;而经 ARC Prize 核验过的只有旧程序下的 13.33%(公开题库)和 7.78%(半私有题库)。
同一个模型,同一套题,分数差了近三倍
OpenAI 发了一篇极其具体的踩坑复盘:同一个 GPT-5.6 Sol、同一套评测题,只把两个 API 设置打开,分数从 13.3% 涨到 38.3%,每局烧掉的输出 token 还降到约六分之一。如果你在用 API 跑任何多步骤的任务,这两个开关的开关状态直接决定成绩和账单。
简单来说,过去看到一个模型跑分低,第一反应是「模型能力不行」;这次给出的答案是「跑模型的那套程序把模型的记忆掐掉了」。这套程序业内叫 harness。他们拿 ARC-AGI-3 这个不给说明书的解谜游戏评测做实验,五个推理强度档位各跑一遍。
之所以说「考砸」,是因为 Sol 在别的地方不是这个样子。它解决过图论里悬了几十年的循环双覆盖猜想,打通过宝可梦火红(Pokémon FireRed,纯看画面、不给任何游戏信息),在 Codex 里通关过杀戮尖塔(Slay the Spire),还打完了 Baba Is You 的前几关。沃顿商学院的 Ethan Mollick 放出的一段记录里,它在 Codex 里赢下了《杀戮尖塔 2》的每日随机挑战,而这款游戏在 Sol 的知识截止日之后才发售。
能打这些游戏,却在 25 局 2D 解谜小游戏上只拿一成多的分。下面这段左右对照的录像是同一款游戏(编号 cd82)、同一个 Sol:左边跑官方程序,右边跑 OpenAI 用 Responses API 重写的程序。这局游戏一共六关,在排行榜上没有任何前沿模型能过第一关;换了程序之后,六关全过。
这考试不给说明书,分数也不是「做对了几道题」
ARC-AGI-3 是 ARC Prize 做的评测,一共 135 个手工搭出来的小游戏环境,公开放出 25 个 demo,谁都能上 arcprize.org 自己玩。这个评测有一条设定贯穿始终:不给说明书。没有物件列表、没有规则说明、没有目标描述,也没有中间奖励分。
模型每走一步,收到的东西就下面这么点:一张 64×64 的格子图,每格是一个 0 到 15 的颜色编号;加一份能按的键,一共七个。
- RESET
- 重开一局
- ACTION1
- 上
- ACTION2
- 下
- ACTION3
- 左
- ACTION4
- 右
- ACTION5
- 确认 / 删除
- ACTION6
- 点某个坐标(x、y 各 0–63)
