xAI 发布 Grok 4.6:性能追平 GPT-5.6 Sol,附提示词和使用指南
- xAI 发了 Grok 4.6,价格和上一代一样:输入每百万 token 2 美元、输出 6 美元。
- 综合分和 GPT-5.6 打平,但十项明细摊开看,拿第一最多的是另一个模型。
- 一位用了几周的工程师做了组对照实验:两页规格书和三句话,结果几乎一样;真正管用的是他加的另一句话。
Grok 4.6 发布,同价,主打能跑长任务的 Agent
xAI(马斯克旗下的 AI 公司)昨天发布了 Grok 4.6,在 4.5 的基础上重点做两件事:能长时间跑下去的 Agent,以及更有野心的交互和视觉活。它要解决的是「一个任务几十步走不完就散架」,查资料、分析信息、在一个代码库里连续改、把一个想法做成能用的应用,中途不掉线。
输入每百万 token 2 美元,输出 6 美元,和 4.5 持平。另有一个 fast 版本,价格翻倍(快多少没说)。
Cursor、Grok Build、官方 API,以及 OpenRouter、Vercel、Cloudflare 等。首周在 Grok Build 和 Cursor 里给双倍的包含用量。
训练做了什么
三步。第一步是比 4.5 更长的补充训练,喂的是筛选过的、模型自己生成的推理和高级技术概念数据,加上高质量工程数据,还换了更好的优化器和训练配方。第二步是用上一代的 Grok 4.5 把「标准解题过程」重新生成一遍,覆盖不同的推理档位、不同的 Agent 框架,以及 STEM、软件工程、知识工作等领域,再用模型自动挑掉有问题的过程。第三步是在大量能动手的环境里做强化学习(agentic RL),包括知识工作、通用编程,以及计算核心优化、网页开发、计算机辅助设计这些特定领域。
安全那一节透露的信号
安全措施随能力一起做了校准。值得留意的是官方点名的几个方向:漏洞修补、加速工程设计周期、增强 AI 研究,这几件都属于安全敏感区,写进来说明这些用途被明确放开了。部署前测试的规模被称为史上最广,另有部署后测试和第三方测试。
综合分追平 GPT-5.6,十项里 Fable 5 赢最多
这次主推的一句是「在 AA 智能指数(Artificial Analysis Intelligence Index)上与 GPT-5.6 Sol 打平」,GPT-5.6 Sol 是 OpenAI 当前的旗舰模型。这个指数是九个测试合成的一个综合分:
官方同时放了一张十项明细表。把它摊开数第一名,故事就不太一样了:
数一下第一名的归属:Fable 5 Max 拿了 5 项,Grok 4.6 拿了 3 项,GPT-5.6 Sol Max 拿了 2 项。所以「追平 GPT-5.6」这个说法只在那个九合一的综合分上成立,十项明细里赢得最多的是 Fable 5 Max。
Grok 4.6 强的方向集中在两块:知识工作和法律。知识工作那两项(GDPVal-AA 1753、AA-Briefcase 1577)都是第一;法律那项差距最夸张,它拿 15.8%,GPT-5.6 Sol Max 只有 2.5%,差了六倍多。
短板同样清楚:Terminal-Bench 只有 26%,GPT-5.6 是 34.6%、Fable 5 是 34.1%,落后八个多点。这项测的是在终端里干活的能力。官方的文字部分没提这一项,只在表格里能看到。
而相比自家上一代,进步是实打实的:Terminal-Bench 从 15.7% 到 26%,APEX-Agents 从 47.1% 到 57.5%,DeepSWE 从 54% 到 65.9%,AA-Briefcase 从 1313 到 1577。
一句提示词,比两页规格书更管用
官方在长任务里观察到一个变化:模型开始自己测自己,干完一步先检查自己的活,再往下走。
而在实测里,这个行为有一个能被显式要出来的开关,一句话。
做法是这样的:同一个「做个电子表格应用」的任务,给两个模型各跑两遍。一遍给的是两页规格书,工具栏每个按钮、每个快捷键、每个公式全写清楚;另一遍只给三句话:
两个结果几乎一模一样。真正改变结果的,是加上这一句:
加上它之后,模型会自己打开应用、沿着真实的用户路径点一遍、检查嵌套公式算得对不对,然后修掉它发现的问题。这是那几周里杠杆最高的一件事。
这个循环能转起来有个前提:模型的浏览器操作能力得够好。没有「能自己打开看一眼」这个能力,后面全都无从谈起。
跳过验证会怎样
反面例子来自后面那个 Excalidraw 项目:某次跑完,摘要读起来像是完成了,但新增视图这个功能实际上不工作。一句「跑一遍给我看」,才把那个坏掉的 import 暴露出来。
提示词的措辞没用,长度决定谁来做主
同一批实验还测了提示词风格,结论有三条。
长规格书并没有失效。他给过一份详细规格做反馈组件,包含会话捕获、服务端处理、云端 Agent 派发,模型端到端跟了下来,结构也合理。但有个具体毛病:除非你明确要求拆分,它会在组件里重复自己。
输出越难自己检查,越得你盯着
整份实测里最能迁移的一条判断在这儿:需要人工介入的地方,根源都是同一个,模型能不能验证自己的活。
所以实用的对策只有两条:要么给它一个「能看」的手段,要么接受这活得你自己检查。
同一个道理在难检查的输出上也成立。对一个 3D 场景说「改进材质」,毫无进展;换成下面这句,立刻见效:
五个项目实测:4.6 的第一版明显更完整
下面六段都是同一个提示词、在隔离的工作区里分别跑 4.5 和 4.6,左右并排录下来的,不是凭上个月的记忆。
跑了几天下来,视频是模型之间差距最大的地方,两个在网页应用上感觉旗鼓相当的模型,在这里可能差得很远。
摘要更密、响应更快,用法从异步回到同步
除了做出来的东西,用起来的手感也变了。
总结里塞的是真内容,而不是把任务重说一遍。运行过程中的短更新,足够判断要不要打断它。
动的文件少就安静,开始动很多文件才叙述。这个分寸的调校比想象中难,不过它仍然会说一些用不上的东西。
速度那条影响更大。4.5 也快,而 4.6 是又快又明显更聪明,这个组合把工作方式推回了同步:不再前置一大堆上下文然后等着,而是要一小块、看一眼、接着走;同一个会话里想转成长任务,说一声就行。
取舍在这儿:异步能在人不在的时候多干活,代价是丢掉线索、最后要冷着头审一个大 diff。真在乎结果的时候,同步那一侧更值得待。
它顺手接掉的杂活
几周里大部分是普通工作:替他导航网站(包括点进某个服务商的控制台创建 API key)、对运行中的应用做功能和视觉 QA、把收件箱收敛到真正需要回复的那几封、起草两个功能的发布推文,还用 Remotion 给它们做了发布视频。
他仍然亲自盯的地方
输出要按「好不好看」来评判的活,动效、3D、最后的打磨,他还是自己介入,因为这些要的是一张参考图加一个截图循环,而不是一段文字描述。另外他会把验收标准写下来,而不是相信一句「已完成」的总结。
他把 4.6 当默认模型的理由不是它某项最强:有些模型是尖的,在某一件事上极其出色,但日常工作不是某一件事。他要的是一个自己足够了解的模型,知道它怎么表现、可靠到能把事交出去、缺点熟到能下意识绕开。
提示词原句和使用指南,可以直接抄
下面这几句都来自那几周的实测,英文是原句,可以一字不改地用。
Verify the function and design after implementation, and keep on iterating and verifying until it's production ready.
加在任务描述的末尾。它会让模型自己打开应用、沿真实用户路径点一遍、检查计算对不对,再修掉发现的问题。这一句是那几周里杠杆最高的改动。
capture the current frame, list what's wrong with it, then fix only those things
run it and show me
第三句看着简单,但正是它暴露了一次「摘要说已完成、功能实际不工作」的情况,一个坏掉的 import。
Build a polished Sheets/Excel-style app in Next.js and an AI chat that can analyze the sheet. Use the Cursor SDK for all AI features. Preload a realistic sample workbook so it looks good immediately.
没用的说法
「好好干」这类催促措辞,加不加结果都差不多。同类的还有「一直做到完成」,它本来就会跑很久。
「改进材质」这种没有检查方式的要求,在 3D 场景上毫无进展。换成上面第②句才有效。
七条使用指南
怎么用上:入口、价格、首周双倍额度
入口有三类:Cursor、Grok Build、以及官方 API(console.x.ai),另外 OpenRouter、Vercel、Cloudflare 等也都能调到。
价格是输入每百万 token 2 美元、输出 6 美元,和 4.5 一样;fast 版本翻倍,但快多少没有说明。首周在 Grok Build 和 Cursor 里给双倍的包含用量。
Grok 4.6 发布:综合分打平 GPT-5.6,十项拆开赢家是另一个模型
价格没涨;一位工程师用了几周后做的对照实验,挖出一句比两页规格书还管用的提示词。
↓ 一页读完 · 有一张会动的图
xAI 发布 Grok 4.6,在 4.5 基础上重点做能长时间跑下去的 Agent(AI 智能体),以及更有野心的交互和视觉活。价格没变,Cursor、Grok Build、官方 API 当天都能用。
这次主推的一句是「与 GPT-5.6 Sol 打平」,AA 智能指数(Artificial Analysis 用九项测试合成的综合分)。把十项明细摊开数第一名,故事不一样。
Grok 4.6 强在知识工作和法律;短板在终端里干活,这一项官方文字部分没提,只在表格里能看到。跑分均为 xAI 自测,竞品数字取自各家公开材料里的最好成绩,没有第三方统一复测。
一位把 Grok 4.6 当日常主力用了几周的工程师做过一组对照实验:同一个电子表格应用任务,一遍给两页规格书(工具栏每个按钮、每个快捷键、每个公式全写清楚),一遍只给下面这三句话,两个结果几乎一样。
实现完之后验证功能和设计,持续迭代和验证,直到可以上生产。
加上它,模型会自己打开应用、点开真实用户路径、查嵌套公式对不对,修掉自己发现的问题,前提是它的浏览器操作能力够好。这和 xAI 在长任务里观察到的现象对上了:模型开始自己检查自己干完的活,再往下走;一边是 xAI 的观察,一边是用户能直接用的开关。同一批实验还发现,提示词的措辞和长度本身影响都不大,撬动结果的是这句验证要求。
需要人盯着的地方,都指向同一件事,模型能不能验证自己的活。网站最容易,3D 更难,视频和物理最难。
对 3D 场景说「改进材质」,没进展;换成「截下当前这一帧,列出哪里不对,然后只修这些」,立刻见效,给它一个能看的手段,问题就解决了一半。
和上一代一样
Fable5/Grok4.6/GPT5.6
落后八个多点
写满两页
配个 AI 聊天
持续迭代直到能上生产。
查公式对不对,修掉问题
实测来自 Eric Zakariasson
持续迭代直到能上生产。
