产品发布 · 小互解读

xAI 发布 Grok 4.6:性能追平 GPT-5.6 Sol,附提示词和使用指南

价格没涨,十项明细里另有故事;文末附一位用了几周的工程师整理出的提示词原句和用法。
一分钟速览
  • xAI 发了 Grok 4.6,价格和上一代一样:输入每百万 token 2 美元、输出 6 美元。
  • 综合分和 GPT-5.6 打平,但十项明细摊开看,拿第一最多的是另一个模型。
  • 一位用了几周的工程师做了组对照实验:两页规格书和三句话,结果几乎一样;真正管用的是他加的另一句话。
跑分全部由 xAI 发布,竞品数字取自各家公开材料里「自报或公开可得的最好成绩」,没有第三方统一复测。本文引用的实测来自 Eric Zakariasson,他的 X 简介写着 @cursor_ai,而 Cursor 是这次发布的首发合作方之一(官方给了首周双倍额度),测试也主要在 Cursor 里进行,那是深度使用者的一手经验,不是无利益关系的独立评测。
发布

Grok 4.6 发布,同价,主打能跑长任务的 Agent

xAI(马斯克旗下的 AI 公司)昨天发布了 Grok 4.6,在 4.5 的基础上重点做两件事:能长时间跑下去的 Agent,以及更有野心的交互和视觉活。它要解决的是「一个任务几十步走不完就散架」,查资料、分析信息、在一个代码库里连续改、把一个想法做成能用的应用,中途不掉线。

xAI 的 Grok 4.6 官方发布片,46 秒。视频 / xAI
价格没变

输入每百万 token 2 美元,输出 6 美元,和 4.5 持平。另有一个 fast 版本,价格翻倍(快多少没说)。

当天就能用

Cursor、Grok Build、官方 API,以及 OpenRouter、Vercel、Cloudflare 等。首周在 Grok Build 和 Cursor 里给双倍的包含用量。

训练做了什么

三步。第一步是比 4.5 更长的补充训练,喂的是筛选过的、模型自己生成的推理和高级技术概念数据,加上高质量工程数据,还换了更好的优化器和训练配方。第二步是用上一代的 Grok 4.5 把「标准解题过程」重新生成一遍,覆盖不同的推理档位、不同的 Agent 框架,以及 STEM、软件工程、知识工作等领域,再用模型自动挑掉有问题的过程。第三步是在大量能动手的环境里做强化学习(agentic RL),包括知识工作、通用编程,以及计算核心优化、网页开发、计算机辅助设计这些特定领域。

为什么让上一代来生成教材:这些「解题过程」是拿来教新模型的样本。用 4.5 重新生成一遍,等于让上一届的优等生把步骤重写,再由自动检查挑掉写错的那些,比直接用旧教材干净,也比人工重写便宜。

安全那一节透露的信号

安全措施随能力一起做了校准。值得留意的是官方点名的几个方向:漏洞修补、加速工程设计周期、增强 AI 研究,这几件都属于安全敏感区,写进来说明这些用途被明确放开了。部署前测试的规模被称为史上最广,另有部署后测试和第三方测试。

跑分

综合分追平 GPT-5.6,十项里 Fable 5 赢最多

这次主推的一句是「在 AA 智能指数(Artificial Analysis Intelligence Index)上与 GPT-5.6 Sol 打平」,GPT-5.6 Sol 是 OpenAI 当前的旗舰模型。这个指数是九个测试合成的一个综合分:

Fable 5 Max
62
Grok 4.6
61
GPT-5.6 Sol Max
61
Grok 4.5 High
56
AA 智能指数:第三方机构 Artificial Analysis 把九个测试合成的综合分,像高考总分,能排个序,但看不出谁语文强谁数学强。数据 / xAI

官方同时放了一张十项明细表。把它摊开数第一名,故事就不太一样了:

测试
Grok 4.6
Grok 4.5
GPT-5.6 Sol
Fable 5 Max
AA 智能指数
61
56
61
62
GDPVal-AA v2 · 知识工作
1753
1526
1728
1741
CursorBench v3.2 · 编程
69.9%
66.7%
67.2%
70.5%
DeepSWE v1.1 · 编程
65.9%
54%
73%
70%
FrontierCode v1.1 · 编程
61.3%
56.6%
60.6%
64.9%
APEX-Agents · Agent
57.5%
47.1%
56.7%
59.2%
Terminal-Bench v3.0 · 终端
26%
15.7%
34.6%
34.1%
APEX-SWE · 软件工程
56.4%
53.6%
58.8%
AA-Briefcase · 知识工作
1577
1313
1502
1574
Harvey LAB · 法律
15.8%
12.9%
2.5%
11.3%
绿色是该行最高分。数据 / xAI;竞品分数取自各家公开材料里自报或公开可得的最好成绩。

数一下第一名的归属:Fable 5 Max 拿了 5 项,Grok 4.6 拿了 3 项,GPT-5.6 Sol Max 拿了 2 项。所以「追平 GPT-5.6」这个说法只在那个九合一的综合分上成立,十项明细里赢得最多的是 Fable 5 Max。

Grok 4.6 强的方向集中在两块:知识工作和法律。知识工作那两项(GDPVal-AA 1753、AA-Briefcase 1577)都是第一;法律那项差距最夸张,它拿 15.8%,GPT-5.6 Sol Max 只有 2.5%,差了六倍多。

站内有这个法律评测的完整解读
Harvey 开源了一个超过 1 亿 Token 的合成律师事务所档案库

短板同样清楚:Terminal-Bench 只有 26%,GPT-5.6 是 34.6%、Fable 5 是 34.1%,落后八个多点。这项测的是在终端里干活的能力。官方的文字部分没提这一项,只在表格里能看到。

而相比自家上一代,进步是实打实的:Terminal-Bench 从 15.7% 到 26%,APEX-Agents 从 47.1% 到 57.5%,DeepSWE 从 54% 到 65.9%,AA-Briefcase 从 1313 到 1577。

实测

一句提示词,比两页规格书更管用

官方在长任务里观察到一个变化:模型开始自己测自己,干完一步先检查自己的活,再往下走。

而在实测里,这个行为有一个能被显式要出来的开关,一句话。

做法是这样的:同一个「做个电子表格应用」的任务,给两个模型各跑两遍。一遍给的是两页规格书,工具栏每个按钮、每个快捷键、每个公式全写清楚;另一遍只给三句话

短提示词版本
用 Next.js 做一个精致的 Sheets/Excel 风格应用,配一个能分析表格的 AI 聊天。所有 AI 功能用 Cursor SDK。预置一个真实的示例工作簿,让它一打开就好看。

两个结果几乎一模一样。真正改变结果的,是加上这一句:

杠杆最高的那一句
Verify the function and design after implementation, and keep on iterating and verifying until it's production ready.
实现完之后验证功能和设计,持续迭代和验证,直到可以上生产。

加上它之后,模型会自己打开应用、沿着真实的用户路径点一遍、检查嵌套公式算得对不对,然后修掉它发现的问题。这是那几周里杠杆最高的一件事。

这个循环能转起来有个前提:模型的浏览器操作能力得够好。没有「能自己打开看一眼」这个能力,后面全都无从谈起。

两页规格书与三句话提示词的产出对比
两种提示词长度的产出对比。此后的每组对比都是同一个提示词在隔离的工作区里分别跑两个模型,不是凭上个月的记忆。图 / Eric Zakariasson

跳过验证会怎样

反面例子来自后面那个 Excalidraw 项目:某次跑完,摘要读起来像是完成了,但新增视图这个功能实际上不工作。一句「跑一遍给我看」,才把那个坏掉的 import 暴露出来。

提示词

提示词的措辞没用,长度决定谁来做主

同一批实验还测了提示词风格,结论有三条。

01
措辞几乎没有影响
像「好好干」(work very hard)这类说法,加不加结果都差不多。
02
长度有影响,但买到的是「具体性」
长提示词买的是精确,你确切知道要什么,就写下来。短提示词则是把决定权交给模型的品味。过去这个取舍支持「什么都写出来」,而 4.6 的品味够好了,短提示词加一句明确的偏好,通常就能落到不错的地方。
03
不用催它努力,但要说清什么叫「做完」
不必叫它「好好干」或者「一直做到完成」,它自己会跑很久。真正要紧的是把「做完」的标准讲明白,否则它替你定。

长规格书并没有失效。他给过一份详细规格做反馈组件,包含会话捕获、服务端处理、云端 Agent 派发,模型端到端跟了下来,结构也合理。但有个具体毛病:除非你明确要求拆分,它会在组件里重复自己。

边界

输出越难自己检查,越得你盯着

整份实测里最能迁移的一条判断在这儿:需要人工介入的地方,根源都是同一个,模型能不能验证自己的活。

网站 · 最容易 页面本身就是文本,能读、能截图、能跟自己的意图对照 3D · 更难 有一整个维度是读不出来的,截一张图回答不了 视频与物理 · 最难 时间是多出来的那一维,要抓一串帧再推理帧与帧之间的差别
本站按实测内容画的示意图。越往上,模型越看不见自己刚做出来的东西。

所以实用的对策只有两条:要么给它一个「能看」的手段,要么接受这活得你自己检查。

同一个道理在难检查的输出上也成立。对一个 3D 场景说「改进材质」,毫无进展;换成下面这句,立刻见效:

对难以检查的输出
截下当前这一帧,列出哪里不对,然后只修这些。
对比

五个项目实测:4.6 的第一版明显更完整

下面六段都是同一个提示词、在隔离的工作区里分别跑 4.5 和 4.6,左右并排录下来的,不是凭上个月的记忆。

帝国时代 2 复刻(16 秒):要求一个浏览器策略游戏,有经济、建造、战斗、战争迷雾、目标,以及新手不看说明就能读懂的界面。4.5 做出一个能用的平面原型;4.6 第一次就给了等距 3D 世界,界面和小地图都已经在位。视频 / Eric Zakariasson
MSN Messenger 复刻(14 秒):两个模型都认得这个参考对象。4.6 更精致,独立的对话窗口和「抖动窗口」都做了出来。视频 / Eric Zakariasson
电子表格 + 分析助手(14 秒):就是前面那个对照实验用的任务,两页规格书和三句话做出来的结果几乎一样,真正拉开差距的是那句「做完自己验证」。视频 / Eric Zakariasson
董事会幻灯片(29 秒):同一份虚构季报。两个都称职,差距在呈现不在分析,4.5 基本是把数字摆到幻灯片上,4.6 在结构和层级上下了功夫。视频 / Eric Zakariasson
Excalidraw 加演示模式(16 秒):真实开源代码库而不是空文件夹,要求保存命名视图、能重新排序、能当引导式演示放出来,提示词故意含糊。两个落点差不多,4.6 第一遍更注意细节,来回指正的次数更少。视频 / Eric Zakariasson
X SDK 发布片(84 秒,用 Remotion 做的):判断标准是有没有故事线、节奏撑不撑得住。两个都避开了多数模型的通病(全大写标题、方框文字、所有东西一起砸到屏幕上),4.6 更好看。视频 / Eric Zakariasson
Remotion 是什么:用写代码的方式做视频(他们自己叫 video as code),每一帧都是一个按帧号渲染的网页组件,整个项目最后由无头浏览器和 FFmpeg 编译成 MP4,视频本身存在代码仓库里。别人剪视频是拖时间轴,它是改代码。也正因为如此,它是最难交给模型的活:跑得通不等于做得对。

跑了几天下来,视频是模型之间差距最大的地方,两个在网页应用上感觉旗鼓相当的模型,在这里可能差得很远。

手感

摘要更密、响应更快,用法从异步回到同步

除了做出来的东西,用起来的手感也变了。

摘要里是信息,不是复述

总结里塞的是真内容,而不是把任务重说一遍。运行过程中的短更新,足够判断要不要打断它。

小改动时它不吭声

动的文件少就安静,开始动很多文件才叙述。这个分寸的调校比想象中难,不过它仍然会说一些用不上的东西。

速度那条影响更大。4.5 也快,而 4.6 是又快又明显更聪明,这个组合把工作方式推回了同步:不再前置一大堆上下文然后等着,而是要一小块、看一眼、接着走;同一个会话里想转成长任务,说一声就行。

取舍在这儿:异步能在人不在的时候多干活,代价是丢掉线索、最后要冷着头审一个大 diff。真在乎结果的时候,同步那一侧更值得待。

它顺手接掉的杂活

几周里大部分是普通工作:替他导航网站(包括点进某个服务商的控制台创建 API key)、对运行中的应用做功能和视觉 QA、把收件箱收敛到真正需要回复的那几封、起草两个功能的发布推文,还用 Remotion 给它们做了发布视频。

他仍然亲自盯的地方

输出要按「好不好看」来评判的活,动效、3D、最后的打磨,他还是自己介入,因为这些要的是一张参考图加一个截图循环,而不是一段文字描述。另外他会把验收标准写下来,而不是相信一句「已完成」的总结。

他把 4.6 当默认模型的理由不是它某项最强:有些模型是尖的,在某一件事上极其出色,但日常工作不是某一件事。他要的是一个自己足够了解的模型,知道它怎么表现、可靠到能把事交出去、缺点熟到能下意识绕开。

可抄走的

提示词原句和使用指南,可以直接抄

下面这几句都来自那几周的实测,英文是原句,可以一字不改地用。

① 最有用的一句:让它自己验证
Verify the function and design after implementation, and keep on iterating and verifying until it's production ready.
实现完之后验证功能和设计,持续迭代和验证,直到可以上生产。

加在任务描述的末尾。它会让模型自己打开应用、沿真实用户路径点一遍、检查计算对不对,再修掉发现的问题。这一句是那几周里杠杆最高的改动。

② 让它先看再改(用于难以检查的输出,如 3D、动效)
capture the current frame, list what's wrong with it, then fix only those things
截下当前这一帧,列出哪里不对,然后只修这些。
③ 怀疑它没做完时的一句
run it and show me
跑一遍给我看。

第三句看着简单,但正是它暴露了一次「摘要说已完成、功能实际不工作」的情况,一个坏掉的 import。

④ 短提示词长什么样(他用来做对照实验的那三句)
Build a polished Sheets/Excel-style app in Next.js and an AI chat that can analyze the sheet. Use the Cursor SDK for all AI features. Preload a realistic sample workbook so it looks good immediately.
用 Next.js 做一个精致的 Sheets/Excel 风格应用,配一个能分析表格的 AI 聊天。所有 AI 功能用 Cursor SDK。预置一个真实的示例工作簿,让它一打开就好看。

没用的说法

⛔ work very hard

「好好干」这类催促措辞,加不加结果都差不多。同类的还有「一直做到完成」,它本来就会跑很久。

⛔ Improve the textures

「改进材质」这种没有检查方式的要求,在 3D 场景上毫无进展。换成上面第②句才有效。

七条使用指南

01
把「做完」的标准写下来
不写,它就替你定。这比催它努力重要得多。
02
短提示词加一句明确偏好,通常就够
长提示词买的是精确度:确切知道要什么就写下来;否则把决定权交给模型的品味,结果往往也不差。
03
长规格书照样能用,但要它拆组件
详细规格能被端到端跟下来,结构也合理;只是不明说的话,它会在组件里重复自己。
04
动效、3D、最终打磨,给参考图不给描述
这类活要的是一张参考图加一个截图循环,一段文字描述不够。
05
别信「已完成」,让它跑给你看
摘要说完成了不等于真完成。把验收标准写下来,比读总结可靠。
06
改成小步同步,别一次塞满上下文
要一小块、看一眼、接着走。同一个会话里想转长任务,说一声就行。
07
先问它能不能看见自己的产出
网页它能读能截图,所以放手;3D 和视频它看不全,那部分的检查得你自己来。
上手

怎么用上:入口、价格、首周双倍额度

入口有三类:CursorGrok Build、以及官方 API(console.x.ai),另外 OpenRouter、Vercel、Cloudflare 等也都能调到。

价格是输入每百万 token 2 美元、输出 6 美元,和 4.5 一样;fast 版本翻倍,但快多少没有说明。首周在 Grok Build 和 Cursor 里给双倍的包含用量。

🧰 上手卡 · Grok 4.6
价格输入 $2 / 输出 $6 每百万 token,fast 版翻倍
门槛Cursor、Grok Build、API 及 OpenRouter/Vercel/Cloudflare 均可用;首周双倍包含用量
✅ 从这篇能直接抄走的三件事
同价位下相比上一代全线提升,强在知识工作和法律,短板在终端里干活。真正能拿走的是那句让它自己验证的提示词,以及一条判断:模型越看不见自己的产出,你越得盯着。
来源
Introducing Grok 4.6xAI·官方发布页·2026-08-12
本站说明
跑分与价格来自 xAI 官方发布页,竞品分数取自各家公开材料里自报或公开可得的最好成绩,无第三方统一复测。实测内容、五组项目对比图与提示词原句来自 Eric Zakariasson 的公开长文,其 X 简介标注为 @cursor_ai,Cursor 为本次发布的首发合作方之一。「自我验证难度阶梯」为本站按实测内容所画示意图。官方 46 秒演示视频因来源站限制未能引用。