产品发布 · 小互解读

Google 发布 Gemini 3.7 Flash:没有重新训练 只是更换了推理算法 价格砍半大促销

三周前刚发过上一代。这次价格砍到一半,但那是限时价,年底到期。
一分钟速览
  • Google 隔了三周就发下一代 Flash,但这三周里它没重新训模型,换掉的只有推理那一层算法。
  • 20 项官方跑分里它拿了 9 项第一,价格不到 Claude Sonnet 5 的四成;不过有一项它比自己上一代还退了。
  • 「半价」这两个字后面跟着一个日期,看漏了,明年一月你的账单会翻倍。
本文的跑分、价格和演示全部来自 Google 自己发布的博客与官方模型卡,成绩由 Google 自己测、对手也由 Google 挑选和呈现,本站没有独立复现。
发布

Gemini 3.7 Flash 发布了什么

Google 发布了 Gemini 3.7 Flash,一款专门拿来跑编程和 Agent 的干活模型旗舰模型像请专家会诊,出诊费按次算;干活模型像雇个全职助理,单次没那么强,但你付得起让他一直干。(workhorse model):旗舰负责刷榜,它负责跑量,便宜、快、够用,一天调几万次也扛得住。

它距上一代 Gemini 3.6 Flash 只隔了三周,价格砍到一半,编程、知识工作、网页开发三条线上的成绩全面往上抬。

三周
距上一代发布
9 / 20
官方跑分里排第一的项数
0.75 / 3.75
每百万输入 / 输出字,美元
不到四成
价格只有 Claude Sonnet 5 这么多
能吃什么
文字、图片、音频、视频
上下文
100 万字,一次最多吐 6.4 万字
可调项
思考档位同一个模型可以调它「想多久」:想得久答得准,但更贵更慢;想得短便宜快,但更容易出错。跟考试一样,多花一倍时间检查,分数确实会高一点,代价是那一倍时间你得掏出来。(thinking configurations),调高更准更贵,调低更快更省,同一个模型光换档位,一个任务的花费能差好几倍
机制

最大的改动:没重新训练,只换了推理算法

三周迭代一代,快得反常。原因是这一代根本没有重新训练:3.7 Flash 直接建在 3.6 Flash 上,架构、训练数据、硬件、软件四项原样沿用,属于 3.7 自己的改动只有一处,核心推理上的算法改进。

3.7 Flash 新的只有这一层
核心推理上的算法改进
这一整块原样沿用,一个字没改
Gemini 3.6 Flash
架构训练数据硬件软件
7 月 21 日3.6 Flash 上市
相隔三周
8 月 13 日3.7 Flash 上市
底座整块沿用,只在推理那一层换了算法,这就是三周能出一代的原因。本站按官方模型卡的内容重画。

新一代模型是另一条线上的事。三周前发 3.6 Flash 时,Google 顺带提了一句,为了 Gemini 4,迄今最有野心的一次预训练已经开跑。3.7 Flash 是那次预训练跑完之前,在同一个底座上做出来的算法迭代。

上一代那次发布,站内有完整解读
Google 一口气发布三款 Gemini 模型,唯独没有等了很久的 3.5 Pro
升级

升级了什么:编程、网页、文档、流程

编程:一次写对的比例明显变高

调试和排查问题这类活干得更好了,一次就写出能用的代码的比例也更高。生产级代码质量从 34.4% 提到 43.6%,同一项 Claude Sonnet 5 是 42.7%、GPT-5.6 Terra 是 41.3%,它排第一。要跑很多轮才能收尾的长周期软件工程,从 48.6% 提到 65.3%。在终端里干活也从 78.0% 提到 85.8%。

网页开发:更少的提示词就能出可用页面

一次生成的布局更完整,功能也更齐,来回改的次数变少。做界面时给它一张截图、一张图片或者一整套设计系统当参照,它照着做出来的东西跟原样的贴合度更高。网页开发的排位分从 1538 涨到 1588,同项四个模型里它最高(Claude Sonnet 5 是 1541,GPT-5.6 Terra 是 1523)。

复杂文档:金融、法律、生物这类专业领域读得更准

这几个领域的共同点是文档又长又密,术语一层套一层。专业 PDF 理解从 22.0% 提到 34.0%,涨了一半还多;长上下文里精确找信息做到 97.0%,同项四个模型里也是它最高。

业务流程自动化:翻了将近一倍

这一项测的是把真实的公司流程交给模型,让它自己一步步办完。成绩从 17.0% 提到 30.4%,同一项 Claude Sonnet 5 只有 10.7%,GPT-5.6 Terra 是 23.6%。这是四块里拉开对手最多的一块。

生产级代码质量FrontierCode 1.1 Main
3.6 Flash34.4%
3.7 Flash43.6%
长周期软件工程DeepSWE v1.1
3.6 Flash48.6%
3.7 Flash65.3%
专业 PDF 理解GDP.pdf
3.6 Flash22.0%
3.7 Flash34.0%
企业流程自动化AutomationBench
3.6 Flash17.0%
3.7 Flash30.4%
整条槽是满分 100%。四项都涨得不少,但绝对值都还在半山腰,这类「自己把一整件事办完」的活,目前所有模型都做不到及格线以上。数据来自官方模型卡,本站重画。

用起来更省心

除了跑分,Google 还提了几处使着舒服的变化:遇到卡住的地方更会绕过去,意图不清楚时会先问一句再动手,给的指令执行得更贴。多步骤的规划和工具调用上它肯下更多力气,于是要人盯着、要推倒重来的次数变少了。

演示

官方放出的四段演示片

这四段有个共同点:里面没有一次是你问一句、它答一句。每一段都是一个模型在下面指挥一堆子任务,自己把整件事从头做到尾。

一句话变成能玩的 3D 游戏。3.7 Flash 搭配 Nano Banana,角色、道具和贴图是边玩边实时生成的。视频来自 Google 发布页。
一次生成一整个能交互的落地页。3.7 Flash 当总指挥,把活拆给几个子 Agent,页面上那些随滚动错位的视差效果交给 Gemini Omni 做。视频来自 Google 发布页。
片子里那两个搭档,站内都讲过
Google 发布 Nano Banana 2 Lite 和视频模型 Omni Flash:生图 4 秒,系列最快最便宜
拿 3.7 Flash 去训练机器人。三个 Agent 组成一个环形回路,模型看着画面判断动作对不对,机器人因此学得更快。视频来自 Google 发布页。
静态 PDF 年报变成能点的数据网页。图表是活的,还会把散在各页的数字汇总成结论。视频来自 Google 发布页。
数据

完整跑分表:20 项里拿下 9 项第一

官方给的对照表一共 20 项,对手是自家上一代 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra,还有 Meta 的 Muse Spark 1.2。3.7 Flash 在其中 9 项拿到全场最高分:生产级代码质量、网页开发、企业流程自动化、复杂法律流程、专业 PDF 理解、长视频理解、长上下文找信息、多学科专家推理、生物研究真实任务。

这张表可以换对手看。默认对的是上一代 3.6 Flash,点上面的按钮换成别家,同样 20 行会按新对手重新标一遍胜负。

把 Gemini 3.7 Flash 拿去对,
对上一代 3.6 Flash:20 项里 赢 18、输 2。输的两项是同一件事的两个档,都是复杂图表理解。 对 Claude Sonnet 5:赢 16、输 3,还有 1 项对方没公布成绩。输的是知识工作、桌面与系统任务、生信研究里人类能解的那档。 对 GPT-5.6 Terra:赢 10、输 9,1 项对方没成绩。这是四个对手里咬得最紧的一个,而它的输出价是 3.7 Flash 的 3.2 倍。 对 Muse Spark 1.2:赢 4、输 2,剩下 14 项对方根本没公布,这张表里数据缺得最多的就是它。
指标3.7 Flash对手
综合智能指数Artificial Analysis56 52555757
生产级代码质量FrontierCode 1.1 Main43.6% 34.4%42.7%41.3%未公布
长周期软件工程DeepSWE v1.165.3% 48.6%53.8%69.6%54.9%
网页开发Code Arena · Elo1588 1538154115231535
在终端里编程Terminal-bench 2.185.8% 78.0%80.4%87.4%82.9%
通用 Agent 能力Terminal-bench 3.014.9% 5.4%14.6%20.8%未公布
企业流程自动化AutomationBench30.4% 17.0%10.7%23.6%未公布
知识工作GDPVal-AA v2 · Elo1525 1422159815781628
复杂法律流程Harvey LAB-AA90.7% 85.1%90.1%85.2%未公布
专业 PDF 理解GDP.pdf34.0% 22.0%28.0%24.7%16.0%
复杂图表理解 · 不带工具CharXiv Reasoning84.5% 85.2%77.0%85.9%未公布
复杂图表理解 · 带工具CharXiv Reasoning88.7% 89.4%88.3%未公布未公布
长视频理解LVBench85.4% 84.2%68.5%78.9%未公布
长上下文里找信息GDM-MRCR v2 · 128k97.0% 91.8%81.5%93.5%未公布
操作电脑OSWorld-2.047.9% 33.8%未公布50.2%未公布
桌面与系统任务Agent's Last Exam26.3% 24.2%33.3%28.0%未公布
多学科专家推理HLE-Verified53.6% 51.2%31.0%51.1%未公布
生信研究 · 人类能解BioMysteryBench87.1% 80.6%87.5%83.8%未公布
生信研究 · 人类也难BioMysteryBench43.5% 41.2%34.1%49.4%未公布
生物研究真实任务LABBench282.1% 76.1%80.1%81.2%未公布
第三列是对手的成绩:绿色带 ✓ 表示 3.7 Flash 在这一行赢了,红色带 ✗ 表示输了。Elo 是排位分,越高越好,不是百分比。
Gemini 3.7 Flash 官方跑分对照表
官方原表。上面两行是价格,两个 Gemini 后面都带星号,星号的意思在下面「价格砍到一半」那一节讲。图片来自 Google 官方模型卡。
两处口径要说明:网页开发这项榜单有两个名字,博客正文用 Arena.ai 的 WebDev Arena,官方表格用 Code Arena,分数一样(1588 对 1538),本文按表格的叫法。另外长周期软件工程的上一代成绩,博客正文是 49.0%、表格和模型卡都是 48.6%,本文按表格取值。
短板

短板:知识工作垫底,通用 Agent 全场不及格

它也有打不过的。知识工作那一项,3.7 Flash 的排位分是 1525,Muse Spark 1.2 是 1628、Claude Sonnet 5 是 1598、GPT-5.6 Terra 是 1578,四个模型里它垫底,而且不是差一点。这项测的是替人干真实白领活的水平,跟它主打的编程和流程自动化不是一回事。

还有一项比上一代退了。复杂图表理解在这张表里分成两档:不给工具时 84.5%,上一代是 85.2%;给工具时 88.7%,上一代是 89.4%。两档都掉了 0.7 个点,这是 20 项里唯一一项 3.7 Flash 比 3.6 Flash 低的。

最能说明问题的是通用 Agent 能力那一行。3.7 Flash 拿了 14.9%,比上一代的 5.4% 涨了将近三倍,听起来像个大跨步;但把这张表里所有模型的成绩放在一条 0 到 100 的刻度上,画面是这样的:

GPT-5.6 Terra20.8%
Gemini 3.7 Flash14.9%
Claude Sonnet 514.6%
Gemini 3.6 Flash5.4%
整条槽是满分 100%。四个模型全挤在最左边那一小截里,跑得最好的 GPT-5.6 Terra 也只填了两成。这一项测的是「把一台电脑交给它,让它自己把活干完」,目前谁都还没及格。数据来自官方模型卡,本站重画。
安全

安全评估:网络攻击触到警戒线

Google 的前沿安全框架给每个风险领域画了两条线,下面一条是警戒线,上面一条是能力红线,过了红线就要触发额外的部署限制。3.7 Flash 的结论是:网络攻击这一项达到了警戒线,但没到红线。生化核那项也一样触到警戒线:专家红队确实能在完整的攻击链条上问出准确、可执行的信息,但因为平均分不高、而且要专家明确引导才问得出来,判定没有过线。两项都会继续挂着缓解措施。

能力红线
过了就要额外限制部署 , 3.7 Flash 全部领域都没到
警戒线
网络攻击、生化核两项都触到了这条线,会继续挂缓解措施
线以下
有害操纵、机器学习研发的加速与自动化,都在这条线下面
本站按官方模型卡里的前沿安全评估结果重画。

评估里还有一条结论跟能力无关:3.7 Flash 的情境感知比 Gemini 3.1 Pro 更强,它能正确判断出自己正在被测试,只是绕不过测试环境的限制。

短板方面还有几条:会有幻觉;偶尔会慢或者超时;知识截止日期写的是 2026 年 3 月,但后面跟了一句限定,有些领域能给到更新的信息,另一些领域,它知道的东西只到 2025 年 1 月。这一条对做检索、做事实核对的场景影响不小,别只看那个 3 月。

价格

价格砍到一半,但只到年底

3.6 Flash 三周前上市,定价是每 100 万输入字 1.50 美元、输出 7.50 美元。3.7 Flash 现在是 0.75 和 3.75,正好是那个价的一半。

3.6 Flash 现在也是 0.75 和 3.75,两代一个价。还在用 3.6 的,换过去不多花一分钱。

但这个价只到 2026 年 12 月 31 日。2027 年 1 月 1 日起,两代 Flash 一起恢复成 1.50 / 7.50,翻一倍。现在按 0.75 做的成本测算,四个半月后要乘以 2 重算一遍。

7 / 21
3.6 Flash 上市,定价 1.50 / 7.50
1.50 / 7.50
8 / 13
3.7 Flash 上市,3.6 同步降到一样的价
0.75 / 3.75
12 / 31
两代 Flash 的限时价同日到期
0.75 / 3.75
明年 1 / 1
恢复原价,单价翻一倍
1.50 / 7.50
条长表示每 100 万字的单价,输入 / 输出,单位美元。数据来自官方模型卡表格脚注和上一代发布博客。

为什么降到这个数,看同一张表的价格行就明白了:Claude Sonnet 5 是 2.00 / 10.00,GPT-5.6 Terra 是 2.00 / 12.00,Muse Spark 1.2 是 1.25 / 4.25。0.75 / 3.75 把这三个全压在下面,而综合智能指数只比最高分少 1 分。

算账

真正的账要按每个任务算

不过每 100 万字多少钱,其实还不是开发者最后付出去的那笔钱。

一个 Agent 干完一件事,中间要来回好多轮:读文件、想一下、调个工具、看结果、再想、再调。这一整趟总共烧掉多少字,是模型自己决定的,话多的模型单价再低,账单也可能更高;而思考档位调高一档,准确率会涨,烧的字也会涨。所以该看的是跑完一个任务平均花了多少钱,不是每 100 万字的挂牌价。这就像打车不看每公里多少钱,看的是从家到公司这一趟一共付了多少:绕路多的司机,单价再便宜也不便宜。

官方这次给的那张图,横轴就是这个,每个任务的平均花费,左边贵、右边便宜,右上角写着「most efficient」(最划算)。图上每个模型是一条线,线上的点是它不同的思考档位。三代 Flash 被一条浅蓝带子串了起来,一路往右上角走:分数越来越高,同时每个任务越来越便宜。

做对的比例 ← 一个任务花得多 花得少 → 横轴:每个任务的平均花费 claude-opus-5 · 约 74% 代价是一个任务十美元出头 3.5 Flash · 约 37% 3.6 Flash · 约 49% 3.7 Flash · 约 65%
本站按官方那张成本曲线图重画的简化版,只留三代 Flash 和一个高价参照。图上的美元数是在原图上目测读出来的,所以正文只说约数;原图见下。

照着这条带子读下来大概是:3.5 Flash 要七美元上下跑一个任务,只做对三成七;3.6 Flash 三美元多,做对将近一半;到 3.7 Flash,两美元出头,做对六成五。而图上分数最高的 claude-opus-5 能到七成四,代价是一个任务十美元出头,就算把它的档位调到最省,也要五美元左右才守得住七成。

DeepSWE V1.1 每任务成本与得分对照图
官方原图。横轴从左往右是 10 美元到 0 美元,越往右越便宜;每条线是一个模型的不同思考档位。被高亮在右上角的就是 3.7 Flash。图片来自 Google 发布页,数据来源 Datacurve AI。
上手

怎么用:今天就能上,三个入口

3.7 Flash 从发布当天起全面可用,三类用户各走各的门。

开发者
在 Google Antigravity 里跑 Agent 优先的工作流;或者走 Gemini API,从 Google AI Studio、Android Studio 直接开写。
企业
Gemini Enterprise Agent Platform,以及 Gemini Enterprise 这个应用。
个人
Gemini App 里的 Spark,需要 Google AI Pro 或 Ultra 订阅,覆盖 160 多个国家,其中不含欧洲经济区、尼日利亚、瑞士和英国。

Spark 是 Google 在 I/O 上发布的个人 Agent,7×24 小时替你干活,你给方向、它自己动手。从今天起它换成 3.7 Flash 驱动,改进落在两处:Google Workspace 那一套工具用得更准,以及复杂的、要跨好几种技能的流程输出质量更好,比如把散在各处的文件归并到一起、起草邮件、更新状态文档。

Spark 在一个制造业场景里干活。归并文件、起草邮件、更新状态文档,全程不用人一步步下指令。视频来自 Google 发布页。

发布页上还挂了 12 家客户的证言,名单本身比话有信息量:Box、Databricks、Harvey、Hebbia、LangChain、Browser Use、Cartwheel、Emergent、Nunu.ai、Open Code、Pydantic,还有斯坦福大学生物系。企业文档、法律、数据平台、Agent 框架、浏览器自动化,都是要长时间反复调用模型的活。

在 Box 对真实企业知识工作的评测里,Gemini 3.7 Flash 比上一代更准,也快得多,提升最大的是那些最难的分析任务。 Yashodha Bhavnani,Box AI 产品副总裁
🧰 上手卡 · Gemini 3.7 Flash
价格每 100 万输入字 0.75 美元、输出 3.75 美元;限时价,2026 年 12 月 31 日到期,之后恢复 1.50 / 7.50
门槛有 Google 账号就能在 AI Studio 里直接试;跑量走 Gemini API,Agent 工作流走 Google Antigravity,企业走 Gemini Enterprise
来源
Introducing Gemini 3.7 FlashGoogle·blog.google·2026-08-13
本站说明
跑分与价格取自官方模型卡的对照表;网页开发那项博客正文称 WebDev Arena、表格称 Code Arena,本文按表格;博客正文写长周期软件工程上一代成绩为 49.0%,表格与模型卡均为 48.6%,本文按表格取值。成本曲线图上的美元数为在原图上目测读出,正文只作约数表述。底座堆叠图、四块升级对比条、通用 Agent 长短条、价格时间线、三代 Flash 走位图、安全阶梯图均为本站按官方数据重画。3.6 Flash 的原价 1.50 / 7.50 出自上一代发布博客。Box 那条证言在发布页上是图片,文字抓取取不到,本站从页面渲染截图逐字读出后翻译;Muse Spark 1.2 的厂商归属取自本站此前对 Muse Spark 1.1 发布的解读。