Google 发布 Gemini 3.7 Flash:没有重新训练 只是更换了推理算法 价格砍半大促销
- Google 隔了三周就发下一代 Flash,但这三周里它没重新训模型,换掉的只有推理那一层算法。
- 20 项官方跑分里它拿了 9 项第一,价格不到 Claude Sonnet 5 的四成;不过有一项它比自己上一代还退了。
- 「半价」这两个字后面跟着一个日期,看漏了,明年一月你的账单会翻倍。
Gemini 3.7 Flash 发布了什么
Google 发布了 Gemini 3.7 Flash,一款专门拿来跑编程和 Agent 的干活模型旗舰模型像请专家会诊,出诊费按次算;干活模型像雇个全职助理,单次没那么强,但你付得起让他一直干。(workhorse model):旗舰负责刷榜,它负责跑量,便宜、快、够用,一天调几万次也扛得住。
它距上一代 Gemini 3.6 Flash 只隔了三周,价格砍到一半,编程、知识工作、网页开发三条线上的成绩全面往上抬。
最大的改动:没重新训练,只换了推理算法
三周迭代一代,快得反常。原因是这一代根本没有重新训练:3.7 Flash 直接建在 3.6 Flash 上,架构、训练数据、硬件、软件四项原样沿用,属于 3.7 自己的改动只有一处,核心推理上的算法改进。
新一代模型是另一条线上的事。三周前发 3.6 Flash 时,Google 顺带提了一句,为了 Gemini 4,迄今最有野心的一次预训练已经开跑。3.7 Flash 是那次预训练跑完之前,在同一个底座上做出来的算法迭代。
升级了什么:编程、网页、文档、流程
编程:一次写对的比例明显变高
调试和排查问题这类活干得更好了,一次就写出能用的代码的比例也更高。生产级代码质量从 34.4% 提到 43.6%,同一项 Claude Sonnet 5 是 42.7%、GPT-5.6 Terra 是 41.3%,它排第一。要跑很多轮才能收尾的长周期软件工程,从 48.6% 提到 65.3%。在终端里干活也从 78.0% 提到 85.8%。
网页开发:更少的提示词就能出可用页面
一次生成的布局更完整,功能也更齐,来回改的次数变少。做界面时给它一张截图、一张图片或者一整套设计系统当参照,它照着做出来的东西跟原样的贴合度更高。网页开发的排位分从 1538 涨到 1588,同项四个模型里它最高(Claude Sonnet 5 是 1541,GPT-5.6 Terra 是 1523)。
复杂文档:金融、法律、生物这类专业领域读得更准
这几个领域的共同点是文档又长又密,术语一层套一层。专业 PDF 理解从 22.0% 提到 34.0%,涨了一半还多;长上下文里精确找信息做到 97.0%,同项四个模型里也是它最高。
业务流程自动化:翻了将近一倍
这一项测的是把真实的公司流程交给模型,让它自己一步步办完。成绩从 17.0% 提到 30.4%,同一项 Claude Sonnet 5 只有 10.7%,GPT-5.6 Terra 是 23.6%。这是四块里拉开对手最多的一块。
用起来更省心
除了跑分,Google 还提了几处使着舒服的变化:遇到卡住的地方更会绕过去,意图不清楚时会先问一句再动手,给的指令执行得更贴。多步骤的规划和工具调用上它肯下更多力气,于是要人盯着、要推倒重来的次数变少了。
官方放出的四段演示片
这四段有个共同点:里面没有一次是你问一句、它答一句。每一段都是一个模型在下面指挥一堆子任务,自己把整件事从头做到尾。
完整跑分表:20 项里拿下 9 项第一
官方给的对照表一共 20 项,对手是自家上一代 3.6 Flash、Claude Sonnet 5、GPT-5.6 Terra,还有 Meta 的 Muse Spark 1.2。3.7 Flash 在其中 9 项拿到全场最高分:生产级代码质量、网页开发、企业流程自动化、复杂法律流程、专业 PDF 理解、长视频理解、长上下文找信息、多学科专家推理、生物研究真实任务。
这张表可以换对手看。默认对的是上一代 3.6 Flash,点上面的按钮换成别家,同样 20 行会按新对手重新标一遍胜负。
| 指标 | 3.7 Flash | 对手 |
|---|---|---|
| 综合智能指数Artificial Analysis | 56 | 52555757 |
| 生产级代码质量FrontierCode 1.1 Main | 43.6% | 34.4%42.7%41.3%未公布 |
| 长周期软件工程DeepSWE v1.1 | 65.3% | 48.6%53.8%69.6%54.9% |
| 网页开发Code Arena · Elo | 1588 | 1538154115231535 |
| 在终端里编程Terminal-bench 2.1 | 85.8% | 78.0%80.4%87.4%82.9% |
| 通用 Agent 能力Terminal-bench 3.0 | 14.9% | 5.4%14.6%20.8%未公布 |
| 企业流程自动化AutomationBench | 30.4% | 17.0%10.7%23.6%未公布 |
| 知识工作GDPVal-AA v2 · Elo | 1525 | 1422159815781628 |
| 复杂法律流程Harvey LAB-AA | 90.7% | 85.1%90.1%85.2%未公布 |
| 专业 PDF 理解GDP.pdf | 34.0% | 22.0%28.0%24.7%16.0% |
| 复杂图表理解 · 不带工具CharXiv Reasoning | 84.5% | 85.2%77.0%85.9%未公布 |
| 复杂图表理解 · 带工具CharXiv Reasoning | 88.7% | 89.4%88.3%未公布未公布 |
| 长视频理解LVBench | 85.4% | 84.2%68.5%78.9%未公布 |
| 长上下文里找信息GDM-MRCR v2 · 128k | 97.0% | 91.8%81.5%93.5%未公布 |
| 操作电脑OSWorld-2.0 | 47.9% | 33.8%未公布50.2%未公布 |
| 桌面与系统任务Agent's Last Exam | 26.3% | 24.2%33.3%28.0%未公布 |
| 多学科专家推理HLE-Verified | 53.6% | 51.2%31.0%51.1%未公布 |
| 生信研究 · 人类能解BioMysteryBench | 87.1% | 80.6%87.5%83.8%未公布 |
| 生信研究 · 人类也难BioMysteryBench | 43.5% | 41.2%34.1%49.4%未公布 |
| 生物研究真实任务LABBench2 | 82.1% | 76.1%80.1%81.2%未公布 |
短板:知识工作垫底,通用 Agent 全场不及格
它也有打不过的。知识工作那一项,3.7 Flash 的排位分是 1525,Muse Spark 1.2 是 1628、Claude Sonnet 5 是 1598、GPT-5.6 Terra 是 1578,四个模型里它垫底,而且不是差一点。这项测的是替人干真实白领活的水平,跟它主打的编程和流程自动化不是一回事。
还有一项比上一代退了。复杂图表理解在这张表里分成两档:不给工具时 84.5%,上一代是 85.2%;给工具时 88.7%,上一代是 89.4%。两档都掉了 0.7 个点,这是 20 项里唯一一项 3.7 Flash 比 3.6 Flash 低的。
最能说明问题的是通用 Agent 能力那一行。3.7 Flash 拿了 14.9%,比上一代的 5.4% 涨了将近三倍,听起来像个大跨步;但把这张表里所有模型的成绩放在一条 0 到 100 的刻度上,画面是这样的:
安全评估:网络攻击触到警戒线
Google 的前沿安全框架给每个风险领域画了两条线,下面一条是警戒线,上面一条是能力红线,过了红线就要触发额外的部署限制。3.7 Flash 的结论是:网络攻击这一项达到了警戒线,但没到红线。生化核那项也一样触到警戒线:专家红队确实能在完整的攻击链条上问出准确、可执行的信息,但因为平均分不高、而且要专家明确引导才问得出来,判定没有过线。两项都会继续挂着缓解措施。
评估里还有一条结论跟能力无关:3.7 Flash 的情境感知比 Gemini 3.1 Pro 更强,它能正确判断出自己正在被测试,只是绕不过测试环境的限制。
短板方面还有几条:会有幻觉;偶尔会慢或者超时;知识截止日期写的是 2026 年 3 月,但后面跟了一句限定,有些领域能给到更新的信息,另一些领域,它知道的东西只到 2025 年 1 月。这一条对做检索、做事实核对的场景影响不小,别只看那个 3 月。
价格砍到一半,但只到年底
3.6 Flash 三周前上市,定价是每 100 万输入字 1.50 美元、输出 7.50 美元。3.7 Flash 现在是 0.75 和 3.75,正好是那个价的一半。
3.6 Flash 现在也是 0.75 和 3.75,两代一个价。还在用 3.6 的,换过去不多花一分钱。
但这个价只到 2026 年 12 月 31 日。2027 年 1 月 1 日起,两代 Flash 一起恢复成 1.50 / 7.50,翻一倍。现在按 0.75 做的成本测算,四个半月后要乘以 2 重算一遍。
为什么降到这个数,看同一张表的价格行就明白了:Claude Sonnet 5 是 2.00 / 10.00,GPT-5.6 Terra 是 2.00 / 12.00,Muse Spark 1.2 是 1.25 / 4.25。0.75 / 3.75 把这三个全压在下面,而综合智能指数只比最高分少 1 分。
真正的账要按每个任务算
不过每 100 万字多少钱,其实还不是开发者最后付出去的那笔钱。
一个 Agent 干完一件事,中间要来回好多轮:读文件、想一下、调个工具、看结果、再想、再调。这一整趟总共烧掉多少字,是模型自己决定的,话多的模型单价再低,账单也可能更高;而思考档位调高一档,准确率会涨,烧的字也会涨。所以该看的是跑完一个任务平均花了多少钱,不是每 100 万字的挂牌价。这就像打车不看每公里多少钱,看的是从家到公司这一趟一共付了多少:绕路多的司机,单价再便宜也不便宜。
官方这次给的那张图,横轴就是这个,每个任务的平均花费,左边贵、右边便宜,右上角写着「most efficient」(最划算)。图上每个模型是一条线,线上的点是它不同的思考档位。三代 Flash 被一条浅蓝带子串了起来,一路往右上角走:分数越来越高,同时每个任务越来越便宜。
照着这条带子读下来大概是:3.5 Flash 要七美元上下跑一个任务,只做对三成七;3.6 Flash 三美元多,做对将近一半;到 3.7 Flash,两美元出头,做对六成五。而图上分数最高的 claude-opus-5 能到七成四,代价是一个任务十美元出头,就算把它的档位调到最省,也要五美元左右才守得住七成。
怎么用:今天就能上,三个入口
3.7 Flash 从发布当天起全面可用,三类用户各走各的门。
Spark 是 Google 在 I/O 上发布的个人 Agent,7×24 小时替你干活,你给方向、它自己动手。从今天起它换成 3.7 Flash 驱动,改进落在两处:Google Workspace 那一套工具用得更准,以及复杂的、要跨好几种技能的流程输出质量更好,比如把散在各处的文件归并到一起、起草邮件、更新状态文档。
发布页上还挂了 12 家客户的证言,名单本身比话有信息量:Box、Databricks、Harvey、Hebbia、LangChain、Browser Use、Cartwheel、Emergent、Nunu.ai、Open Code、Pydantic,还有斯坦福大学生物系。企业文档、法律、数据平台、Agent 框架、浏览器自动化,都是要长时间反复调用模型的活。
在 Box 对真实企业知识工作的评测里,Gemini 3.7 Flash 比上一代更准,也快得多,提升最大的是那些最难的分析任务。 Yashodha Bhavnani,Box AI 产品副总裁
Gemini 3.7 Flash 发布:三周多出一代,靠的是换算法,没有重新训练
Google 8 月 13 日上线的编程/Agent 模型,一页带图讲完机制、成绩单,和价格里那道年底到期的坎。
↓ 一页读完 · 有一张会动的图
Google 在 8 月 13 日发布 Gemini 3.7 Flash,一款专门跑编程和 Agent 的干活模型,便宜、快,适合一天调用几万次的活。官方给的 20 项跑分里,它拿下 9 项第一;这些数字全部来自 Google 自己的模型卡和发布博客,暂无第三方复现。
三周就能出新一代,是因为这次没有重新训练模型。架构、训练数据、硬件、软件四项原样沿用自 3.6 Flash,改动只有一处:换了一套核心推理算法。
编程、网页开发、复杂文档、流程自动化这四块涨得最多。同一张表里,它也有干不过对手、甚至比自己上一代还退步的地方。
3.7 Flash 的价格砍到 3.6 Flash 发布价的一半,3.6 现在也同步降到这个价,但这只是限时价,到 2026 年 12 月 31 日为止,明年 1 月 1 日两代 Flash 一起弹回原价。
1.50 / 7.50 美元
0.75 / 3.75 美元
每百万字的挂牌价,还不是开发者最后付的钱。一个 Agent 干一件事要来回好多轮,该看的是跑完一整个任务平均花多少钱。
发布了!
- × 没重新训练
- × 没换架构
- × 没换训练数据
- × 没换硬件软件
核心推理算法
0.75/3.75!
1/1 弹回原价
想了想
也不是真账
平均花多少钱
记好日期
