产品发布 · 小互解读

DeepSeek-V4-Flash 正式版发布:可原生接 Codex,性能超越自家更大的 V4-Pro,输出比 Opus 4.8 便宜 89 倍

九项 Agent 测试全部反超自家更大的 V4-Pro 预览版,模型主干一个参数没改。
一分钟速览
  • 九项 Agent 测试全部反超自家更大的 V4-Pro,差得最多的一项高出四倍,不过分数是谁测出来的,值得对一眼。
  • 输出一百万个字收 0.28 美元,Claude Opus 4.8 收 25 美元。这张价目表末尾还跟着一行小字。
  • 跑一条命令,Codex 背后的模型就换成了它,你原来的配置一个都不用动。
⚑ 跑分数据分两个来源:五列对比表来自 DeepSeek 官方发布材料,属厂商自评;Artificial Analysis 的分数来自第三方独立测试。两者在文中分别标注,出入之处专门比对。
发布

API 转正式版,调用方式一个字不用改

DeepSeek 的 V4-Flash 转正式版了。7 月 31 日开始公测,版本号 0731。

这次最实用的一件事是:它现在能直接接进 Codex。跑一条命令,Codex 背后的模型就换成了 DeepSeek,你原来的配置一个都不用动。

第二件事是价格。输出每一百万个字收 0.28 美元,同样的量 Claude Opus 4.8 收 25 美元。

第三件事是模型权重也放出来了,MIT 协议,谁都能自己拿去部署。

已经在调 DeepSeek API 的人不用改代码:地址不变,model 还是填 deepseek-v4-flash,拿到的就是新版本。

你不用动的 这次新多出来的 调用地址 api.deepseek.com,原样不变 模型名 照填 deepseek-v4-flash 即最新版 模型规模 284B 总参数、13B 激活、1M 上下文 Responses API Codex 跟模型对话用的接口格式 Codex 适配 一条命令配好,三个客户端通用 开源权重 MIT 协议,可自行部署 本次只升级 V4-Flash 的 API,V4-Pro 的 API 与 DeepSeek App、网页版都没有变化
左边三项保持原样,右边三项是这次转正带来的。图为本站按官方发布材料绘制。

需要划清的边界是:这次动的只有 V4-Flash 这一条线。V4-Pro 的 API 没变,DeepSeek App 和网页版上跑的模型也没变。V4-Pro 的正式版,官方的说法是「即将发布」。

数据

九项 Agent 测试,全部反超自家更大的 V4-Pro

那么它到底比上一版强了多少。DeepSeek 随发布放了一张对比表,一共九项偏 Agent 方向的测试。

DeepSeek 官方发布的九项 Agent 基准五列对比表
左起第一列是这次的 0731 正式版,第二列是 4 月的预览版,第三列是自家更大的 V4-Pro 预览版。† 标记的两项是 DeepSeek 内部自建测试集,外部无法复现。图片来源:DeepSeek。

九项全部超过 V4-Pro 预览版:DeepSWE 54.4 对 12.8,DSBench-Hard 59.6 对 31.1,Cybergym 76.7 对 52.7,差距最小的 Agents' Last Exam 也高出 8.7 分。V4-Pro 是 1.6 万亿总参数的大模型,Flash 只有 2840 亿。

同一张表上,九项也全部低于 Claude Opus 4.8,这一半发布材料没有提。差得最少的是 Agents' Last Exam(0.5 分)和 Terminal Bench(2.3 分),最多的是 NL2Repo(15.5 分)和 DSBench-Hard(12.1 分)。

涨幅最大的一项是 DeepSWE,从预览版的 7.3 分涨到 54.4 分。

核对

同一个基准换第三方来测,Opus 的分数没变,DeepSeek 的少了 3.7

上面那张表是 DeepSeek 自己发的。第三方评测机构 Artificial Analysis 同一天用自己的框架也测了一遍,有一处对不上。

TERMINAL-BENCH 2.1,同一个基准,两把尺子 Claude Opus 4.8 DeepSeek 自己测 85.0 第三方测 85 一致 DeepSeek V4-Flash 0731 DeepSeek 自己测 82.7 第三方测 79 差 3.7 上面一组,两把尺子量出来一样长;下面一组,DeepSeek 自己测的长了一截。 差异只出现在它自己那一行上。
本站按 DeepSeek 官方发布材料与 Artificial Analysis 公开评测结果绘制。

Terminal-Bench 这一项,Claude Opus 4.8 两边都是 85;而 V4-Flash 0731,DeepSeek 自报 82.7,第三方测出 79。官方脚注写明,这九项里的 Code Agent 任务用的是 DeepSeek 自家一套还没发布的外壳框架(harness),外面拿不到、也没法复现。Agent 类测试的分数很吃这层外壳,站内有个例子,只换外壳不动模型,ARC-AGI-3 的成绩能推到 99%。

站内相关

只换一层外壳:让 Opus 4.8 和 Fable 5 在 ARC-AGI-3 评测中冲到 99%

第三方的其余数据印证了这次升级的幅度(顺带一提,同一份榜单上 GLM-5.2 是 51 分,比 Flash 0731 高一分,跟官方表里八项全胜 GLM 的口径不同):

50
综合智能指数。上一代 40 分,自家 V4-Pro 44 分,Claude Opus 4.8 是 56 分
1559
真实工作任务 Elo,人类基线为 1000。上一代 1189,自家 V4-Pro 只有 1306
−12%
跑完同一套评测所消耗的输出 token,相对上一代

体积上它是这一档里最小的:处理每个字实际动用的参数,V4-Flash 只有 GLM-5.2 的三分之一不到、Kimi K3 的八分之一。

处理每一个字,实际动用多少参数 DeepSeek V4-Flash 智能指数 50 130 亿 GLM-5.2 智能指数 51 约 400 亿 Kimi K3 智能指数 57 1042 亿 条长为激活参数的真实比例;智能指数为 Artificial Analysis 各模型最高档成绩
激活参数指处理每个字时实际参与计算的部分。GLM-5.2 的数值来自公开资料,Kimi K3 的数值来自其技术报告,V4-Flash 来自官方模型卡。本站制图。
站内相关

Kimi K3 技术报告:2.8 万亿参数,靠三处架构改动把算力效率提到 2.5 倍

价格

输入比 Claude Opus 4.8 便宜 35 倍,输出便宜 89 倍

能力大概摸清了,那么这个能力卖多少钱。下面是官方定价页上的三档,单位是每百万 token;Claude Opus 4.8 一列取自 Anthropic 官方定价,放在这里做参照。

每百万 tokenV4-FlashV4-ProClaude Opus 4.8
输入(缓存未命中)$0.14$0.435$5.00
输入(缓存命中)$0.0028$0.003625
输出$0.28$0.87$25.00
并发上限2500500
数据来自 DeepSeek 官方定价页与 Anthropic 官方定价页。

换算成倍数:输入每百万 token 差 35 倍,输出差 89 倍。跟自家的 V4-Pro 比,Flash 的输入输出都是 Pro 的三分之一不到,而能同时打的请求数是 Pro 的五倍。

每百万输出 TOKEN 的价格,按真实比例 Claude Opus 4.8 $25.00 DeepSeek V4-Pro $0.87 DeepSeek V4-Flash $0.28 最下面那道几乎看不见的深色短杠,就是同样一百万个字的输出要花的钱
三根条按真实价格比例绘制,未做压缩。本站制图。

三个容易被漏掉的加分项

价格没涨。0731 的定价跟 4 月那版预览版完全一致,能力大涨而价目表原封不动。

缓存命中打到两折的零头。同样的开头内容再发一次,可以直接复用上次算好的结果,这部分只收 $0.0028,是未命中价的五十分之一,折扣率 98%。第三方评测机构 Artificial Analysis 专门点了这一条:行业大多数模型给的缓存折扣是 90%,DeepSeek 给到 98%,这是它每任务成本能压这么低的关键来源之一。而对着同一个代码库反复提问的场景,也就是 Codex 干活的常态,命中率天然就高。

吐的字还变少了。Artificial Analysis 跑完自己那整套评测,0731 用掉约 2.06 亿输出 token,上一代用掉约 2.34 亿。少用 12% 的字,拿到更高的分数。省下来的是标价之外的另一笔。

Artificial Analysis 智能指数排行与智能/成本散点图
下半张图的横轴是每完成一项任务花的钱(对数刻度),纵轴是智能分。绿色区域是「又聪明又便宜」的最优象限,虚线是 Pareto 前沿,同等价位没有更聪明的、同等智能没有更便宜的。紫箭头指的 DeepSeek V4 Flash 0731 落在这条线上,每任务约合三分钱;而右上角 Claude Opus 5 那几个点在 2 美元以上。图片来源:Artificial Analysis。
⚠️ 价目表末尾那行小字。官方定价页的脚注写着:DeepSeek API 即将实行高峰/非高峰定价,高峰时段所有计费项按现价的 2 倍 收费,高峰时段为北京时间每天 9:00–12:00 和 14:00–18:00,正好覆盖国内的整个上班时间。生效日期以官方公告为准,目前还没公布。真按 2 倍算,白天跑是输入 $0.28、输出 $0.56,仍然比 Claude Opus 4.8 便宜一个数量级以上,但做成本测算时这一栏得先按两倍填。
机制

针对 Codex 的适配:连 Codex 自己的系统提示词都一并配好了

价格和能力都摆完了,回到开头说的那件最实用的事:接 Codex。Codex 是通过 Responses API 跟模型对话的,DeepSeek 这次原生支持了这套格式,这是能接上的前提。但如果适配只做到"接口能通",Codex 里的 DeepSeek 会是一个被降格使用的模型:不知道自己的上下文有多大,不知道该用哪种方式提交代码补丁,也拿不到 Codex 内置模型享有的那套行为规范。

实际做法比这彻底得多。配置过程里会写入一个 ~/.codex/models.json,它本质上是一份写给 Codex 看的模型说明书,把 DeepSeek 模型按 Codex 内置模型的格式完整声明了一遍。

~/.CODEX/MODELS.JSON 里装了三层东西 一、模型能力的家底 上下文窗口 1048576 字,有效部分按 95% 算;支持并行调用多个工具 提交代码补丁用 freeform 方式;最低要求客户端版本 0.144.0 二、三档推理力度 low 快速轻思考 · high 复杂问题深挖(默认)· max 最难的问题拉满 这三档会直接出现在 Codex 的档位切换里 三、Codex 原装的那整份系统提示词 "You are Codex" 这句开头 后面跟着人格设定、怎么用 skills、遇到破坏性命令怎么办的完整规范 第三层意味着:DeepSeek 模型在 Codex 里干活时,穿的是 Codex 原装的那身行为守则
按 DeepSeek 官方 Codex 集成文档中 models.json 的实际内容绘制。

第三层是这次适配里最值得注意的一处。那份 models.json 里原样收录了 Codex 自己的官方系统提示词,从 "You are Codex" 这句开头 这句开头,一直到该怎么加载技能文件、碰上删除类命令要如何处置的整套规矩。

接进去之后,模型是 DeepSeek 的,但那套关于"我是谁、我该怎么干活、什么事不能干"的行为守则,仍然是 Codex 原装的。所谓针对 Codex 优化,优化的是模型与这整套外壳的配合,而不只是让两端的接口能对上话。

上手

接入教程:一条命令配好,原有设置不动

动手之前先确认两件事:Codex CLI 或者 ChatGPT 桌面 app 至少启动过一次(这样 ~/.codex 目录才会存在),以及客户端版本不低于 0.144.0。

方式一:官方脚本,一条命令

macOS / Linux · 终端
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
Windows 用户在 PowerShell 里运行:irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex

脚本跑起来会让你从菜单里挑模型,首次运行时要求填 API Key(sk- 开头,在 DeepSeek 平台申请)。它做的四件事都挺规矩:

  1. 先把现有的 ~/.codex/config.toml 备份到 ~/.codex/backup-deepseek/,随时可以还原回去。
  2. 写入模型目录 ~/.codex/models.json,也就是上一节讲的那份说明书。
  3. config.toml:只重写必要的字段并追加一段 [model_providers.deepseek]。你原有的 MCP 服务器、项目信任等级这些设置全部保留;如果有字段跟新配置冲突,会删掉并逐条打印删除原因。
  4. 写入之前先校验两个文件的语法,校验不通过就直接中止,一个文件都不动。

之后随时可以再跑一次这个脚本切换模型,或者从菜单第 3 项恢复到安装之前的状态。

方式二:手动改配置

不想跑脚本的话,models.json 的完整内容在官方文档里可以直接复制,config.toml 加上这段就行:

~/.codex/config.toml
model = "deepseek-v4-flash"
model_provider = "deepseek"
preferred_auth_method = "apikey"
forced_login_method = "api"
model_reasoning_effort = "high"
model_catalog_json = "~/.codex/models.json"

[model_providers.deepseek]
name = "deepseek"
base_url = "https://api.deepseek.com/"
wire_api = "responses"
experimental_bearer_token = "<你的 DeepSeek API Key>"
关键在 wire_api = "responses" , 它告诉 Codex 用 Responses API 这套协议跟模型说话。model_reasoning_effort 就是上一节那三档推理力度,可以填 low / high / max。

配好之后怎么确认生效

三个 Codex 客户端读的是同一份配置,配一次全通:

Codex CLI
进项目目录敲 codex,启动横幅显示 model: deepseek-v4-flash 就说明生效了。
ChatGPT 桌面版
模型选择器里会显示成 “Custom”。这不是没配好,桌面版把所有本地配置的模型都显示成这个,实际跑的就是你选的那个 DeepSeek 模型。
VS Code 扩展
跟 Codex CLI 共用同一份配置,装上扩展直接就能用。

现在还够不着的几处

只有 Flash
能接 Codex 的目前只有 deepseek-v4-flash,Responses API 也一样。V4-Pro 的支持,官方给的时间是 2026 年 8 月初。
不记对话
这是个无状态接口,previous_response_idconversation 都不支持,多轮对话要自己把完整历史每次都发全。
超长直接报错
不支持自动截断,请求超出上下文窗口会直接返回 400,不会帮你砍掉前面的内容。
图片会被换掉
不支持图片和文件输入。传图片不会报错,但内容会被静默替换成一行占位文字,这条最容易踩,因为它不吭声。
自定义工具
custom 类型的工具只认 apply_patch 这一个名字(就是给 Codex 用的),传别的名字返回 400。

还有一条设计值得单说:不支持的参数一律静默忽略,不报错。所以现成的 Responses API 客户端不用改代码就能直接接过来,代价是那些被忽略的参数你得自己心里有数。

🧰 上手卡 · DeepSeek-V4-Flash(0731 正式版)
价格每百万 token:输入 $0.14(缓存命中 $0.0028)/输出 $0.28;高峰时段将按 2 倍计费
门槛有 API Key 即可调用;接 Codex 需客户端 ≥ 0.144.0,跑一条官方脚本自动配好;也可用 MIT 权重配 vLLM 自建
技术

技术上只改了训练的最后一步,模型主干一个参数没动

最后简单说说这次的能力提升是从哪儿来的。官方更新日志里那句话是理解全篇的钥匙:0731 与预览版的模型架构和尺寸完全相同,只是重新做了一遍后训练。

后训练(post-training)指的是模型把海量文本读完之后的第二个阶段,用示范和奖励教它怎么把肚子里的本事真正用出来。书是同一批书,这一步换的是教法。

同一堆权重 · 换一套教法 模型主干(没动) 284B 总参数 13B 激活 1M 上下文 重做的后训练 换掉的只有这一块 九项 Agent 测试同时上涨 柱高为示意,具体数值见前文对比表
示意图,柱状高度不代表实际分值。本站制图。

有一处得说准:HuggingFace 上开源的权重体积是 3040 亿参数,比主干的 2840 亿多出约 200 亿。多出来的那部分是一个投机解码模块,让一个小模块先抢着往下猜几个字、大模型回头一次性验证,猜对的直接采用。它只加快出字速度,不改变模型会什么、不会什么。用 vLLM 部署时加一个参数就能打开。

至于后训练具体怎么做的,模型卡给的路线是两段式:先用示范数据和强化学习分头培养各个领域的专家模型,再让一个统一的模型跟着这些专家现场给出的答案学,把各科本事收进同一个模型里。

价格能压这么低,同样是模型自身结构带来的:2840 亿参数里,处理每个字时只从 256 个专家中挑 6 个、再加 1 个共用的,实际参与计算的约 130 亿;专家部分的权重压到 FP4 精度存放,其余多数用 FP8;再配上一套压缩注意力机制,把长文本最占显存的那块缓存大幅砍下来,官方给的数字是,在 100 万字的上下文里,V4-Pro 单个字的推理算力只要上一代 V3.2 的 27%,缓存只要 10%。

有一点值得留意:省的是算力和缓存,不是显存。2840 亿参数的权重仍然得全部待在显存里,因为下一个字可能会点到任何一个专家。

来源
DeepSeek-V4-Flash-0731DeepSeek·HuggingFace 模型卡·2026-07-31
本站说明
九项基准对比表为 DeepSeek 官方发布图,经第三方媒体转载获取,数值与 HuggingFace 模型卡上的同一张表逐项核对一致。智能指数与成本散点图来自第三方机构 Artificial Analysis 的公开评测;文中 Terminal-Bench 79%、综合智能指数、真实工作任务 Elo、token 用量降幅等第三方数据均出自该机构同批公开结果。四张示意图为本站绘制,其中技术节末尾那张柱高仅为示意。Claude Opus 4.8 的价格取自 Anthropic 官方定价页。DeepSWE、NL2Repo、Terminal-Bench 的测试方式说明来自各自的公开论文与项目页。