DeepSeek-V4-Flash 正式版发布:可原生接 Codex,性能超越自家更大的 V4-Pro,输出比 Opus 4.8 便宜 89 倍
- 九项 Agent 测试全部反超自家更大的 V4-Pro,差得最多的一项高出四倍,不过分数是谁测出来的,值得对一眼。
- 输出一百万个字收 0.28 美元,Claude Opus 4.8 收 25 美元。这张价目表末尾还跟着一行小字。
- 跑一条命令,Codex 背后的模型就换成了它,你原来的配置一个都不用动。
API 转正式版,调用方式一个字不用改
DeepSeek 的 V4-Flash 转正式版了。7 月 31 日开始公测,版本号 0731。
这次最实用的一件事是:它现在能直接接进 Codex。跑一条命令,Codex 背后的模型就换成了 DeepSeek,你原来的配置一个都不用动。
第二件事是价格。输出每一百万个字收 0.28 美元,同样的量 Claude Opus 4.8 收 25 美元。
第三件事是模型权重也放出来了,MIT 协议,谁都能自己拿去部署。
已经在调 DeepSeek API 的人不用改代码:地址不变,model 还是填 deepseek-v4-flash,拿到的就是新版本。
需要划清的边界是:这次动的只有 V4-Flash 这一条线。V4-Pro 的 API 没变,DeepSeek App 和网页版上跑的模型也没变。V4-Pro 的正式版,官方的说法是「即将发布」。
九项 Agent 测试,全部反超自家更大的 V4-Pro
那么它到底比上一版强了多少。DeepSeek 随发布放了一张对比表,一共九项偏 Agent 方向的测试。
九项全部超过 V4-Pro 预览版:DeepSWE 54.4 对 12.8,DSBench-Hard 59.6 对 31.1,Cybergym 76.7 对 52.7,差距最小的 Agents' Last Exam 也高出 8.7 分。V4-Pro 是 1.6 万亿总参数的大模型,Flash 只有 2840 亿。
同一张表上,九项也全部低于 Claude Opus 4.8,这一半发布材料没有提。差得最少的是 Agents' Last Exam(0.5 分)和 Terminal Bench(2.3 分),最多的是 NL2Repo(15.5 分)和 DSBench-Hard(12.1 分)。
涨幅最大的一项是 DeepSWE,从预览版的 7.3 分涨到 54.4 分。
同一个基准换第三方来测,Opus 的分数没变,DeepSeek 的少了 3.7
上面那张表是 DeepSeek 自己发的。第三方评测机构 Artificial Analysis 同一天用自己的框架也测了一遍,有一处对不上。
Terminal-Bench 这一项,Claude Opus 4.8 两边都是 85;而 V4-Flash 0731,DeepSeek 自报 82.7,第三方测出 79。官方脚注写明,这九项里的 Code Agent 任务用的是 DeepSeek 自家一套还没发布的外壳框架(harness),外面拿不到、也没法复现。Agent 类测试的分数很吃这层外壳,站内有个例子,只换外壳不动模型,ARC-AGI-3 的成绩能推到 99%。
站内相关只换一层外壳:让 Opus 4.8 和 Fable 5 在 ARC-AGI-3 评测中冲到 99%
第三方的其余数据印证了这次升级的幅度(顺带一提,同一份榜单上 GLM-5.2 是 51 分,比 Flash 0731 高一分,跟官方表里八项全胜 GLM 的口径不同):
体积上它是这一档里最小的:处理每个字实际动用的参数,V4-Flash 只有 GLM-5.2 的三分之一不到、Kimi K3 的八分之一。
Kimi K3 技术报告:2.8 万亿参数,靠三处架构改动把算力效率提到 2.5 倍
输入比 Claude Opus 4.8 便宜 35 倍,输出便宜 89 倍
能力大概摸清了,那么这个能力卖多少钱。下面是官方定价页上的三档,单位是每百万 token;Claude Opus 4.8 一列取自 Anthropic 官方定价,放在这里做参照。
| 每百万 token | V4-Flash | V4-Pro | Claude Opus 4.8 |
|---|---|---|---|
| 输入(缓存未命中) | $0.14 | $0.435 | $5.00 |
| 输入(缓存命中) | $0.0028 | $0.003625 | — |
| 输出 | $0.28 | $0.87 | $25.00 |
| 并发上限 | 2500 | 500 | — |
换算成倍数:输入每百万 token 差 35 倍,输出差 89 倍。跟自家的 V4-Pro 比,Flash 的输入输出都是 Pro 的三分之一不到,而能同时打的请求数是 Pro 的五倍。
三个容易被漏掉的加分项
价格没涨。0731 的定价跟 4 月那版预览版完全一致,能力大涨而价目表原封不动。
缓存命中打到两折的零头。同样的开头内容再发一次,可以直接复用上次算好的结果,这部分只收 $0.0028,是未命中价的五十分之一,折扣率 98%。第三方评测机构 Artificial Analysis 专门点了这一条:行业大多数模型给的缓存折扣是 90%,DeepSeek 给到 98%,这是它每任务成本能压这么低的关键来源之一。而对着同一个代码库反复提问的场景,也就是 Codex 干活的常态,命中率天然就高。
吐的字还变少了。Artificial Analysis 跑完自己那整套评测,0731 用掉约 2.06 亿输出 token,上一代用掉约 2.34 亿。少用 12% 的字,拿到更高的分数。省下来的是标价之外的另一笔。
针对 Codex 的适配:连 Codex 自己的系统提示词都一并配好了
价格和能力都摆完了,回到开头说的那件最实用的事:接 Codex。Codex 是通过 Responses API 跟模型对话的,DeepSeek 这次原生支持了这套格式,这是能接上的前提。但如果适配只做到"接口能通",Codex 里的 DeepSeek 会是一个被降格使用的模型:不知道自己的上下文有多大,不知道该用哪种方式提交代码补丁,也拿不到 Codex 内置模型享有的那套行为规范。
实际做法比这彻底得多。配置过程里会写入一个 ~/.codex/models.json,它本质上是一份写给 Codex 看的模型说明书,把 DeepSeek 模型按 Codex 内置模型的格式完整声明了一遍。
第三层是这次适配里最值得注意的一处。那份 models.json 里原样收录了 Codex 自己的官方系统提示词,从 "You are Codex" 这句开头 这句开头,一直到该怎么加载技能文件、碰上删除类命令要如何处置的整套规矩。
接进去之后,模型是 DeepSeek 的,但那套关于"我是谁、我该怎么干活、什么事不能干"的行为守则,仍然是 Codex 原装的。所谓针对 Codex 优化,优化的是模型与这整套外壳的配合,而不只是让两端的接口能对上话。
接入教程:一条命令配好,原有设置不动
动手之前先确认两件事:Codex CLI 或者 ChatGPT 桌面 app 至少启动过一次(这样 ~/.codex 目录才会存在),以及客户端版本不低于 0.144.0。
方式一:官方脚本,一条命令
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex脚本跑起来会让你从菜单里挑模型,首次运行时要求填 API Key(sk- 开头,在 DeepSeek 平台申请)。它做的四件事都挺规矩:
- 先把现有的
~/.codex/config.toml备份到~/.codex/backup-deepseek/,随时可以还原回去。 - 写入模型目录
~/.codex/models.json,也就是上一节讲的那份说明书。 - 改
config.toml:只重写必要的字段并追加一段[model_providers.deepseek]。你原有的 MCP 服务器、项目信任等级这些设置全部保留;如果有字段跟新配置冲突,会删掉并逐条打印删除原因。 - 写入之前先校验两个文件的语法,校验不通过就直接中止,一个文件都不动。
之后随时可以再跑一次这个脚本切换模型,或者从菜单第 3 项恢复到安装之前的状态。
方式二:手动改配置
不想跑脚本的话,models.json 的完整内容在官方文档里可以直接复制,config.toml 加上这段就行:
model = "deepseek-v4-flash" model_provider = "deepseek" preferred_auth_method = "apikey" forced_login_method = "api" model_reasoning_effort = "high" model_catalog_json = "~/.codex/models.json" [model_providers.deepseek] name = "deepseek" base_url = "https://api.deepseek.com/" wire_api = "responses" experimental_bearer_token = "<你的 DeepSeek API Key>"
wire_api = "responses" , 它告诉 Codex 用 Responses API 这套协议跟模型说话。model_reasoning_effort 就是上一节那三档推理力度,可以填 low / high / max。配好之后怎么确认生效
三个 Codex 客户端读的是同一份配置,配一次全通:
codex,启动横幅显示 model: deepseek-v4-flash 就说明生效了。现在还够不着的几处
deepseek-v4-flash,Responses API 也一样。V4-Pro 的支持,官方给的时间是 2026 年 8 月初。previous_response_id 和 conversation 都不支持,多轮对话要自己把完整历史每次都发全。apply_patch 这一个名字(就是给 Codex 用的),传别的名字返回 400。还有一条设计值得单说:不支持的参数一律静默忽略,不报错。所以现成的 Responses API 客户端不用改代码就能直接接过来,代价是那些被忽略的参数你得自己心里有数。
技术上只改了训练的最后一步,模型主干一个参数没动
最后简单说说这次的能力提升是从哪儿来的。官方更新日志里那句话是理解全篇的钥匙:0731 与预览版的模型架构和尺寸完全相同,只是重新做了一遍后训练。
后训练(post-training)指的是模型把海量文本读完之后的第二个阶段,用示范和奖励教它怎么把肚子里的本事真正用出来。书是同一批书,这一步换的是教法。
有一处得说准:HuggingFace 上开源的权重体积是 3040 亿参数,比主干的 2840 亿多出约 200 亿。多出来的那部分是一个投机解码模块,让一个小模块先抢着往下猜几个字、大模型回头一次性验证,猜对的直接采用。它只加快出字速度,不改变模型会什么、不会什么。用 vLLM 部署时加一个参数就能打开。
至于后训练具体怎么做的,模型卡给的路线是两段式:先用示范数据和强化学习分头培养各个领域的专家模型,再让一个统一的模型跟着这些专家现场给出的答案学,把各科本事收进同一个模型里。
价格能压这么低,同样是模型自身结构带来的:2840 亿参数里,处理每个字时只从 256 个专家中挑 6 个、再加 1 个共用的,实际参与计算的约 130 亿;专家部分的权重压到 FP4 精度存放,其余多数用 FP8;再配上一套压缩注意力机制,把长文本最占显存的那块缓存大幅砍下来,官方给的数字是,在 100 万字的上下文里,V4-Pro 单个字的推理算力只要上一代 V3.2 的 27%,缓存只要 10%。
有一点值得留意:省的是算力和缓存,不是显存。2840 亿参数的权重仍然得全部待在显存里,因为下一个字可能会点到任何一个专家。
一条命令换掉 Codex 背后的模型:DeepSeek-V4-Flash 转正,输出便宜 89 倍
DeepSeek 7 月 31 日把 V4-Flash 转成正式版公测,原生支持了 Codex 用的接口,一页带图讲完发布了什么、能干多少活、多少钱、怎么接。
↓ 一页读完 · 有一张会动的图
DeepSeek 在 7 月 31 日把 V4-Flash 从预览版转成正式版公测,版本号 0731。已经在调它的人一行代码都不用改,地址和模型名照旧,变化在于多了一套接口、权重也开源了。这次动的只有 V4-Flash 一条线,V4-Pro 的 API 和 DeepSeek App、网页版都没有变化。
model = "deepseek-v4-flash"
模型名照填就是最新版。2840 亿总参数、每处理一个字只叫醒其中约 130 亿、100 万字上下文,都和 4 月的预览版一样。
原生支持了 Responses API(Codex 跟模型对话用的那套接口格式),并专门为 Codex 做了适配;权重按 MIT 协议开源,谁都能拿去自己部署。
架构和尺寸跟 4 月的预览版完全相同,这一版只重新做了一遍后训练,模型把海量文本读完之后的第二个阶段,用示范和奖励教它怎么把肚子里的本事真正用出来。书是同一批书,换的是教法。九项偏 Agent 方向的测试因此全部上涨。
上面那张表是 DeepSeek 自己发的。第三方评测机构 Artificial Analysis 同一天用自己的框架测了一遍:Claude Opus 4.8 的分数两边对得上,DeepSeek 自己那一列对不上。
便宜来自结构:2840 亿参数里,处理每个字只从 256 个专家中叫醒 6 个、再加 1 个共用的,实际参与计算的约 130 亿;专家的权重用更省的精度存放,再配一套压缩注意力,把长文本里最占地方的缓存大幅砍下来。落到价目表上是这样(每百万 token,大致相当于一百万个字)。
接 Codex 是这次最实用的一件事:跑一条官方脚本(完整命令正文里可以直接复制),它会写入两个配置文件,关键那行是 wire_api = "responses"。适配做到了 models.json 这一层,一份写给 Codex 看的模型说明书。
✔ 只重写必要字段,你原有的其他设置全部保留;有冲突的会删掉并逐条打印原因
✔ 写入前先校验两个文件的语法,不通过就直接中止,一个文件都不动
✔ 之后随时再跑一次这个脚本换模型,或从菜单恢复到安装之前
✘ 服务器不替你记对话历史,多轮要自己每次把完整历史发全
✘ 请求超出上下文窗口直接报错,不会帮你砍掉前面的内容
✘ 传图片不报错,但内容会被静默换成一行占位文字,这条最容易踩,因为它不吭声
的输出
小互账单上的单价
Opus 4.8 收 $25,
它收 $0.28。
预览版 → 0731
反常,DeepSeek
没有解释
DeepSeek 自己测 85 / 第三方测 85
DeepSeek 自己测 82.7 / 第三方测 79
它自己那一列
- × 能接的只有 deepseek-v4-flash
- × 不替你记对话,历史每次发全
- × 传图片被静默换成一行占位字
