阿里巴巴发布并开源 Qwen3.8-Max 模型:家族最强模型首次开源,2.4 万亿参数,能自己连续自主运行 16 天
- 阿里把 Qwen 最强的 Max 档第一次开源:2.4 万亿参数的 Qwen3.8-Max,网页版已经能用,权重下周放上 Hugging Face。
- 发布页几乎不晒跑分,晒的是没人插手连干几天的活,最硬的一个案例里,答案错一个二进制位都不行。
- API 兼容 Anthropic 协议,几个环境变量就能让 Claude Code 换它当引擎;价格还没公布。
看家的 Max 档第一次开源:2.4 万亿参数
阿里通义 8 月 3 日发布了 Qwen3.8-Max,Qwen 家族迄今最强的模型,网页版当天上线。同一天官宣的还有一件事:Max 档的权重第一次开放,2.4 万亿参数,下周就放上 Hugging Face 和 ModelScope。
Qwen 家族一直是这么分的:小尺寸模型开源随便下,最强的 Max 档只给 API、不给权重,看家本事不外露。这次把这条线抹掉了。2.4 万亿参数是 Qwen 放出过的最大权重;上个月月之暗面开源的 Kimi K3 是 2.8 万亿,两者同在开源模型的最大一档。
它是 MoE 结构(Mixture of Experts,专家混合):2.4 万亿参数,每次任务只激活 950 亿,占总参数的 4% 不到。
一栋住了 2.4 万名工匠的大楼,每接一单活只叫醒最对口的 950 人,其余的接着睡,不耗电。
架构沿用 Qwen 3.5 那一套,参数规模翻了上去。许可证是哪种、自己部署要多大的机器,发布页都没提,得等下周权重真放出来才知道。
这一代升级了什么:跟自家上一代同场比,涨幅最大的是连续干活的能力
官方给这一代的定位是四个方向全面加强:编程、办公、科研、长周期任务,核心主张是「端到端可靠交付」,一件事从头干到尾,中间不用人扶。
同一张成绩单里拿上一代旗舰 Qwen3.7-Max 对照,涨幅集中在要连着干很多步的项目上:
后面那个开一年网店的模拟里,年底总现金比上一代多 152%。单点问答类的涨幅就小得多:GPQA Diamond(研究生级科学问答)从 92.4 到 92.6,几乎原地。涨的地方都在长活上。
跑分有输有赢:写代码仍落后 Claude 最强档,多模态是它的主场
发布页把 Claude Opus 4.8、Claude Fable 5、GPT-5.6 Sol、Gemini 3.1 Pro 都拉进了对比表,输赢都印在自己页面上:
| 基准(考什么) | Qwen3.8-Max | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| SWE-bench Pro(真实仓库改代码) | 67.7 | 80.0 | 64.6 |
| Terminal Bench 2.1(终端操作) | 86.6 | 84.6 | 88.8 |
| PaperBench(复现研究论文) | 93.0 | 88.8 | 90.5 |
| IFBench(听不听得懂复杂指令) | 82.8 | 63.5 | 72.7 |
| OSWorld-Verified(操作电脑) | 86.1 | 85.0 | 83.2 |
| OmniDocBench 1.5(文档解析) | 92.1 | 89.5 | 86.7 |
| VideoMME 带字幕(长视频理解) | 90.4 | 未报 | 89.5 |
| ScreenSpot Pro(屏幕元素定位) | 84.5 | 87.3 | 81.3 |
写代码的差距最实在:SWE-bench Pro 落后 Claude Fable 5 十二分多。反过来,听懂复杂指令一项高出第二名 10 分,复现论文全场最高,文档解析、长视频理解、操作电脑这些多模态项目也排第一,这一片是它的主场,但没有通吃,屏幕定位、安卓手机操作仍是 Fable 5 更高。
脚注里有个细节:相当一部分编码项目是拿 Claude Code 当评测框架跑的,用对手家的工具测自己的模型,评测框架这一层不占自家便宜。表里 Fable 5 空着的几项,官方标注是暂无可用分数。
16 天没人插手:模型自己接需求、写代码、跑测试,攒下 265 次提交
第一个活:从一个空文件夹起步,开发一个叫 oh-my-cli 的命令行工具,全程不许人插手。
它给自己搭了一条自动循环:用户反馈和社区实践进来先变成 GitHub issue,然后按状态机领任务、写实现,写完自动跑构建、单元测试和端到端测试,全过了才合并;哪一步挂了,任务自动退回去重修。这套循环本身也在被它升级,运行途中它给项目加上了 /goal、/resume、会话回放、桌面版这些新能力。
到 7 月 30 日、自主运行约 16 天时,仓库攒下 265 次提交、127 个 PR、151 个 issue。全过程的痕迹公开在 GitHub 仓库 qwen-code-dev-bot/oh-my-cli 里,每一条 commit 都能翻。
一篇论文加一批 GPU:五天复现六项结论,还找出了比论文更好的方法
第二个活换成科研。给它一篇今年 5 月的数据挑选论文和一批 GPU(训练模型用的显卡),没有任何起始代码,论文标题和链接在文末来源栏。论文研究的问题很实际:训练数据多到用不完、预算有限,该留哪些样本?论文给的答案:挑「艰难抉择点」多的样本,也就是解题过程中,模型真正拿不准该往哪走的那些时刻。
它先花约 37 小时把论文的整套流水线从零写出来,数据处理、训练、评测约 7,600 行代码,然后把论文六项主要结论全部复现了一遍:用论文的方法挑数据去微调 Qwen3-8B(80 亿参数的开源小模型,实验对象不是它自己),在竞赛数学基准 AIME24 上比随机挑数据高 7.7 个百分点。
复现是前 37 小时,之后的约 88 小时它跑起一个科研循环:提出改进假设,写代码,上 GPU 训练,分析结果,进下一轮。四轮下来,自己提出并测掉 18 种想法:
| 轮次 | 当轮最佳想法 | AIME24 | 较复现基线 |
|---|---|---|---|
| — | 论文原方法(复现基线) | 49.58% | — |
| 1 | 先按难度给数据分层,再挑选 | 50.42% | +0.84 |
| 2 | 按「熵—分数差」给样本加权 | 51.67% | +2.09 |
| 3 | 调优挑选的宽度 | 51.25% | +1.67 |
| 4 | 直接数「艰难抉择点」的个数(nhighgate) | 52.29% | +2.71 |
第三轮比第二轮回撤了 0.4 分,表里原样保留。最后胜出的想法反而最简单:不算复杂的加权分数,直接数每个样本里「艰难抉择点」的个数。前后约五天 125 小时不间断、1,100 多步操作、33 轮 GPU 训练,没人碰过键盘。
天池真比赛:45 次提交从 0.60 爬到 0.853,压过 87% 的人类队伍
第三个活有对手:阿里云天池上的 WWW2025 多模态对话意图识别挑战赛,526 支人类队伍同场。任务是读电商客服对话,文字加商品截图,判断顾客到底想要什么。时限 24 小时。
它读完比赛规则自己搭方案:微调了几个中文文本模型和一个看图模型,融成一套加权投票系统,各家投票的权重用交叉验证校准。45 次提交,每次的排行榜反馈都拿来调下一版,准确率从 0.60 一路爬到 0.853,压过 458 支人类队伍,全场的 87%。
最没法吹的案例:功能一位不许错,芯片电路从 8298 门磨到 678 门
长程任务里最硬的一个:设计一块加密运算硬件电路(GCD/RSA 加速器)。这个案例的成绩没法注水,功能验证要求逐位精确(bit-exact):随机测试下四种位宽的输出,必须和标准答案每一个二进制位都一样,错一位就不合格;在此前提下比谁用的逻辑门少,门数(cell count)由综合工具 Yosys 算出来,不是人打分。
作文分数可以商量,对答案没得商量,差一个字母都算错。过了及格线还要排名,比的只剩同样的功能谁的电路省。
给它的只有任务描述、一个空的接口骨架和评估脚本,没有参考设计。它在仿真、综合、物理设计的工具沙箱里连续跑了约 500 轮交互、71 次评估,门数一路这样掉下来:
跑了几百轮之后它还在发起大改:第 170 轮之后仍在打破模块边界做结构级重构,没有停在小修小补上。678 门这个成绩,官方称在同场参评的模型里最好,参评名单没有公开。
设计最后送进了真实的布局布线流程(OpenROAD,Nangate45 工艺库),生成实际的芯片物理版图:
- 芯片面积 106×106 µm²
- 布线总长 33,369 µm
- 时序不达标(Slack −4.46 ns)
- 芯片面积 46×46 µm²,缩了 81%
- 布线总长 4,187 µm,只剩八分之一
- 500 MHz 下时序达标(+0.66 ns)
时序达标的意思是:电路真能在 500 MHz 的目标频率下稳定跑;省下来的八成面积,做得成实体芯片,测得出真实数。
模拟开一年网店:10 万本金变 41.6 万,途中还要认出 152 家骗子供应商
E-Commerce Bench 是用淘宝天猫真实脱敏数据搭的模拟环境:365 天、12 种店铺类型、60 个类目、7,000 种商品、近 600 家供应商。10 万元启动资金同时开几家店,选品、进货议价、库存、定价、退货全得自己拿主意,年底看总现金。
难点埋在环境里。供应商由博弈论内核驱动、各有性格和让步策略,压价要一轮轮用自然语言谈;600 家里混着 152 家骗子,套路是会费陷阱、低价诱导、货不对板;一年里还有大促爆单和台风断料。
官方展示的重点是「越玩越会」:同一家供应商的同款商品,价格一轮轮试探着压低,谈出来的经验还能搬到同类商品上;2,000 多轮交互里议价效率一直在涨,对照的其他模型普遍中期就到顶了。年终大促那一波,它的净利润超过 10 万元,是 GLM 5.2 的近 2.4 倍。
几百种职业挨个试:律师团队一周的活,一小时标完 1284 条
以上都是极限测试,落回日常:他们从几百种高价值职业里挑高频工作场景挨个试,发布页给了六个带对照的例子。
| 职业 | 交出的活 | 用时 | 传统流程 |
|---|---|---|---|
| 企业合规律师 | 数百份文档里标出 1,284 条相关条款 | 1 小时内 | 助理团队约一周 |
| UI/UX 设计师 | 8 页银行 App 可交互原型,零返修 | 一次成型 | 3–5 轮修改 |
| 餐饮主理人 | 26 道菜完整菜单,食材成本率 33.8% | 一次产出 | 数周试菜核算 |
| 结构工程师 | 浏览器里的 30 层写字楼抗震模型 | 一份图纸建成 | 专业软件一周以上 |
| 康复理疗师 | 2D 评估单变成可转角度的 3D 解剖演示 | 直接生成 | 外包 2–4 周、数千到数万元 |
| 体育数据分析师 | 每名球员约 8,400 个攻防回合的战术画像 | 数十分钟 | 数个工作日 |
一句话,起一个量化研究项目
另一个大案例给了量化研究员:一句任务描述,它连续干数小时,自己搭数据系统、建因子、跑回测,中途按证据换方向,看到设计期指标涨、验证期掉头向下的过拟合信号,就自动删冗余因子;多条路径收敛到同一组信号,就加多种子交叉验证。广度上,六类经典因子的六句描述被拆成每类 50 个研究方向,调度约 330 个子智能体并行挖,一共约 6,000 次回测,入选因子的超额夏普比率(承担同样波动能多赚多少的常用指标)在 0.64 到 1.48 之间,日频 Rank IC(衡量因子预测方向准不准的指标)也全部为正。
能力从哪来:训练环境按三个维度拆开,像乐高一样组合出海量场景
案例讲完,发布页少见地交代了训练方法:这些干活能力主要靠大规模强化学习,让模型在真实工作环境里反复干活、按结果给分。难题是练习用的环境从哪来:真实工作千姿百态,一个个手工搭环境跟不上训练的胃口。
他们的做法是把环境拆成三个独立维度,各自扩充,再交叉组合:
配套两件事。一套统一的奖励系统:代码能跑的就用执行结果验证,网页这类靠看的就按评分表检查渲染出来的样子,再加 agentic 检查,所有环境共用一致的给分口径。一个在线数据均衡器:把每批训练数据在任务、难度、工作区、harness 上配平,梯度才稳,算力才加得上去。
harness 是模型外面那层替它读文件、跑命令、管流程的工具系统。它是在 Claude Code、Codex 这些别人家的工具里练和测的,所以换一个工具外壳,性能不塌。
干活时眼睛不闲着:发现电视放反了,自己回头改
输入端的规格一句带过:200 多页的财报 PDF 能跨页读成结构化报告;100 多小时的长视频能整理成可检索的「视频图谱记忆」,人物、事件、时间、场景连成网,随查随取。
这一代真正的变化在另一头:视觉被装进了干活的过程里。执行任务时它持续看自己的中间产物,页面布局、物体方向、动画效果,渲染出来的房间里电视放反了、界面错位了,就定位问题、重新规划、自己改掉。看,从「理解输入」的一种方式,变成了边干边验收的反馈回路。
配套出了一个新基准 RecreationBench:把一个真实应用当黑盒,不给源码、不许联网,纯靠看界面、点按钮去理解它,再从零把整个应用复刻出来,覆盖 Ubuntu、macOS、Windows、Android、Web 五个平台。另外放出了 Qwen-MM-Plugins 扩展库,给现有的 Agent 框架补图像视频处理、多模态记忆这些能力。
现在就能用:网页免费,两个环境变量接进 Claude Code
网页版在 chat.qwen.ai,打开就能用。API 挂在千问AI平台,同时兼容 OpenAI 和 Anthropic 两种协议,Claude Code 想换它当引擎,配几个环境变量就行:
export ANTHROPIC_MODEL="qwen3.8-max" export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-max" export ANTHROPIC_BASE_URL=https://dashscope.aliyuncs.com/apps/anthropic export ANTHROPIC_AUTH_TOKEN=<你的API密钥>
Codex、OpenClaw、Qoder、Qwen Code 也都有官方配置。API 支持用 reasoning_effort 参数调推理深度,三档:xhigh(默认,想得最深)、medium、low(快而省)。价格发布页没提,开源用什么许可证也还没说,这两样都得等下周。
阿里开源了最强的那一档 Qwen:2.4 万亿参数,摆出来的证据是没人插手干完的五件活
阿里通义发布 Qwen3.8-Max,权重下周开源;16 天写完一个工程、500 轮把芯片电路省掉 92%、一年模拟开店赚到 4.16 倍,一页带图看完。
↓ 一页读完 · 有一张会动的图
阿里通义 8 月 3 日发布 Qwen3.8-Max,网页版当天上线,权重下周放上 Hugging Face 和 ModelScope。Qwen 以前的规矩是小尺寸模型开源随便下、最强的 Max 档只给接口不给权重,这次把这条线抹掉了。
它是 MoE 结构(专家混合:参数分成一大群「专家」,每接一单活只叫醒其中一小部分)。一栋住了 2.4 万名工匠的大楼,每次只叫醒最对口的 950 人,其余的接着睡。
发布页拿出来说服人的,是五件从头到尾没人碰键盘的活,最短 24 小时,最长 365 天。
能连着干这么久,来路在训练环境的搭法:Qwen 把练习场拆成任务、工作空间、工具外壳(harness,替模型读文件、跑命令、管流程的那层软件)三个维度,各自扩充再交叉组合,环境数量按乘法涨。它是在 Claude Code、Codex 这些别人家的工具里练和测的,换个外壳成绩不塌。
给它的只有一句任务描述和一个空接口,没有参考设计:做一块加密运算电路。这件活的成绩注不了水,功能验证要求逐位精确(输出的每一个二进制位都要和标准答案对上,错一位就不合格),过了这关才比谁用的逻辑门少,门数由综合工具算出来,不是人打分。
最后这一版送进了真实的布局布线流程:芯片面积从 106×106 微米缩到 46×46 微米,省掉八成,布线总长只剩八分之一,500 兆赫兹下时序达标,电路真能在这个频率上稳定跑。
跑分在发布页只占一小段。摆到 Claude 最强档旁边,它输的那几项也印在了自己页面上。
| 考什么 | Qwen3.8-Max | Claude Fable 5 |
|---|---|---|
| 真实仓库里改代码(SWE-bench Pro) | 67.7 | 80.0 |
| 屏幕元素定位(ScreenSpot Pro) | 84.5 | 87.3 |
| 听懂复杂指令(IFBench) | 82.8 | 63.5 |
| 复现研究论文(PaperBench) | 93.0 | 88.8 |
| 操作电脑(OSWorld-Verified) | 86.1 | 85.0 |
写代码的落后最实在,差了十二分多;多模态那一片(同时处理文字、图片、视频)是它领先的地方,文档解析、长视频理解也排第一。终端操作一项 GPT-5.6 Sol 的 88.8 最高,Qwen 的 86.6 排中间。这些分数全部出自 Qwen 团队自己的测试,暂无第三方复测;其中相当一部分编码项目是拿 Claude Code 当评测框架跑的。
网页版 chat.qwen.ai 打开就能用,接口这边同时兼容 OpenAI 和 Anthropic 两套协议。
网页版当天上线,不用等权重
接口兼容 Anthropic 协议,Claude Code 配几个环境变量就能换成它当引擎
Codex、OpenClaw、Qwen Code 也都给了官方配置
2.4 万亿参数的权重下周才上 Hugging Face 和 ModelScope
开源用哪种许可证、接口怎么收费,发布页都没写,自己部署要多大的机器也没提
万亿
每次只叫醒
950 亿
Max 这一档
头一回放权重
天
265 次提交
GitHub 上
能逐条翻
- × 价格没公布
- × 用哪种许可证没说
- × 自己部署要多大机器没提
- × 权重还要等下周
