8月4日,阿里通义千问正式发布 Qwen3.8-Max 旗舰模型。与此前7月的预览版不同,这次是带着完整基准与开源承诺的正式亮相:2.4万亿总参数、95B激活,原生面向长周期编码、深度研究与多模态智能体任务;Artificial Analysis 智能指数拿到53分,追平 Claude Sonnet 5,仅落后开源领先者 Kimi K3 4分;在 TerminalBench 上以86.6分略超 Anthropic Fable 5 的84.6分,价格却只是后者的零头。更关键的是,阿里宣布下周开源权重——这是 Qwen Max 级模型首次开源。当「最大、最强」不再只属于闭源实验室,中国开源模型的边界又被往前推了一步。

一、规格与定位:为 Agent 任务而生的旗舰

Qwen3.8-Max 的核心规格很明确:2.4万亿总参数、95B激活的 MoE 架构,专为长周期编码、深度研究与多模态智能体任务设计。这与过去一年旗舰模型「样样都做、但没有突出长板」的路线不同——它把火力集中到 Agent 最吃香的几类工作:需要持续多步推理的编程、需要调用工具与检索的研究、以及需要理解图文音的多模态交互。社区里一个被反复引用的演示是,它能用裸 GLSL 实时光追写出物理正确的黑洞渲染,21个参数实时可调、零依赖双击即跑。这类「能独立产出可运行成果」的能力,正是 Agent 时代衡量模型价值的硬指标,而非单纯的聊天流畅度。

二、基准坐标:平价逼近顶级闭源

把 Qwen3.8-Max 放进横向坐标,结论很耐人寻味。TerminalBench 上86.6分略超 Fable 5 的84.6分,意味着在终端环境自主规划、执行多步命令与错误恢复的权威基准上,这款即将开源的国产模型已经踩到了顶级闭源模型的肩膀;Artificial Analysis 智能指数53分追平 Claude Sonnet 5,虽落后开源标杆 Kimi K3 约4分,但价格只是 Fable 5 的零头。社区还流传它能「在10天内自主开发生产级项目」的说法。对一个面向 Agent 工作流、且准备开源权重的模型而言,这种「能力逼近顶级闭源、成本只有零头」的组合,比单纯刷榜更有杀伤力——它直接改写了开发者做选型时的性价比算式。

三、开源前夜:Max 级首次下放的战略含义

真正让这则发布有分量的,是「下周开源权重」的承诺。过去 Max 级(旗舰级)模型往往是闭源实验室的护城河,开源阵营的强模型多集中在中小规模;而 Qwen3.8-Max 把 Max 级首次下放为开源,与 Kimi K3(2.8万亿参数、已开源)形成「中国最强编码与协作模型」的贴身之争。模型已上线 OpenRouter,开源权重下周发布,同时还将开放 Qwen3.8-27B 版本。对开发者而言,这意味着可以本地部署、二次训练、接入自有工作流,而不必被闭源 API 的配额、价格与合规边界锁死。开源强模型越多,Agent 应用层被单一闭源厂商锁定的风险就越低,基础设施的主导权也越向可迁移、可自控的一侧倾斜。

四、客观看:强在哪、边界在哪

价值在于,Qwen3.8-Max 把「顶级编码能力 + 平价 + 即将开源」三件事打包呈现,为 Agent 开发者提供了一条更可控、更低成本的模型选项,也把国产开源模型的能力上限又往前推了一档。但边界要讲清:其一,它仍落后开源标杆 Kimi K3 约4分,在公开综合榜上暂列开源第二,谈「全面超越」为时尚早;其二,多模态智能体任务的真实可用性、长链路自主工作的稳定性,仍需第三方与生产环境验证,而非仅凭厂商演示判断;其三,开源权重下周才释出,「10天自主开发生产级项目」等说法有待独立复现;其四,部分基准为厂商自报,最终成色以社区实测与开源后的公开评测为准。Qwen3.8-Max 是一次扎实的旗舰亮相,而它能否真正改变格局,要看开源之后开发者用调用量投出的那一票。