Alibaba · 通义千问 · 2026.08.03 发布

Qwen3.8 系列模型全面解读

2.4 万亿参数稀疏 MoE 旗舰 + 270 亿稠密开源模型——千问首个开放权重的 Max 级旗舰, 以混合注意力架构与 Agent 执行力,重新定义开源前沿。

发布日期:2026-08-16 · 2.4T MoE · 92 层混合注意力 · Apache 2.0 开源
·

概述:Qwen3.8 系列是什么

Qwen3.8 是阿里巴巴通义千问团队于 2026 年 8 月 3 日正式发布的旗舰大模型系列。 该系列包含两大核心模型:Qwen3.8-Max(2.4 万亿参数 MoE 旗舰)和 Qwen3.8-27B(270 亿参数稠密开源模型)。其中 Qwen3.8-Max 是千问历史上 首个开放权重的 Max 级旗舰模型,于 8 月 12 日在 Hugging Face 开源底座权重; Qwen3.8-27B 则于 8 月 14 日以 Apache 2.0 许可开源。

2.4T
Max 总参数
激活 95B / MoE
27B
稠密开源模型
Apache 2.0 许可
1M
最大上下文
原生 262K 可扩展
#5
Text Arena 排名
Vision Arena #2
关键节点:2026-07-19 WAIC 预览 → 08-03 正式发布 → 08-12 开源 Max 底座权重 → 08-14 开源 27B(Apache 2.0)。
1

模型矩阵:Qwen3.8 系列全览

Qwen3.8 系列包含旗舰 MoE 模型与稠密开源模型两条产品线,覆盖从 API 服务到本地部署的全场景需求。

模型名称 参数量 架构类型 上下文长度 是否开源
Qwen3.8-Max(API 版) 2.4T 总参 / 95B 激活 Sparse MoE 默认 1M API + 权重(Qwen3.8-Max License)
Qwen3.8-2.4T-A95B(开源底座) 2.4T 总参 / 95B 激活 Sparse MoE 262K 原生 / 1M 扩展 BF16+FP8
Qwen3.8-27B 27.78B(稠密) Dense 262K 原生 / 1M 扩展 Apache 2.0
说明:Qwen3.8-Max 的 API 版与开源底座权重在参数量与架构上一致,但 API 版额外提供视觉输入、非思考模式和默认 1M 上下文; 开源底座版本为纯文本、仅思考模式、原生 262K 上下文。Qwen3.8-27B 则是完整的多模态模型,原生支持文本、图像与视频输入。
2

模型优势:性能与特色能力

Qwen3.8-Max 在权威第三方榜单 Arena 中位列全球第一梯队,Text Arena 排名第五、Vision Arena 排名第二、 Frontend Code Arena 排名第四。Qwen3.8-27B 在多项 Agent 与编程评测中超越上代 Qwen3.6-27B, 部分指标甚至超过 Claude Opus 4.6 Max。

① Qwen3.8-Max Benchmark 表现

评测项目 Qwen3.8-Max 排名 参考对比
Text Arena 第 5 5 / 全部 仅次于 Claude 系列
Vision Arena 第 2 2 / 全部
Frontend Code Arena 第 4 4 / 全部
HLE(极高+工具) 56.20 13 / 181
GPQA Diamond(极高) 92.60 21 / 226
SWE-Bench Pro(极高+工具) 67.70 5 / 57 Claude Mythos 5: 80.3
FrontierSWE(极高+工具) 73.50 4 / 4
Terminal-Bench 2.1(极高+工具) 86.60 8 / 43 Opus 4.8: 84.6
LongBench v2 66.30 1 / 13
GSM8K 95.91%

② Qwen3.8-27B Benchmark 表现

评测项目 Qwen3.6-27B Qwen3.8-27B 提升
LiveCodeBench v6 83.9 90.3 +6.4
Terminal-Bench 2.1 63.4 73.0 +9.6
SWE-Bench Pro 53.5 61.7 +8.2
DeepSWE 1.1 13.3 42.2 +28.9
OSWorld-Verified 63.9 84.3 +20.4
WebArena-Verified 48.8 64.8 +16.0
AndroidWorld 70.3 81.9 +11.6
GPQA Diamond 87.8 89.2 +1.4
CoWorkBench 61.0 70.7 +9.7
QwenSWEBench 49.3 79.0 +29.7
亮点:Qwen3.8-27B 在 OSWorld-Verified 上达 84.3,超越 Claude Opus 4.6 Max 的 72.7(同表对比)。在 DeepSWE 1.1 上从 13.3 跃升至 42.2,涨幅超过 3 倍。
🤖

16 天自主软件工程

Qwen3.8-Max 在内部测试中自主完成了一个为期 16 天的真实软件工程项目——从零构建自进化智能体框架 oh-my-cli,全程无需人工干预,已开源至 GitHub。

👁️

原生视觉智能

作为多模态基座模型,Qwen3.8-Max 可将百页文档、整部剧集或 100 小时直播转化为可搜索、可交互的知识库,支持从截图重建前端项目。

🔬

科研复现与创新

Qwen3.8-Max 不仅能复现已发表论文的实验,还设计出优于原始论文的新方法,在 WWW2025 多模态对话意图识别挑战赛中超越人类参赛者。

🎮

RecreationBench

团队推出长周期应用重构基准 RecreationBench:在完全黑箱、无网络、无源码的环境下,模型仅通过交互即可自主从零重构应用程序

3

技术架构:MoE 与混合注意力

Qwen3.8 系列基于 Qwen3.5 的架构基础构建,采用稀疏混合专家(Sparse MoE)与混合注意力机制的联合设计。 这种架构在保持超大规模参数的同时,将推理时的实际激活量压缩至仅约 4%(95B / 2.4T), 实现了规模与效率的关键平衡。

① Qwen3.8-Max 架构详情

92
网络层数
23 组 × 4 层
512
专家总数
每次激活 10+1
3:1
线性 : 全注意力
69 层 : 23 层
MTP
多 Token 预测
一次预测 3 个候选
Qwen3.8-Max 混合注意力层结构(23 组循环)
Gated DeltaNet
线性注意力
Gated DeltaNet
线性注意力
Gated DeltaNet
线性注意力
Gated Attention
全注意力
×23 组
MoE 专家路由结构
512 专家池
路由 Top-10
每 Token 选 10 个
+
1 共享专家
始终激活
=
95B 激活
总参 2.4T
🧬

混合注意力机制

92 层由 23 组相同结构组成,每组包含 3 层 Gated DeltaNet(门控 Delta 网络,线性注意力)1 层 Gated Attention(门控全注意力)。线性注意力层使长上下文推理的显存占用近似线性增长,而非传统注意力的二次方增长。

稀疏 MoE 路由

512 个专家中,每个 Token 仅激活 10 个路由专家 + 1 个共享专家,激活率约 2.1%。相比 Kimi K3(896 专家、16 激活、103B),Qwen3.8 的每个专家更大,但总激活量稍小(95B)。

🔮

MTP 多 Token 预测

训练了 Multi-Token Prediction 能力,示例配置一次预测 3 个候选 Token。若候选被主模型接受,相当于一次前向传播推进多个 Token,显著降低自回归生成的串行延迟。

💾

KV Cache 优化

官方宣称通过 KV Cache 优化可节省约 30% 显存。推理阶段采用 TP(张量并行)、DP(数据并行)和 EP(专家并行)组合,Attention 部分依赖 TP,MoE 部分依靠 EP 分散专家到不同 GPU。

② Qwen3.8-27B 架构详情

64
网络层数
16 组 × 4 层
5,120
隐藏维度
Dense 稠密
27
视觉编码器层数
原生多模态
248K
词表大小
model_type: qwen3_5
Qwen3.8-27B 混合注意力层结构(16 组循环)
Gated DeltaNet
Gated DeltaNet
Gated DeltaNet
Gated Attention
×16 组
多模态输入流
图像 / 视频帧
视觉编码器(27 层)
Patch Merge → 5120 维
64 层混合注意力
架构延续性:Qwen3.8-27B 的 config.json 显示 model_type: qwen3_5,与 Qwen3.6-27B 架构完全一致——相同的层数、隐藏维度、注意力布局与 MTP 设置。3.6 到 3.8 的提升来自后训练(更多数据、更强强化学习),而非新架构。

③ 技术创新点

🏆

首个开源 Max 级权重

千问此前从未开放 Max 级旗舰权重(Qwen-Max-0428、Qwen2.5-Max 均仅 API)。Qwen3.8 是第一个开放权重的 Max 规模模型

🔀

3:1 混合注意力

线性注意力(Gated DeltaNet)与传统全注意力以 3:1 比例交替,使 262K 原生上下文成为可能,且可扩展至 1M Token。

🎛️

灵活思考控制

支持 reasoning_effort 调节推理深度,通过 preserve_thinking 保留历史消息的推理上下文,可按请求关闭思考模式。

📦

多精度量化

官方提供 BF16 和 FP8 checkpoint,社区进一步提供 NVFP4、MXFP4 量化版本,从双节点部署压缩到单节点。

🌐

多模态原生支持

原生支持文本、图像、视频与文档处理,可将百页文档或百小时直播转化为可交互知识库。

🔄

与 Kimi K3 架构趋同

K3(93 层 / 69 KDA + 24 Gated MLA)与 Qwen3.8(92 层 / 69 DeltaNet + 23 Gated Attention)均采用 ~3:1 线性:全注意力比,超大模型训练配方已开始收敛。

4

参数量与部署 GPU 需求(8 卡 96GB H20 测算)

以下参数量与部署需求基于 Qwen3.8 官方开源权重文件(Hugging Face)与公开部署文档, 结合 8 卡 H20(单卡 96GB HBM3,8 卡共 768GB)进行显存估算,仅供私有化部署规划参考。

① 各模型参数量汇总

模型 总参数 激活参数 架构 BF16 权重体积
Qwen3.8-Max 2.4T 95B MoE(512 专家) ~4,800 GB(213 分片)
Qwen3.8-27B 27.78B 不涉及(Dense) Dense(64 层) ~55.6 GB(18 分片)

② H20 显卡规格说明

96GB
单卡 HBM3 显存
4.0TB/s
显存带宽
900GB/s
NVLink 互联带宽
768GB
8 卡总显存
96GB × 8
H20 定位:H20 是英伟达面向中国市场的合规特供卡,单卡 96GB HBM3,带宽 4.0TB/s,支持 NVLink 900GB/s。 虽算力受限,但显存容量大,是受出口管制下国内私有化部署大模型的现实选择。

③ 不同精度下显存需求估算

权重显存 = 参数量 × 每参数字节数。额外需预留 20–30% 给 KV Cache、激活值与推理框架开销。

Qwen3.8-Max(2.4T)

精度模式 权重体积 含 KV Cache 估算 8 卡 H20(768GB) 所需卡数(估算)
BF16(全精度) ~4,800 GB ~5,500 GB ~58 卡 / 8 节点
FP8(官方推荐) ~2,400 GB ~2,800 GB ~30 卡 / 4 节点
FP4 / NVFP4 / MXFP4 ~1,200 GB ~1,500 GB ~16 卡 / 2 节点
INT4(社区量化) ~1,200 GB ~1,500 GB ~16 卡 / 2 节点
2-bit(极限量化) ~600 GB ~780 GB 极限勉强 ~9 卡(几乎无余量)

Qwen3.8-27B(27.78B)

精度模式 权重体积 含 KV Cache 估算 8 卡 H20(768GB) 所需卡数(估算)
BF16(全精度) ~56 GB ~80 GB 单卡即可 1 卡
FP8(官方提供) ~28 GB ~50 GB 单卡即可 1 卡
INT4(社区量化) ~14 GB ~35 GB 单卡轻松 1 卡
Ollama 4-bit 包 ~18 GB ~30 GB 单卡即可 1 卡
关键结论:8 卡 H20(768GB)无法有效部署 Qwen3.8-Max 的任何精度版本——即便 2-bit 极限量化也几乎无余量给 KV Cache。 官方文档显示 BF16/FP8 至少需要两台 NVIDIA B300 或 AMD MI355X 节点(每节点 8 卡,288GB/卡),FP4 可压缩到单节点。 而 Qwen3.8-27B 单卡 H20 即可全精度 BF16 部署,8 卡可支持超大并发与 1M 超长上下文。

④ 部署建议与成本估算

方案 硬件配置 总显存 可部署模型 服务器成本(估算)
8 卡 H20(单节点) H20 SXM ×8 768 GB Qwen3.8-27B 全精度 约 120–180 万元
16 卡 H20(双节点) H20 SXM ×16 + 高速网络 1,536 GB Qwen3.8-27B(超大并发) 约 280–380 万元
16 卡 B300 / MI355X(参考) B300 或 MI355X ×16 ~4,608 GB Qwen3.8-Max FP8 约 600–900 万元
8 卡 B300 / MI355X(参考) B300 或 MI355X ×8 ~2,304 GB Qwen3.8-Max FP4 约 350–500 万元
云端 API 调用 无需自有硬件 Qwen3.8-Max 原版精度 按 Token 计费
⚖️

8 卡 H20 的现实定位

768GB 显存无法承载 Qwen3.8-Max任何精度。但对于 Qwen3.8-27B,8 卡 H20 绰绰有余——单卡即可跑 BF16 全精度,8 卡可支撑大并发或 1M 超长上下文推理。

💡

Max 部署替代方案

若需私有化部署 Qwen3.8-Max,建议使用云端 API(国内输入 12 元/百万 Token),或采购 B300/MI355X 级别算力。16 卡可跑 FP8,8 卡可跑 FP4。

Qwen3.8-Max 的部署门槛不在"模型有多强",而在"显存有多大"——2.4T 参数即使极限量化也需近 10 卡 H20。而 Qwen3.8-27B 则是 8 卡 H20 的完美搭档:单卡全精度、8 卡跑满并发。
—— 部署规划参考结论

⑤ API 定价参考

计费项 国内价格 国际价格 说明
输入 ¥12.00 / 百万 Token $2.00 / 百万 Token 国际价格为 Opus 5 的 40%
输出 ¥36.00 / 百万 Token $6.00 / 百万 Token 国际价格为 Opus 5 的 24%
缓存命中 ¥1.50 / 百万 Token 隐式缓存
5

与竞品对比

从参数规模、开源情况、编程能力与性价比等核心维度,对比 Qwen3.8 系列与 GPT-5.6、Claude、GLM-5.3、Kimi K3 等主流旗舰。

维度 Qwen3.8-Max Qwen3.8-27B Claude Fable 5 GPT-5.6 Sol GLM-5.3 Kimi K3
总参数 2.4T 27.78B 未公开 未公开 ~744B 2.8T
激活参数 95B 不涉及 ~40B 103B
架构 MoE / 512 专家 Dense / 64 层 MoE / 256 专家 MoE / 896 专家
是否开源 权重已开源Max License Apache 2.0 两周内
上下文长度 1M 262K → 1M 1M
多模态 文本/图像/视频 文本/图像/视频 文本 文本 文本
Terminal-Bench 2.1 86.6 73.0 28.3
SWE-Bench Pro 67.7 61.7
GPQA Diamond 92.6 89.2
本地部署 需 16+ 卡 B300 单卡 H20 即可 不支持 不支持 需 16 卡 H20(FP8) 需大规模集群
说明:"—"表示该模型未公布对应数据。Qwen3.8-Max 在 Terminal-Bench 与 GPQA Diamond 上表现突出; Qwen3.8-27B 以 Apache 2.0 许可和单卡可部署的优势,成为本地多模态 Agent 的最佳候选之一。
6

使用场景推荐