2.4 万亿参数稀疏 MoE 旗舰 + 270 亿稠密开源模型——千问首个开放权重的 Max 级旗舰, 以混合注意力架构与 Agent 执行力,重新定义开源前沿。
Qwen3.8 是阿里巴巴通义千问团队于 2026 年 8 月 3 日正式发布的旗舰大模型系列。 该系列包含两大核心模型:Qwen3.8-Max(2.4 万亿参数 MoE 旗舰)和 Qwen3.8-27B(270 亿参数稠密开源模型)。其中 Qwen3.8-Max 是千问历史上 首个开放权重的 Max 级旗舰模型,于 8 月 12 日在 Hugging Face 开源底座权重; Qwen3.8-27B 则于 8 月 14 日以 Apache 2.0 许可开源。
Qwen3.8 系列包含旗舰 MoE 模型与稠密开源模型两条产品线,覆盖从 API 服务到本地部署的全场景需求。
| 模型名称 | 参数量 | 架构类型 | 上下文长度 | 是否开源 |
|---|---|---|---|---|
| Qwen3.8-Max(API 版) | 2.4T 总参 / 95B 激活 | Sparse MoE | 默认 1M | API + 权重(Qwen3.8-Max License) |
| Qwen3.8-2.4T-A95B(开源底座) | 2.4T 总参 / 95B 激活 | Sparse MoE | 262K 原生 / 1M 扩展 | 是BF16+FP8 |
| Qwen3.8-27B | 27.78B(稠密) | Dense | 262K 原生 / 1M 扩展 | 是Apache 2.0 |
Qwen3.8-Max 在权威第三方榜单 Arena 中位列全球第一梯队,Text Arena 排名第五、Vision Arena 排名第二、 Frontend Code Arena 排名第四。Qwen3.8-27B 在多项 Agent 与编程评测中超越上代 Qwen3.6-27B, 部分指标甚至超过 Claude Opus 4.6 Max。
| 评测项目 | Qwen3.8-Max | 排名 | 参考对比 |
|---|---|---|---|
| Text Arena | 第 5 | 5 / 全部 | 仅次于 Claude 系列 |
| Vision Arena | 第 2 | 2 / 全部 | — |
| Frontend Code Arena | 第 4 | 4 / 全部 | — |
| HLE(极高+工具) | 56.20 | 13 / 181 | — |
| GPQA Diamond(极高) | 92.60 | 21 / 226 | — |
| SWE-Bench Pro(极高+工具) | 67.70 | 5 / 57 | Claude Mythos 5: 80.3 |
| FrontierSWE(极高+工具) | 73.50 | 4 / 4 | — |
| Terminal-Bench 2.1(极高+工具) | 86.60 | 8 / 43 | Opus 4.8: 84.6 |
| LongBench v2 | 66.30 | 1 / 13 | — |
| GSM8K | 95.91% | — | — |
| 评测项目 | Qwen3.6-27B | Qwen3.8-27B | 提升 |
|---|---|---|---|
| LiveCodeBench v6 | 83.9 | 90.3 | +6.4 |
| Terminal-Bench 2.1 | 63.4 | 73.0 | +9.6 |
| SWE-Bench Pro | 53.5 | 61.7 | +8.2 |
| DeepSWE 1.1 | 13.3 | 42.2 | +28.9 |
| OSWorld-Verified | 63.9 | 84.3 | +20.4 |
| WebArena-Verified | 48.8 | 64.8 | +16.0 |
| AndroidWorld | 70.3 | 81.9 | +11.6 |
| GPQA Diamond | 87.8 | 89.2 | +1.4 |
| CoWorkBench | 61.0 | 70.7 | +9.7 |
| QwenSWEBench | 49.3 | 79.0 | +29.7 |
Qwen3.8-Max 在内部测试中自主完成了一个为期 16 天的真实软件工程项目——从零构建自进化智能体框架 oh-my-cli,全程无需人工干预,已开源至 GitHub。
作为多模态基座模型,Qwen3.8-Max 可将百页文档、整部剧集或 100 小时直播转化为可搜索、可交互的知识库,支持从截图重建前端项目。
Qwen3.8-Max 不仅能复现已发表论文的实验,还设计出优于原始论文的新方法,在 WWW2025 多模态对话意图识别挑战赛中超越人类参赛者。
团队推出长周期应用重构基准 RecreationBench:在完全黑箱、无网络、无源码的环境下,模型仅通过交互即可自主从零重构应用程序。
Qwen3.8 系列基于 Qwen3.5 的架构基础构建,采用稀疏混合专家(Sparse MoE)与混合注意力机制的联合设计。 这种架构在保持超大规模参数的同时,将推理时的实际激活量压缩至仅约 4%(95B / 2.4T), 实现了规模与效率的关键平衡。
92 层由 23 组相同结构组成,每组包含 3 层 Gated DeltaNet(门控 Delta 网络,线性注意力)和 1 层 Gated Attention(门控全注意力)。线性注意力层使长上下文推理的显存占用近似线性增长,而非传统注意力的二次方增长。
512 个专家中,每个 Token 仅激活 10 个路由专家 + 1 个共享专家,激活率约 2.1%。相比 Kimi K3(896 专家、16 激活、103B),Qwen3.8 的每个专家更大,但总激活量稍小(95B)。
训练了 Multi-Token Prediction 能力,示例配置一次预测 3 个候选 Token。若候选被主模型接受,相当于一次前向传播推进多个 Token,显著降低自回归生成的串行延迟。
官方宣称通过 KV Cache 优化可节省约 30% 显存。推理阶段采用 TP(张量并行)、DP(数据并行)和 EP(专家并行)组合,Attention 部分依赖 TP,MoE 部分依靠 EP 分散专家到不同 GPU。
千问此前从未开放 Max 级旗舰权重(Qwen-Max-0428、Qwen2.5-Max 均仅 API)。Qwen3.8 是第一个开放权重的 Max 规模模型。
线性注意力(Gated DeltaNet)与传统全注意力以 3:1 比例交替,使 262K 原生上下文成为可能,且可扩展至 1M Token。
支持 reasoning_effort 调节推理深度,通过 preserve_thinking 保留历史消息的推理上下文,可按请求关闭思考模式。
官方提供 BF16 和 FP8 checkpoint,社区进一步提供 NVFP4、MXFP4 量化版本,从双节点部署压缩到单节点。
原生支持文本、图像、视频与文档处理,可将百页文档或百小时直播转化为可交互知识库。
K3(93 层 / 69 KDA + 24 Gated MLA)与 Qwen3.8(92 层 / 69 DeltaNet + 23 Gated Attention)均采用 ~3:1 线性:全注意力比,超大模型训练配方已开始收敛。
以下参数量与部署需求基于 Qwen3.8 官方开源权重文件(Hugging Face)与公开部署文档, 结合 8 卡 H20(单卡 96GB HBM3,8 卡共 768GB)进行显存估算,仅供私有化部署规划参考。
| 模型 | 总参数 | 激活参数 | 架构 | BF16 权重体积 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T | 95B | MoE(512 专家) | ~4,800 GB(213 分片) |
| Qwen3.8-27B | 27.78B | 不涉及(Dense) | Dense(64 层) | ~55.6 GB(18 分片) |
权重显存 = 参数量 × 每参数字节数。额外需预留 20–30% 给 KV Cache、激活值与推理框架开销。
| 精度模式 | 权重体积 | 含 KV Cache 估算 | 8 卡 H20(768GB) | 所需卡数(估算) |
|---|---|---|---|---|
| BF16(全精度) | ~4,800 GB | ~5,500 GB | 否 | ~58 卡 / 8 节点 |
| FP8(官方推荐) | ~2,400 GB | ~2,800 GB | 否 | ~30 卡 / 4 节点 |
| FP4 / NVFP4 / MXFP4 | ~1,200 GB | ~1,500 GB | 否 | ~16 卡 / 2 节点 |
| INT4(社区量化) | ~1,200 GB | ~1,500 GB | 否 | ~16 卡 / 2 节点 |
| 2-bit(极限量化) | ~600 GB | ~780 GB | 极限勉强 | ~9 卡(几乎无余量) |
| 精度模式 | 权重体积 | 含 KV Cache 估算 | 8 卡 H20(768GB) | 所需卡数(估算) |
|---|---|---|---|---|
| BF16(全精度) | ~56 GB | ~80 GB | 是单卡即可 | 1 卡 |
| FP8(官方提供) | ~28 GB | ~50 GB | 是单卡即可 | 1 卡 |
| INT4(社区量化) | ~14 GB | ~35 GB | 是单卡轻松 | 1 卡 |
| Ollama 4-bit 包 | ~18 GB | ~30 GB | 是单卡即可 | 1 卡 |
| 方案 | 硬件配置 | 总显存 | 可部署模型 | 服务器成本(估算) |
|---|---|---|---|---|
| 8 卡 H20(单节点) | H20 SXM ×8 | 768 GB | Qwen3.8-27B 全精度 | 约 120–180 万元 |
| 16 卡 H20(双节点) | H20 SXM ×16 + 高速网络 | 1,536 GB | Qwen3.8-27B(超大并发) | 约 280–380 万元 |
| 16 卡 B300 / MI355X(参考) | B300 或 MI355X ×16 | ~4,608 GB | Qwen3.8-Max FP8 | 约 600–900 万元 |
| 8 卡 B300 / MI355X(参考) | B300 或 MI355X ×8 | ~2,304 GB | Qwen3.8-Max FP4 | 约 350–500 万元 |
| 云端 API 调用 | 无需自有硬件 | — | Qwen3.8-Max 原版精度 | 按 Token 计费 |
768GB 显存无法承载 Qwen3.8-Max任何精度。但对于 Qwen3.8-27B,8 卡 H20 绰绰有余——单卡即可跑 BF16 全精度,8 卡可支撑大并发或 1M 超长上下文推理。
若需私有化部署 Qwen3.8-Max,建议使用云端 API(国内输入 12 元/百万 Token),或采购 B300/MI355X 级别算力。16 卡可跑 FP8,8 卡可跑 FP4。
| 计费项 | 国内价格 | 国际价格 | 说明 |
|---|---|---|---|
| 输入 | ¥12.00 / 百万 Token | $2.00 / 百万 Token | 国际价格为 Opus 5 的 40% |
| 输出 | ¥36.00 / 百万 Token | $6.00 / 百万 Token | 国际价格为 Opus 5 的 24% |
| 缓存命中 | ¥1.50 / 百万 Token | — | 隐式缓存 |
从参数规模、开源情况、编程能力与性价比等核心维度,对比 Qwen3.8 系列与 GPT-5.6、Claude、GLM-5.3、Kimi K3 等主流旗舰。
| 维度 | Qwen3.8-Max | Qwen3.8-27B | Claude Fable 5 | GPT-5.6 Sol | GLM-5.3 | Kimi K3 |
|---|---|---|---|---|---|---|
| 总参数 | 2.4T | 27.78B | 未公开 | 未公开 | ~744B | 2.8T |
| 激活参数 | 95B | 不涉及 | — | — | ~40B | 103B |
| 架构 | MoE / 512 专家 | Dense / 64 层 | — | — | MoE / 256 专家 | MoE / 896 专家 |
| 是否开源 | 权重已开源Max License | 是Apache 2.0 | 否 | 否 | 是两周内 | 是 |
| 上下文长度 | 1M | 262K → 1M | — | — | 1M | — |
| 多模态 | 文本/图像/视频 | 文本/图像/视频 | 文本 | — | 文本 | 文本 |
| Terminal-Bench 2.1 | 86.6 | 73.0 | — | — | 28.3 | — |
| SWE-Bench Pro | 67.7 | 61.7 | — | — | — | — |
| GPQA Diamond | 92.6 | 89.2 | — | — | — | — |
| 本地部署 | 需 16+ 卡 B300 | 单卡 H20 即可 | 不支持 | 不支持 | 需 16 卡 H20(FP8) | 需大规模集群 |