技术解读 · 原理科普

小杯干翻超大杯:DeepSeek V4.1 Flash 是如何做到的

552B 参数,激活 8B,把自家 1.6T 的旗舰打了下去——不是玄学,是三处架构改动。拆开看

2026-09-13大模型 · 架构原理约 8 分钟

01事件回顾:小模型干掉了自家旗舰

9 月 10 日,DeepSeek 发了一封邮件。事情从这里开始。

没有发布会,没有直播。邮件里说:发布 DeepSeek V4.1 Flash,全新模型结构系列里"最小尺寸"的那一个。

按常理,Flash 是走量的款。便宜、快、能力砍一刀,给轻量场景用。这次不一样。公告的原话是:经多方测试,V4.1 Flash 在性能、费用、速度、总用时等各项指标上已全面超越 V4 Pro,因此我们计划有序下线 V4 Pro。

自家新品反超自家旗舰,然后把旗舰下线。这种事在大模型行业还是头一回。用咖啡店的菜单说:小杯把超大杯干翻了。

时间表也排好了。北京时间 9 月 14 日 12:00 之后,到 V4.1 Pro 上线之前,所有访问 deepseek-v4-pro 的请求,全部路由到 V4.1 Flash,按 Flash 的单价计费。旧款 V4 Flash 和 V4 Flash Vision Exp 直接下线,旧模型名暂时路由到新模型过渡。合作伙伴动作也快,腾讯 WorkBuddy(含 CodeBuddy)和 OpenCode 宣布全量接入。

一个"最小尺寸"的模型,凭什么干掉 1.6T 参数的旗舰?答案不在跑分表上,在架构里。往下拆。

02非对称架构:输入 8B,输出 16B

第一个改动:读和写,分开配力。

先补一个背景:MoE,混合专家。V4.1 Flash 总参数 552B,但每个 token 走进来,路由器只挑一小部分专家参与计算。具体到这个模型:每层 1 个共享专家加 384 个路由专家,每个 token 只激活 6 个。

所以"大小"要拆成两个数看。总参数决定模型"知道多少",激活参数决定每个 token"花多少钱"。V4 Pro 是 1.6T 总参数、49B 激活;V4.1 Flash 是 552B 总参数,prefill 时激活只有 8B。总参数不到旗舰的一半,单次激活量只有旗舰的六分之一。

项目V4-FlashV4-ProV4.1-Flash
骨干参数284B1.6T552B
每 token 激活13B49B8B(prefill) / 16B(decode)
上下文1M1M1M
LicenseMITMITMIT

真正的新闻在表格外:输入和输出的激活量不一样。8B 对 16B。

这次用的是全新的 Causal Encoder-Decoder 结构,简称 CED。40 层,前 20 层是因果编码器,后 20 层是解码器。理解输入用一套更稀疏的配置,生成输出用一套更足的配置。

为什么能这么干?可以这么理解:prefill 和 decode 本来就是两种活。

Prefill 是"读"。你的 prompt、检索回来的文档、历史对话,几万 token 涌进来,模型要把它们全看一遍,算出注意力。这一段吞吐大,但每个 token 的计算深度可以浅一点——读懂就行。

Decode 是"写"。答案一个 token 一个 token 往外蹦,每一步都要做完整的推理决策。写代码、推数学、走推理链,都发生在这一段。这里省激活,能力会直接掉。

所以 DeepSeek 把力气花在了刀刃上:读的半场用 8B 跑,写的半场用 16B 跑。输入动辄几万 token,输出几百到几千 token,大头在读——读的那段省下来的,就是账单上省下来的。

还有一个模块值得记一笔:Engram。一个 196B 参数的记忆模块,稀疏访问,按需取用。官方口径里的 552B 不包含它。

03KV Cache 瘦身:HBM 只要四分之一

第二个改动,动的是推理成本里最隐蔽的一块。

KV Cache 是什么?注意力机制有个特点:生成每个新 token 时,模型要"回头看"之前所有 token 的 Key 和 Value。为了不重复计算,这些值被缓存起来。这就是 KV Cache。

代价是线性增长的显存。上下文越长,缓存越大。一百万 token 的上下文窗口,KV Cache 能把显存吃到爆。长会话的 Agent,成本大头往往不在计算,在搬运这些缓存——HBM 带宽是硬瓶颈。

V4.1 Flash 对这一刀砍得很深。全局 KV Cache 压到 890 bytes/token,约为上一代 V4-Flash 的四分之一,相对初代模型缩小了 437 倍。落到硬件上:对 HBM 的需求降到 1/4,对 SSD 的需求降到 1/8。

437 倍是什么概念?从初代到现在,上下文窗口在变大,缓存却在变小。两个箭头反向走,靠的不是工艺,是算法:低秩压缩、稀疏注意力,一路叠加到这次的结构改动。

对做 Agent 的人,这一段直接关系到钱包。Agent 会话里,系统提示词、工具定义、历史对话、RAG 检索回来的前缀,常常占输入的九成以上,而这些内容轮轮都一样——缓存命中率能到 99% 以上。账单的大头,就是缓存命中这一项的计费。

缓存小了,命中就便宜了。往下看定价时你会看到这一刀的后果。

04后训练:同一副骨架,练出不同的肌肉

架构是骨架,训练是肌肉。这次两件事都改了。

预训练用了 45T tokens 的多模态语料。稀疏注意力先在 64K 序列长度上训练,训到 34T tokens 的时候,扩展到 1M 上下文。这个"先短后长"的节奏是行业通行做法:长序列训练贵,把基础能力练扎实了再拉长。

更关键的是后训练。公告里的措辞是"经过了更大规模的强化学习后训练"。

这句话放在 2026 年的语境里读:预训练堆参数的边际收益在放缓,RL 后训练成了新的能力引擎。同一副骨架,靠后训练练出不同的肌肉——各家都在把训练预算从预训练往 RL 搬。

模型还支持 reasoning_effort 参数,1 到 100 连续可调。想要更深的推理链,调高;想要快和便宜,调低。成本和准确率的权衡,第一次做成了旋钮,不是档位。

05跑分真相:赢了什么,没赢什么

官方说"全面超越"。拆开看,"全面"要打个引号。

先说赢的。Agentic 和代码类,V4.1 Flash 确实压着旗舰打:

基准V4-ProV4.1-Flash
DeepSWE v1.162.774.2
Terminal-Bench 2.187.990.6
CyberGym83.388.1
AutomationBench43.254.8
Codeforces33483471
HLE(纯文本)42.736.8
SimpleQA-Verified55.242.3

输了的地方也有。纯推理和知识类反过来:HLE 36.8 对 V4 Pro 的 42.7,SimpleQA-Verified 42.3 对 55.2。国盛证券复述官方数据做了个统计:19 项测评里 14 项超过 Pro,约七成半。不是全部。

对跑分这件事本身,也要多留个心眼。这些分数全部来自官方自测,Artificial Analysis 和 LMArena 当时都还没有独立评分。技术报告自己的表 4 显示:只是换一个 scaffold,DeepSWE v1.1 的分数就在 65.5 到 74.2 之间波动。同一个模型,换个脚手架,分差快 9 分。

速度是实打实的。社区实测的生成速度分布很散,从 160 到 500+ t/s 都有人报,取决于任务类型和上下文。但同一组对照很说明问题:同一个提示词写长文,V4.1 Flash 160 t/s,V4 Pro 50 t/s,三倍;首 token 延迟 0.3 秒对 1.1 秒。另一组实测 355-427 t/s、首 token 178 毫秒,对照 V4 Pro 的 63 t/s、766 毫秒。

所以准确的说法是:在"综合性价比"这个维度上——性能、费用、速度、总用时放一起算——Flash 赢了。单项有输有赢,综合成本收益上占优。这个口径,对选型的人其实更有用。

06定价门道:峰谷、缓存和时区

架构省下的钱,最终要落到价格上。

新价格 9 月 10 日 12:00 生效。人民币,每百万 token:闲时缓存命中 ¥0.02、未命中 ¥1.0、输出 ¥4.0。高峰时段全部翻倍:¥0.04、¥2.0、¥8.0。

高峰怎么算?周一到周五的 9:00-12:00 和 14:00-18:00。其余时间,含周末全天,都算闲时。

和旧价比,降幅并不均匀。缓存命中从 ¥0.05 砍到 ¥0.02,降 60%;未命中从 ¥1.5 到 ¥1.0,降 33%;输出从 ¥4.5 到 ¥4.0,只降 11%。

为什么缓存命中降得最狠?回头看第三节。KV Cache 被架构压缩了四倍,成本项里这一块直接塌了下去,降价空间全在这。厂商降价不是发善心,是成本结构变了。

放到市场里比。智谱前不久刚发了 GLM-5.3-Flash,价格比 V4 Flash 还低。逐项对:缓存命中,DeepSeek ¥0.02 对 GLM ¥0.23,便宜十倍;未命中,¥1.0 对 ¥0.8,GLM 略胜;输出 ¥4.0 对 ¥2.8,GLM 便宜四成多。谁更便宜,取决于你的缓存命中率和调用时段。Agent 重度用户,缓存命中的权重最大——这套组合拳是冲着他们去的。

时区陷阱:国内团队白天干活,正好全压在高峰上;把批量任务、后台评测挪到晚上和周末,直接省一半。美洲团队要倒过来算——北京时间的周一到周五白天,换到美东是前一天 21:00 到次日清晨,夜间批处理窗口反而会撞进北京的高峰时段。

最后是开源。MIT 协议,权重已上 Hugging Face。官方欢迎大规模部署,条件明码标价:2k 卡 GPU 起步,带存储集群。

07总结:三个改动,一个信号

回头看,"小模型反超旗舰"不是撞大运。

拆开是三件事。非对称架构,读和写分开配力,激活量砍到旗舰的六分之一。KV Cache 压缩,890 bytes/token,HBM 需求四分之一,缓存计费直接跳水。更大规模的 RL 后训练,把省下来的成本换成了能力。

这三件事指向同一个判断:Scaling Law 放缓之后,"总参数大、激活小、缓存瘦、后训练狠"这条架构优化路线,已经开始产出看得见的回报。堆算力之外,这是第二条路。

至于"全面超越旗舰"——19 项里赢了 14 项,够把 V4 Pro 送下线了。等 V4.1 Pro 用同一套架构放大出来,那才是这套结构的真正亮相。

在那之前,有个更实际的问题:你上个月的 API 账单里,缓存命中占了几成?