智谱 · GLM-5.3-FlashX

同一个模型,凭什么快 5 倍

模型一个字没动,速度 5 倍、价格 2.5 倍——多出来的速度从哪来,又卖给谁

2026-09-19推理基础设施 · 深度科普约 15 分钟

00引言:一场没换模型的"发布会"

三个数字,一个疑问:权重文件没变,速度从哪来。

9 月 18 日中午,智谱在官方微信发了一条消息:GLM-5.3-FlashX 上线,API 同步全面开放。

三个数字一起公布:推理速度最高 200 tokens/s,比现有 GLM-5.3-Flash 快 5 倍,定价是原版的 2.5 倍。

没有发布会。也没有新模型。320B 总参数、18B 激活、1M 上下文、原生多模态——翻开技术文档,每一项都和 8 月 26 日上线的 GLM-5.3-Flash 一模一样。智能水平没涨没跌,AA 综合智能指数还是那个 57 分。

模型一个字没动,速度从哪来?

这笔账值得算。40 tokens/s 和 200 tokens/s,用起来是两种东西。前者,你看着字一个一个往外挤,读得比它吐得快。后者,字成段往外涌,你得集中注意力才跟得上。但权重文件是同一份——多出来的 160 tokens/s,总得有个出处。

智谱官方的说法很克制:"为满足快速增长的需求,持续加大 Infra 侧的投入与推理优化。"翻译一下:模型没变,跑模型的系统变了。

这篇文章顺着这条线往下挖。先把大模型为什么天生慢讲透,再看这 5 倍速度具体从哪里抠出来,最后算一算"快 5 倍、贵 2.5 倍"这门生意卖给谁。看完之后,再遇到任何"同一个模型提速 N 倍"的新闻,你都能自己拆出答案。

01大模型的速度,到底卡在哪?

瓶颈不是算不快,是搬不动。推理是带宽活,不是算力活。

想明白"快 5 倍"有多反常识,得先知道大模型为什么慢。

大模型生成文字的方式,叫自回归解码。说白了就一个动作:挤。牙膏式的挤。

每生成一个 token,模型都要把前文完整"看"一遍,算出下一个 token 的概率分布,挑一个,吐出来。然后把刚吐出来的这个加进前文,再看一遍,再吐下一个。你让它写一篇 800 字的文章,这个循环要重复一千多次。

重复计算不浪费吗?浪费。所以有个补救机制,叫 KV 缓存:前面算过的中间结果存进显存,下次不必重算。代价是显存——对话越长,缓存越大。百万 token 的上下文塞满后,缓存本身就是几十 GB 的负担。

真正的瓶颈在这:每生成一个 token,芯片都要把激活的模型权重从显存完整读一遍。每一个 token,都要读一遍。

算笔账(量级示意):GLM-5.3-Flash 是 MoE 架构,总参数 320B,每个 token 只激活 18B。按 BF16 精度存,18B 参数约 36 GB。一张高端 AI 芯片的显存带宽按 3 TB/s 算,36 GB 除以 3 TB/s 约等于 12 毫秒——这是读一遍权重的硬底线。一秒 1000 毫秒,除以 12,单卡理论极限约 80 tokens/s。再算上 KV 缓存的搬运、调度开销、网络往返,实际落在 40 tokens/s 上下。对上了。实际部署会把权重切片到多卡、让同批请求摊薄搬运,但量级逻辑不变。

看出问题了吗?瓶颈不是"算不快",是"搬不动"。解码的时候,芯片的计算单元大部分时间在空转,等数据从显存流进寄存器。训练大模型是算力活,跑大模型是带宽活。行话叫 memory-bound,访存受限。

从这条物理规律出发,提速的路径一共四条,没有第五条:

路径通俗理解归谁管
搬的东西变少参数更稀疏、缓存更小模型架构
搬得更快更新的芯片、更大的带宽硬件
多人拼车一个批次装更多请求,一趟搬运大家摊调度系统
改流水线读题和答题分开跑,互不拖累部署架构

8 月那版 GLM-5.3-Flash,已经把第一条走到头了。跟 GLM-4.5 相比,总参数相当(355B → 320B),激活参数几乎减半(32B → 18B),层数从 92 砍到 45。再叠上稀疏注意力与线性注意力的混合架构、IndexPool 索引压缩,注意力计算量比 GLM-5.3 降了 3.01 倍,KV 缓存小了 4.44 倍。30T token 的多模态语料预训练,让它在参数减半的情况下智能反超上一代。

第一条路到顶了。所以 FlashX 的 5 倍,只能从后三条里来。这三条有个共同的名字——Infra,基础设施。

02模型没变,那 FlashX 到底改了什么?

模型是发动机,推理系统是变速箱。FlashX 动的全部是后者。

先划清一条边界:你调用的"模型",其实是两层东西。

底层是权重文件。几百 GB 的数字,训练完就定型。GLM-5.3-Flash 和 FlashX,用的是同一份。这层决定"聪明不聪明"。

上层是推理系统。调度器决定请求的先来后到,批处理器决定多少人拼一辆车,内存管理器决定 KV 缓存怎么摆,往下还有算子优化、并行策略、机器间通信。这层决定"快不快、贵不贵"。

同一份权重,换一套推理系统,速度差几倍是常态。行业里早有惯例:同一个开源模型,不同推理引擎去跑,吞吐榜单能差出好几倍。模型是发动机,推理系统是变速箱、轮胎和风阻。发动机不变,把整车调校好,照样快。

FlashX 动的全部是上层。API 换个名字(glm-5.3-flash → glm-5.3-flashx),参数原样兼容,上下文、最大输出、多模态能力一项没动。

技术社区的分析,指向一个关键词:分离部署

传统部署里,一个请求的"预填充"(读题)和"解码"(答题)在同一批机器上干。这两件事脾气完全相反。预填充是算力密集——一次并行算几百上千个 token,把计算单元喂饱。解码是带宽密集——一次算一个 token,把显存带宽吃满。混在一起,互相拖累:解码时算力闲着,预填充时带宽空着。

拆开,各干各的。读题的机器专职读题,答题的机器专职答题,中间靠高速网络传 KV 缓存。据第三方技术社区的分析,智谱这套分离式流水线(EPD)把端到端服务性能拉高了约 3 倍。

问题来了:这技术不是今天才有的。为什么以前不拆?

成本。分离部署要更多机器、更复杂的调度、更长的链路。需求不够的时候,这笔账算不过来。单机混部,一张卡顶两张卡用,省。

现在,需求爆了。

回头看 8 月。GLM-5.3-Flash 正式发布前,智谱没挂自己的牌子,用"Ox-Alpha"的匿名身份把模型放上了 OpenCode 和 OpenRouter。没有品牌背书,没有发布会,裸着上线。中文社区给它起了个外号,叫"牛来"。

那几天,开发者社区里最热的话题不是夸模型,是猜身世。"这个 Ox-Alpha 到底是谁家的?"帖子一条接一条。没人认领。模型闷头刷榜,调用量自己说话——当周双平台最受欢迎,创下调用量新高。第三方统计说,仅 OpenRouter 一个平台,6 天跑了超过两万亿 token。

9 月 18 日,答案揭晓。智谱官宣:Ox-Alpha 就是 GLM-5.3-Flash,这些流量全部跑在国产芯片上。10 万张国产芯片组成的推理集群,上线即被打满。

打满,是好事,也是坏事。坏就坏在:没有余量。想降批次、拆流水线、堆缓存?先得有富余的机器。于是有了下一步。

0310 万张芯片,怎么变成 200 tokens/s?

四招全是工程:降批次、拆流水线、堆缓存、自动调优。

先把钱的事说了。

今年 7 月,智谱完成 40 亿美元再融资。9 月,又完成 50 亿美元。两个月,90 亿美元,主要砸向算力扩容。这个节奏只说明一件事:需求跑在供给前面,而且持续跑在前面。

机器到位,提速的手段才解锁。挨个说。

第一招,降批次。批处理是推理系统的基本操作:把同时到达的请求凑成一车,一趟搬运,大家摊。批次塞 64 个请求,每人分到的带宽就是 1/64;塞 8 个,就是 1/8。人少车轻,人人都快。代价也直白——芯片利用率掉下来,单位 token 的成本升上去。这是用钱换速度最直接的一招。

第二招,分离部署。上一章讲过:读题和答题拆开,各配专职机器。端到端约 3 倍的提升,主要来自这里。

第三招,堆缓存。上下文缓存在 Agent 场景里是刚需:每一轮对话都要重发前文,缓存命中一次,就少搬一遍几个 GB 的数据。FlashX 给缓存命中的定价是 0.57 元/百万 token——不到输入原价的三折。这个定价在明着鼓励你把缓存用起来。

第四招,把调优本身自动化。调度策略、批大小、并行配置,这些参数的组合是个无底洞,人肉调优调不过来。据报道,智谱在这套系统里引入了自动化的调优手段,让推理集群自己逼近最优配置。单点收益不起眼,积少成多。

四招叠加,40 tokens/s 变 200 tokens/s。没有魔法,没有换模型,全是工程。

这里停一秒,看一个反直觉的事实:低延迟是"浪费"出来的。

吞吐和延迟,天生一对矛盾。同一张芯片,把请求塞满跑,单位时间吐出的 token 总量最大,但每个请求都慢;少塞请求跑,每个请求都快,但芯片大部分算力在空转。FlashX 选了后者:把利用率降下来,把速度换上去,再把多出来的成本,通过 2.5 倍的定价,转给最在乎速度的人。

快不是变出来的,是买来的。

04快 5 倍只贵 2.5 倍,谁在买单?

速度第一次成了独立于智能的计价维度。

先把价目表摆出来(第三方信息整理,以智谱官方页面为准):

计费项(元 / 百万 token)GLM-5.3-FlashGLM-5.3-FlashX倍数
输入0.822.5×
输出2.872.5×
缓存命中0.230.57约 2.5×

绝对值看是涨价。但贵不贵,要看省了什么。

先分清两个常被混为一谈的指标:首字延迟(按下回车,第一个字多久出来)和吐字速度(之后每秒吐几个字)。首字延迟由预填充决定,输入越长越慢;吐字速度由解码阶段的带宽决定。FlashX 主打后者——200 tokens/s。对长输出的任务,这个差距是碾压级的。

两类人完全不用考虑 FlashX。一类是离线批处理:夜里跑几百万条数据清洗,快慢无所谓,成本优先,用 Flash。另一类是延迟无感场景:生成报告、总结文档,用户本来就不盯着屏幕等。

该认真考虑的,是三类人。

第一类,Agent 开发者。FlashX 瞄准的核心人群。

Agent 的工作方式是循环:想一步,调一次工具,看结果,再想一步。每一步都要过一遍模型。一轮典型循环,2 到 3 秒。听着不多?乘一下:10 轮迭代,光等待就半分钟起步。真实的 Agent 任务,几十轮上百轮是常事。5 倍速度意味着,原来 10 分钟的任务变 2 分钟,原来"不可用"的变"可用"。Agent 能力的上限,一半卡在模型智能,另一半就卡在这个循环的速度上。

用过慢模型的开发者都熟悉这个场景:终端里光标闪着,第一行代码迟迟不来。你数着秒。第五秒,函数名蹦出来,然后又停住。注意力就在这一停一顿里漏光了。换快 5 倍的模型,字是成段涌出来的——你还没读完上一段,下一段已经到了。差别的本质不在数字,在于你还愿不愿意让它继续干活。

第二类,实时交互产品。在线客服、语音助手、陪伴类应用。用户发问之后,第一个字必须在半秒内出现,之后吐字不能肉眼可见地卡顿。这类产品里,吐字速度就是体验本身——不是加分项,是及格线。

第三类,AI 编程。代码补全对延迟的容忍是毫秒级的:建议慢上几百毫秒,工程师就直接手打了,工具从"帮忙"变成"挡路"。智谱的 GLM Coding Plan 里,Flash 的用量涨得快;FlashX 暂时还没进套餐——留着单独收费,看得出这个档位的定价底气。

再算一笔钱:一个 Agent 任务,消耗 10 万 token,其中输出 3 万。用 Flash,输出费 0.084 元;用 FlashX,0.21 元。多花不到一毛三分钱,整个任务快了几分钟。工程师一小时的成本上百元。这笔账不难算。

在按 token 计费的生意里,"速度"第一次成了独立计价的维度。以前你只为聪明付钱。现在,你可以单为快付钱。

05智谱在下什么棋?

同一颗大脑,拆成档位卖。竞争重心从"训得聪明"转向"跑得又快又便宜"。

把产品线摊开,格局就清楚了:

产品智能速度价格
GLM-5.3旗舰标准基准
GLM-5.3-FlashAA 57,进入全球前沿区间约 40 tokens/sGLM-5.3 的 1/10(限时 1/20)
GLM-5.3-FlashX与 Flash 相同最高 200 tokens/sFlash 的 2.5 倍

同一颗大脑,拆成档位卖。像机票:经济舱、商务舱,目的地一样。Flash 是经济舱,便宜、能到;FlashX 是商务舱,贵 2.5 倍,快 5 倍。

这颗大脑本身值多少钱?8 月定价时说得直白:GLM-5.3-Flash 的价格是 GLM-5.3 的 1/10,限时折扣内 1/20,是 Claude Opus 4.8 的 1/40。AA 指数 57 分,跟 Opus 4.8 持平。同样的分数,四十分之一的价格。便宜不是偷工减料,是架构省出来的。官方博客里还有个例子:不给任何外部素材,让模型自己在 Blender 里搭一套约 400 平方米的专业主厨自宅加测试厨房,它自主跑了 16 个小时。这颗大脑的能耐,FlashX 原样继承。

再看棋盘另一边,钱从哪来。

上半年,智谱的算力乘数指标同比增长 14 倍。瑞银预计,这个指标未来 6 到 12 个月内超过 1。翻译成人话:每投一份算力,能挣回超过一份的收入,收入增长不再被算力卡脖子。

10 月起,智谱与海内外头部云服务商签的收入分成协议开始确认收入。GLM 系列开源模型不再只是生态投入,开始借第三方的机房和销售渠道变现。

这条路的参照系是 Anthropic。Claude 上了 AWS Bedrock、Google Cloud Vertex AI、Microsoft Azure Foundry 三大平台,年化收入从 2025 年底约 90 亿美元,涨到 2026 年春季的 300 亿以上。智谱把年末 ARR 指引从 24 亿美元上调到 30 亿美元,上调 25%。当前全业务 ARR,18 亿美元。

FlashX 在棋盘上的位置:把"速度"这个新维度变现的第一颗棋子。算力扩容的钱已经花出去,需求已经验证,现在把富余的算力包装成低延迟服务,卖给最愿意付钱的人——同时给接下来更大规模的 Agent 时代占位。

往大了说,这是全行业竞争重心的转移。过去两年,大家比谁训得聪明:刷榜、抢跑、发论文。现在智能差距在收窄,跑模型的成本和速度开始成为胜负手。模型能力是入场券,Infra 是护城河。智谱这步棋,把胜负手压在了"快"上。

06收尾:下次看到"提速 N 倍",先问一句

是模型变了,还是系统变了?两个答案指向完全不同的东西。

先问一句:是模型变了,还是系统变了?

模型变了,意味着架构、数据、训练方法更新了,智能本身在涨。它决定模型"能干什么"。系统变了,意味着算力、调度、部署更新了。它决定模型"跑多快、多贵"。

两个答案指向完全不同的东西。前者是研究问题,进步以"代"计;后者是工程和生意问题,进步以"版本"计。前者难,后者贵。

FlashX 是后者。同一个大脑,换了一套更快的神经系统,再把这套系统的成本,定成一个新档位卖给你。

值不值,取决于你的时间值多少钱。智谱赌的是:Agent 干的活越多,人对"等它干完"的耐心就越少。

这个赌注,接下来一年见分晓。