Z.ai · 智谱AI · 2026.08.16 发布

GLM-5.3 核心优势全面解读

不换基座,重塑上界——通过极致的后训练 Scaling,GLM-5.3 在编程、智能体与网络安全领域 全面跃升,成为当前能力最强的开源模型之一。

发布日期:2026-08-16 · 基座不变 · 智能跃迁
·

概述:GLM-5.3 是什么

GLM-5.3 是智谱(Z.ai / 智谱AI)发布的新一代模型。它的核心命题并非"更大的基座", 而是 在不更换基座模型的前提下,通过极致的后训练 Scaling 大幅提升模型智能上界。 官方直言:「可能还远未开发出这个基座的智能上界。」

+50%
编程体感提升
较 GLM-5.2
28.3
Terminal-Bench 3.0
由 4.6 跃升
2,436
累计发现漏洞
1,097 个中高危
3000万
经济价值参考
1

优势一:后训练 Scaling 的突破

行业普遍认为"换基座才能变强",而 GLM-5.3 证明了另一条路径—— 后训练阶段的 Scaling 同样能撬动巨大的智能增量

Method 01

IndexShare

新一代数据共享与索引机制,让后训练阶段高效复用高质量轨迹与经验,显著提升样本效率。

Method 02

SAO

面向智能体的优化方法,将"动作—反馈"闭环嵌入后训练,让模型在真实任务中持续自我修正。

Method 03

新一代 Slime 框架

升级版 Slime 框架统一编排后训练流程,支持大规模、多阶段、可复现的训练 Scaling。

🧠

Agent = Model + Harness

GLM-5.3 秉持"Agent = Model + Harness"理念:模型负责推理,Harness 负责环境交互与工具调用,二者协同释放智能上限。

🚀

智能上界尚未触顶

官方明确表示"可能还远未开发出这个基座的智能上界"——意味着后续版本仍可在同一基座上持续爬升。

不换基座,也能大幅提升智能上界。后训练 Scaling,是 GLM-5.3 给出的一份笃定答案。
—— GLM-5.3 核心命题
2

优势二:最强开源编程模型

编程体感较 GLM-5.2 提升 50%,在多项主流编程与智能体评测中大幅跃升, 编程与智能体能力接近 Claude Fable 5

评测项目 GLM-5.2 GLM-5.3 提升
Terminal-Bench 3.0 4.6 28.3 +514%
DeepSWE v1.1 46.2 66.9 +44.8%
Agents' Last Exam 23.8 28.5 +19.7%
Z.ai Code Bench(High 档) 31.4% 超 Claude Opus 4.8(29.5%)

更少的 Token,更强的结果

在 Z.ai Code Bench High 档位达到 31.4% 准确率,超过 Claude Opus 4.8 的 29.5%,而 Token 消耗仅约 5 万,Opus 需约 12 万

🏆

编程能力最强的开源模型

综合编程体感与评测数据,GLM-5.3 是当前 编程能力最强的开源模型,编程与智能体能力接近 Claude Fable 5。

3

优势三:领先的网络安全能力

GLM-5.3 在白盒漏洞识别、深度推理漏洞利用、限时漏洞利用吞吐量等维度全面领先, 累计发现漏洞 2,436 个,其中 1,097 个中高危,覆盖 269 个项目。

84.5%
CyberGym 白盒识别
高于 GPT-5.6 Sol(83.6%)
54.4%
ExploitBench 深度利用
GLM-5.2 仅 24.4%
130
ExploitGym 6h 吞吐
2h 即完成 105 项
~45年
最早可溯漏洞
覆盖 269 个项目

安全防御真实案例

Cursor

保护开发者工具

发现 Cursor 中的权限校验漏洞,避免潜在越权风险。

国民级通讯 APP

数亿日活的私有协议漏洞

在某数亿日活的国民级通讯 APP 中发现私有协议漏洞。

DNS 基础设施

潜伏 40 余年的协议级漏洞

发现 DNS 基础设施中潜伏 40 余年的协议级漏洞。

微软邮件与办公系统

微软官方致谢

微软官方致谢 "Kunlun Lab & GLM"。

人形机器人

远程劫持致命漏洞

发现可远程劫持上千台机器人的致命漏洞。

经济价值

约 3000 万元参考价值

累计发现漏洞的经济价值参考达约 3000 万元

说明:上述案例均来自 GLM-5.3 官方发布的安全防御成果,体现其在真实世界漏洞挖掘与防御中的工程化落地能力。
4

优势四:有责任的开源生态

GLM-5.3 不只是"开源模型",更提出 "开源之盾"计划——将安全防御能力公共化, 让社区共享顶尖的安全能力,而非仅服务于商业闭源产品。

🛡️

"开源之盾"计划

将 GLM-5.3 的安全防御能力公共化,向社区开放顶尖漏洞挖掘与防御能力,推动行业整体安全水位提升。

🔓

完整权重两周内开源

完整模型权重将在 两周内开源,确保开发者可本地部署、二次开发与私有化审查。

🧭

分层风险审查系统

采用以意图为中心的审查方法,分层评估风险,在开放与责任之间取得平衡。

🌍

能力公共化而非锁闭

将业界顶尖的安全能力以开源方式释放,区别于"能力越强、越闭源"的闭源路径。

5

优势五:完善的工具生态

围绕 GLM-5.3 构建了从编程、效率到多平台接入的完整工具链,开发者可在熟悉的环境中直接使用。

💻

ZCode 编程工具

官方编程工具,深度集成 GLM-5.3 的编程与智能体能力。

⚙️

AutoClaw 效率工具

自动化效率工具,助力复杂任务的端到端推进。

🧰

多平台支持

TraeWork / TraeCode、扣子、WorkBuddy / CodeBuddy、Qoder / QwenWork 等。

📦

GLM Coding Plan

面向高频编程用户的订阅方案,提供稳定的使用额度与优先级。

🔌

Agent = Model + Harness

基于 Harness 理念,工具链可与模型协同,释放智能体上限。

🚀

开箱即用

从本地 IDE 到云端平台,开发者无需自建脚手架即可上手。

6

优势六:高性价比

完整权重开源,本地部署免费;而能力相近的闭源模型订阅费用高昂。 GLM-5.3 以 更低的 Token 消耗开源免费 的双重优势,显著降低使用门槛。

对比维度 GLM-5.3(开源) 闭源旗舰
模型权重 完整开源 闭源
本地部署 免费 不支持
High 档 Token 消耗 约 5 万 约 12 万(Opus)
安全能力 "开源之盾"公共化 锁闭于商业产品
订阅方案 GLM Coding Plan 高昂月费
关键结论:在相近的编程与智能体能力下,GLM-5.3 以约 5 万 Token 完成 Opus 需约 12 万 Token 的任务, 叠加开源免费本地部署,整体性价比显著优于闭源旗舰。
7

优势七:参数量与私有化部署

GLM-5.3 与 GLM-5.2 共享同一基座——所有提升来自后训练,模型结构不变。 以下参数量与部署需求基于 GLM-5 / GLM-5.2 官方技术报告(同基座), 结合 8 卡 H20 显存进行 估算,仅供私有化部署规划参考。

① 参数量信息

~744B
模型总参数量
约 7440 亿(同 GLM-5.2 基座)
~40B
激活参数量
每次推理仅激活约 400 亿
256 / 8
专家数 / 每次激活
稀疏度约 5.4%
1M
原生上下文
78 层 · DSA 稀疏注意力
🧬

MoE 混合专家架构

GLM-5.3 采用 MoE 架构:总参数约 744B,但每次推理仅激活约 40B(约 5.4%)。前三层为密集层,后续层使用 DeepSeek 风格稀疏注意力(DSA),大幅降低长上下文计算成本。

🔁

基座不变,后训练 Scaling

GLM-5.3 的参数量与结构与 GLM-5.2 完全一致。MoE 的优势在于降低单次推理计算量,但全部专家参数仍需驻留显存——这是部署成本的核心约束。

② 私有化部署 GPU 需求(8 卡 H20 估算)

H20 是英伟达面向中国市场的合规特供卡,单卡 96GB HBM3,带宽 4.0TB/s,支持 NVLink 900GB/s。 8 卡 H20 总显存 = 96GB × 8 = 768GB

部署精度 权重体积(参考) vLLM 建议最低显存 8 卡 H20(768GB)是否可承载
BF16(全精度) ~1.51 TB ~1786 GB 否(需约 19 卡 / 3 节点)
FP8(推荐默认) ~756 GB ~893 GB 否(需约 10 卡 / 2 节点)
INT4(社区量化) ~400 GB+ ~400 GB+ 可单节点部署
2-bit(极限量化) ~241–281 GB ~256 GB+ 是(更宽裕)
⚖️

8 卡 H20 的现实定位

768GB 显存 不足以跑 FP8(需 893GB),但可承载 INT4 / 2-bit 量化推理。若需 FP8 原版精度,建议 2 节点 16 卡 H20(1536GB);BF16 则需 3 节点 24 卡。

🛠️

部署建议

8 卡 H20 + INT4 量化:128K 上下文起步,中低并发;上下文越长,KV Cache 占用越大,可支持并发越少。长上下文 1M 场景建议增加节点或使用 FP8 KV Cache。

③ 部署成本估算表

方案 硬件配置 总显存 服务器成本(估算) 支持精度
8 卡 H20(单节点) H20 SXM ×8 768 GB 约 120–180 万元 INT4 / 2-bit 量化
16 卡 H20(双节点) H20 SXM ×16 + 高速网络 1536 GB 约 280–380 万元 FP8(推荐)
8 卡 H200(参考) H200 SXM ×8(141GB/卡) 1128 GB 约 350 万元 FP8 单节点
云端 API 调用 无需自有硬件 按 Token 计费 原版精度
成本说明(估算 / 参考):H20 服务器价格为基于 H20 单卡市场价与整机配置的估算区间,实际随供应链、配置与时间波动; 8 卡 H200 的约 350 万元来自 GLM-5.2 部署成本公开测算。H20 为中国合规特供卡,单价显著低于 H200,是受出口管制下国内私有化部署的现实选择。
私有化部署 GLM-5.3 的门槛不在"能否加载",而在"能否以目标精度与上下文稳定服务"——8 卡 H20 是 INT4 量化的起点,FP8 原版精度建议 2 节点起。
—— 部署规划参考结论
8

竞品对比:GLM-5.3 vs 主流旗舰

从开源、编程、安全、性价比等核心维度,对比 GLM-5.3 与 Claude Fable 5、GPT-5.6 Sol、DeepSeek V4-Pro。

维度 GLM-5.3 Claude Fable 5 GPT-5.6 Sol DeepSeek V4-Pro
是否开源 权重两周内开源 部分开源
编程能力 最强开源体感 +50% 接近(GLM 已逼近)
Terminal-Bench 3.0 28.3
网络安全(CyberGym) 84.5%领先 83.6%
ExploitBench 深度利用 54.4%
Token 效率(High 档) 约 5 万更省 约 12 万(Opus 对比项)
安全能力公共化 "开源之盾"计划
本地部署 支持(免费) 不支持 不支持 部分支持
性价比 极高 高费用 高费用 较高
说明:"—"表示该模型在对应评测上未公布官方数据;对比项以官方公开信息为准。GLM-5.3 在开源、安全与性价比维度具备明显差异化优势。
9

使用场景推荐