不换基座,重塑上界——通过极致的后训练 Scaling,GLM-5.3 在编程、智能体与网络安全领域 全面跃升,成为当前能力最强的开源模型之一。
GLM-5.3 是智谱(Z.ai / 智谱AI)发布的新一代模型。它的核心命题并非"更大的基座", 而是 在不更换基座模型的前提下,通过极致的后训练 Scaling 大幅提升模型智能上界。 官方直言:「可能还远未开发出这个基座的智能上界。」
行业普遍认为"换基座才能变强",而 GLM-5.3 证明了另一条路径—— 后训练阶段的 Scaling 同样能撬动巨大的智能增量。
新一代数据共享与索引机制,让后训练阶段高效复用高质量轨迹与经验,显著提升样本效率。
面向智能体的优化方法,将"动作—反馈"闭环嵌入后训练,让模型在真实任务中持续自我修正。
升级版 Slime 框架统一编排后训练流程,支持大规模、多阶段、可复现的训练 Scaling。
GLM-5.3 秉持"Agent = Model + Harness"理念:模型负责推理,Harness 负责环境交互与工具调用,二者协同释放智能上限。
官方明确表示"可能还远未开发出这个基座的智能上界"——意味着后续版本仍可在同一基座上持续爬升。
编程体感较 GLM-5.2 提升 50%,在多项主流编程与智能体评测中大幅跃升, 编程与智能体能力接近 Claude Fable 5。
| 评测项目 | GLM-5.2 | GLM-5.3 | 提升 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | +514% |
| DeepSWE v1.1 | 46.2 | 66.9 | +44.8% |
| Agents' Last Exam | 23.8 | 28.5 | +19.7% |
| Z.ai Code Bench(High 档) | — | 31.4% | 超 Claude Opus 4.8(29.5%) |
在 Z.ai Code Bench High 档位达到 31.4% 准确率,超过 Claude Opus 4.8 的 29.5%,而 Token 消耗仅约 5 万,Opus 需约 12 万。
综合编程体感与评测数据,GLM-5.3 是当前 编程能力最强的开源模型,编程与智能体能力接近 Claude Fable 5。
GLM-5.3 在白盒漏洞识别、深度推理漏洞利用、限时漏洞利用吞吐量等维度全面领先, 累计发现漏洞 2,436 个,其中 1,097 个中高危,覆盖 269 个项目。
发现 Cursor 中的权限校验漏洞,避免潜在越权风险。
在某数亿日活的国民级通讯 APP 中发现私有协议漏洞。
发现 DNS 基础设施中潜伏 40 余年的协议级漏洞。
微软官方致谢 "Kunlun Lab & GLM"。
发现可远程劫持上千台机器人的致命漏洞。
累计发现漏洞的经济价值参考达约 3000 万元。
GLM-5.3 不只是"开源模型",更提出 "开源之盾"计划——将安全防御能力公共化, 让社区共享顶尖的安全能力,而非仅服务于商业闭源产品。
将 GLM-5.3 的安全防御能力公共化,向社区开放顶尖漏洞挖掘与防御能力,推动行业整体安全水位提升。
完整模型权重将在 两周内开源,确保开发者可本地部署、二次开发与私有化审查。
采用以意图为中心的审查方法,分层评估风险,在开放与责任之间取得平衡。
将业界顶尖的安全能力以开源方式释放,区别于"能力越强、越闭源"的闭源路径。
围绕 GLM-5.3 构建了从编程、效率到多平台接入的完整工具链,开发者可在熟悉的环境中直接使用。
官方编程工具,深度集成 GLM-5.3 的编程与智能体能力。
自动化效率工具,助力复杂任务的端到端推进。
TraeWork / TraeCode、扣子、WorkBuddy / CodeBuddy、Qoder / QwenWork 等。
面向高频编程用户的订阅方案,提供稳定的使用额度与优先级。
基于 Harness 理念,工具链可与模型协同,释放智能体上限。
从本地 IDE 到云端平台,开发者无需自建脚手架即可上手。
完整权重开源,本地部署免费;而能力相近的闭源模型订阅费用高昂。 GLM-5.3 以 更低的 Token 消耗 和 开源免费 的双重优势,显著降低使用门槛。
| 对比维度 | GLM-5.3(开源) | 闭源旗舰 |
|---|---|---|
| 模型权重 | 完整开源 | 闭源 |
| 本地部署 | 免费 | 不支持 |
| High 档 Token 消耗 | 约 5 万 | 约 12 万(Opus) |
| 安全能力 | "开源之盾"公共化 | 锁闭于商业产品 |
| 订阅方案 | GLM Coding Plan | 高昂月费 |
GLM-5.3 与 GLM-5.2 共享同一基座——所有提升来自后训练,模型结构不变。 以下参数量与部署需求基于 GLM-5 / GLM-5.2 官方技术报告(同基座), 结合 8 卡 H20 显存进行 估算,仅供私有化部署规划参考。
GLM-5.3 采用 MoE 架构:总参数约 744B,但每次推理仅激活约 40B(约 5.4%)。前三层为密集层,后续层使用 DeepSeek 风格稀疏注意力(DSA),大幅降低长上下文计算成本。
GLM-5.3 的参数量与结构与 GLM-5.2 完全一致。MoE 的优势在于降低单次推理计算量,但全部专家参数仍需驻留显存——这是部署成本的核心约束。
H20 是英伟达面向中国市场的合规特供卡,单卡 96GB HBM3,带宽 4.0TB/s,支持 NVLink 900GB/s。 8 卡 H20 总显存 = 96GB × 8 = 768GB。
| 部署精度 | 权重体积(参考) | vLLM 建议最低显存 | 8 卡 H20(768GB)是否可承载 |
|---|---|---|---|
| BF16(全精度) | ~1.51 TB | ~1786 GB | 否(需约 19 卡 / 3 节点) |
| FP8(推荐默认) | ~756 GB | ~893 GB | 否(需约 10 卡 / 2 节点) |
| INT4(社区量化) | ~400 GB+ | ~400 GB+ | 是可单节点部署 |
| 2-bit(极限量化) | ~241–281 GB | ~256 GB+ | 是(更宽裕) |
768GB 显存 不足以跑 FP8(需 893GB),但可承载 INT4 / 2-bit 量化推理。若需 FP8 原版精度,建议 2 节点 16 卡 H20(1536GB);BF16 则需 3 节点 24 卡。
8 卡 H20 + INT4 量化:128K 上下文起步,中低并发;上下文越长,KV Cache 占用越大,可支持并发越少。长上下文 1M 场景建议增加节点或使用 FP8 KV Cache。
| 方案 | 硬件配置 | 总显存 | 服务器成本(估算) | 支持精度 |
|---|---|---|---|---|
| 8 卡 H20(单节点) | H20 SXM ×8 | 768 GB | 约 120–180 万元 | INT4 / 2-bit 量化 |
| 16 卡 H20(双节点) | H20 SXM ×16 + 高速网络 | 1536 GB | 约 280–380 万元 | FP8(推荐) |
| 8 卡 H200(参考) | H200 SXM ×8(141GB/卡) | 1128 GB | 约 350 万元 | FP8 单节点 |
| 云端 API 调用 | 无需自有硬件 | — | 按 Token 计费 | 原版精度 |
从开源、编程、安全、性价比等核心维度,对比 GLM-5.3 与 Claude Fable 5、GPT-5.6 Sol、DeepSeek V4-Pro。
| 维度 | GLM-5.3 | Claude Fable 5 | GPT-5.6 Sol | DeepSeek V4-Pro |
|---|---|---|---|---|
| 是否开源 | 是权重两周内开源 | 否 | 否 | 部分开源 |
| 编程能力 | 最强开源体感 +50% | 接近(GLM 已逼近) | 强 | 强 |
| Terminal-Bench 3.0 | 28.3 | — | — | — |
| 网络安全(CyberGym) | 84.5%领先 | — | 83.6% | — |
| ExploitBench 深度利用 | 54.4% | — | — | — |
| Token 效率(High 档) | 约 5 万更省 | — | — | 约 12 万(Opus 对比项) |
| 安全能力公共化 | "开源之盾"计划 | 否 | 否 | 否 |
| 本地部署 | 支持(免费) | 不支持 | 不支持 | 部分支持 |
| 性价比 | 极高 | 高费用 | 高费用 | 较高 |