GLM 5.3:什么都不改,反而成了最佳开源大模型
GLM 5.3 是当下最佳开源大模型:Z.ai 没有改架构,还是那个 744B 模型,只是把后训练拉得更长。价格、跑分和对你生意的实际影响,一次讲清。
Oleksandr Moccogni
八月最重要的 AI 模型,没有换新大脑。GLM 5.3 是你现在能租到的最佳开源大模型,而它甚至不是一个新模型。
核心要点
我的主业是搭建 AI 驱动的营销系统,我终端里那个编程 agent 就跑在 GLM 5.3 上。它会搭建落地页、重构埋点代码,还能通过 agent bridge 操控 Blender 里的 3D 物体,而我在一旁喝咖啡。一年前这是演示视频,现在只是个普通的星期二。
接下来是没人写进标题的部分。GLM 5.3 不是新模型。它和 GLM 5.2 是同一个模型,只是训练得更久。同样的架构,同样的注意力层,同样的 7440 亿参数。Z.ai 没有发明任何新东西才走到今天,他们只是拒绝停止训练。
这个细节就是 AI 竞赛此刻的全部故事。我来带你过一遍发生了什么,全部对照一手来源核实过,再讲讲如果你像我一样在这些模型之上做开发,这对开源 AI 格局意味着什么。

GLM 5.3 到底是什么
2026 年 8 月 14 日,Z.ai(智谱 AI 背后的公司)发布了 GLM 5.3,这是他们新的前沿编程模型。官方声明大多有独立分析背书:
- 最强的开放权重编程模型,在 Z.ai 自家的 Code Bench 上比 GLM 5.2 提升了 50%。
- 它在很多 benchmark 上击败 Kimi K3,按 Interconnects 的分析,它在部分测试中追平或超过 Claude Fable 5 与 GPT-5.6-Sol,站到了 agentic coding 的最前沿附近。
- 它快:Artificial Analysis 测得 GLM 5.3 约每秒 93 个 token,而 Kimi K3 是 39。
- 它便宜:Z.ai API 上每百万输入 token 1.40 美元,每百万输出 token 4.40 美元。同样的用量下,Claude Fable 5 是 10 美元和 50 美元。
把这段价格再读一遍,因为这才是安静的重磅炸弹:接近前沿的输出质量,输入比 Anthropic 旗舰便宜约 7 倍,输出便宜约 11 倍。
如果你跑的 agentic 工作流单个任务就要烧掉一百万 token,这不叫打折,这是另一种商业模式。
出于较真说句实话,这些事我都核实过。截至本文写作时,GLM 5.3 自己的权重在 Hugging Face 上仍未放出,zai-org 最新的仓库还停留在更早的 GLM 版本。Z.ai 把它定位为自家的开放权重产品线,并预告发布后约两周内放出权重。把“开放”当作方向就好,在制定自托管方案之前,先确认权重真的落地。
GLM 5.3 对比 Fable 5:诚实的数字
你不必盲信 Z.ai 的营销说辞。Together AI 把两个模型都放上了 DeepSWE,一个真实世界的软件工程 benchmark:904 次 agent rollout,每个模型 452 次。这是关于前沿到底在哪、最接近照片的东西。
**Pass@1,官方的首次尝试得分:GLM 5.3 解决 69.0% 的任务,Fable 5 解决 69.7%。**差距落在统计噪声区间之内。在真实工作上,这是平手。
给每个模型更多尝试次数,GLM 就反超了:Pass@2 是 81.1% 对 77.1%,Pass@4 是 87.6% 对 84.1%。
然后是那句值钱的话。**每次 rollout 的成本:3.99 美元对 21.63 美元。**每花 100 美元,GLM 5.3 交付 17 个解决的任务,Fable 5 只交付 3 个。

Fable 5 还在哪里赢?前沿 harness 类 benchmark:在 Z.ai 自家 Code Bench 上全力跑分是 39.5% 对 34.5%,在 ExploitGym 的长程安全任务上明显领先。还有 Rust,Fable 以 85% 对 70% 领先。如果你的工作负载是 Rust 加重序列化,那就为前沿付费。
路由思路是这堆数据里最实用的宝石。先走 GLM,只有失败时再升级到 Fable,你能拿到 81.1% 的准确率,单任务成本 10.74 美元。这优于单独使用 Fable(69.7% 准确率、21.63 美元)。两个维度都更好,成本还减半。大多数跑前沿模型的团队从没算过这笔账。
同一个大脑,更长的训练:一句关键的坦白
这次发布里最有意思的句子不在跑分图上,而在 Z.ai 对模型自己的描述里:
“我们为 GLM-5.3 做的全部事情,就是扩展后训练。”
细品这句话。行业对进步的心智模型是这样的:新架构、更大的模型、更聪明的模型。每一次能力跃迁都应该伴随包装盒上的新数字和一篇全新的研究论文。
GLM 5.3 说不。基座模型与 GLM 5.2 完全相同。参数量没有变:约 744B 总参数,Mixture-of-Experts 架构,每个 token 激活约 40B,继承自 GLM-5 基座。变的是后训练:更多环境、更多样的任务、以及在海量真实任务上练习所烧掉的算力。这种能力没法靠抄更大模型的答案伪造出来。
说白了:他们给同一个大脑安排了多年刻意练习,而不是换一个更大的脑壳。
而且这份练习可以量化,因为发布对比把两个版本放上了同一组 benchmark:
- Terminal-Bench 3.0:从 4.6 到 28.3。
- SWE-Marathon v1.1:从 19.4 到 42.5。
- DeepSWE v1.1:从 46.2 到 66.9。

产出这些数字的不是新架构,是刻意练习。
Interconnects 称这次的结果是“幅度相当惊人的分数提升”。而且发布节奏和分数本身同样重要。当西方实验室把两次发布之间的时间花在私下测试上时,中国实验室以天为单位交付而非以月,并且用好其中的每一天往上爬。
规模悖论:744B 击败 2.8T
接下来我要戴上分析师的帽子,因为这些数字讲了一个不太舒服的故事。
| 模型 | 实验室 | 总参数 | 备注 |
|---|---|---|---|
| GLM 5.3 | Z.ai | 约 744B(激活 40B) | 在很多 benchmark 上击败下方的 Kimi K3 |
| Kimi K3 | Moonshot AI | 约 2.8T(896 个专家) | 原生多模态,1M 上下文 |
| Qwen3.8-Max | 阿里巴巴 | 约 2.4T(激活 95B) | 首个开放权重的 Max 级模型 |
| DeepSeek V4 Flash 0731 | DeepSeek | 284B(激活 13B) | 仅重新后训练,提升显著 |
一个 744B 模型在跑分上超过一个 2.8 万亿参数的模型,这不是四舍五入的误差,这是一份诊断书。

先说前提:Kimi K3 把容量花在了编程 benchmark 不计分的原生多模态工作上。即便把这一点算进去,信号也很难忽视。如果一个体量小近四倍的模型能在双方同台竞技的 benchmark 上获胜,那更大的那个模型就是训练不足。我的判断:Kimi K3 不笨,它只是还没完工。
它的架构原始容量比 GLM 5.3 更大。跑分差距衡量的是还有多少后训练的余量趴在桌上没花掉。我赌一件事:当 Moonshot 在同一个基座上认真跑一轮后训练时,排行榜会再次翻转。
这重新框定了“谁领先”这场讨论。问题从来不是“谁的架构赢”,而是“谁从每个参数里榨出了更多能力”。至少在开放模型上,此刻的答案是 Z.ai,而且差距不小。
同样的事发生了两次:DeepSeek 打了同一个战术
如果 GLM 5.3 是唯一的数据点,我会说这是孤例。但它不是。去读 DeepSeek 官方 API 更新日志里两周前发布的 V4-Flash-0731:
“DeepSeek-V4-Flash-0731 保持了与 DeepSeek-V4-Flash-Preview 完全相同的模型架构和规模,仅重新进行了后训练。”

同样的话,同样的赌注。两家不同的实验室,相隔两周,得出了同一个结论:架构已定,训练未完。
DeepSeek 保留了完全相同的 284B 模型、13B 激活,对它重新做了后训练。收益显著。The New Stack 的报道角度就是:小模型打败了自家旗舰。
在我看来,这就是中国实验室的打法:一次性选出参数效率最高的架构,然后用两个旋钮扩性能:给现有模型更多后训练,或者上更大的模型并立刻给它同样的后训练待遇。
一个旋钮便宜又快,另一个慢且贵。他们两个都在拧。
如果你真的在用 AI,开源大模型竞赛意味着什么
作为一个在这些模型之上规划营销系统的人,GLM 5.3 落到我桌上是这样的。
你的单任务成本崩塌了
Agentic 工作流很吃 token。一条包含调研、起草、质检、发布环节的内容流水线,一周烧掉几百万 token 很正常。按 Fable 5 的价格,这是实打实的钱。
按 1.40/4.40 美元的价格,同一条流水线的成本只剩零头,而对很多任务来说质量已经可以互换。把你的账重算一遍。上个季度“自动化太贵”的那个流程,这个季度可能就是你的利润。(想要更完整的框架,我写过为什么 AI 营销项目会失败,问题很少出在模型上。)
别再绑定单一供应商,开始给自己的任务做 benchmark
当能力跃迁每隔几周就靠后训练送上门时,今天的赢家就是下个月的基线。唯一能替你付账单的 benchmark,是跑在你自己工作负载上的那个。
建一个小的评测集:从你的流水线里挑二十个真实任务,由人来打分。让每个新模型都跑一遍。一个下午的功夫,就能把炒作变成一张表格。
开放权重是采购筹码,不是信仰
你不会把 744B 的 MoE 自托管在一台备用服务器上。但贴近开放的模型改变了谈判格局。可以离开、可以微调、可以放在自己防火墙后面运行的选项,正是把闭源模型价格拉下来的东西。
这波开源 AI 浪潮(包括 Qwen3.8-Max 的权重)就是前沿 API 持续变便宜的原因。哪怕你永远不行使这个选项,你也在享受它带来的好处。
能力更新节奏已经是每周,所以要分层构建
我最近写过 OpenAI 踩下刹车,出于安全考虑放慢了节奏。把这两个故事并排放在一起,规律一目了然:西方前沿实验室放慢脚步做测试,中国实验室加紧发布。
所以别再把战略押在某个“下一个版本”上。用三层结构来搭建:稳定层(你今天信得过的模型)、便宜层(开放权重级别,干大批量的活)、实验层(这周刚发布的任何东西)。让这三层各自独立演进。
常见问题
GLM 5.3 真的是开源的吗?
Z.ai 把 GLM 5.3 定位为开放权重产品线,GLM 家族的权重历史上也都会登上 Hugging Face。截至写作时,GLM 5.3 自己的权重仍未放出,官方预告是 8 月 14 日发布后约两周。“开放”是这家公司对这个模型宣称的方向。在围绕它规划自托管之前,先去 Hugging Face 确认。
GLM 5.3 和 Claude 比怎么样?
在 agentic coding benchmark 上,GLM 5.3 在部分测试中追平 Claude Fable 5,在另一些上落后。价格上则便宜得多:每百万 token 1.40/4.40 美元,而 Fable 5 是 10/50 美元。我的工作原则:最难的那 10% 任务交给闭源前沿模型,大批量工作交给 GLM 级别的模型,那里质量差异看不出来,成本差异却看得清清楚楚。
什么是 LLM 的后训练?
基座模型完成预训练之后发生的一切:监督微调、基于人类反馈的强化学习(RLHF),以及在代码和数学等可验证任务上的强化学习。GLM 5.3 保持基座模型与 GLM 5.2 完全一致,然后激进地扩大了这个阶段。它比从零训练一个新架构便宜,而且当下大多数可度量的能力提升都来自这里。
我的最终判断:练习胜过架构
当下的最佳开源大模型,是靠什么都不改做出来的。没有新架构,没有更大的模型,只有一种纪律:在别人全都从零重来的时候,坚持把手里这个模型继续训下去。
我觉得这真正令人鼓舞,而且不只是对 AI 研究而言。它说明前沿并不专属于拥有最大训练集群的那一方,刻意练习对机器同样有效。它还说明,那些我们以为已经定型的大模型(包括 Kimi K3)身上还压着没花完的潜力,而持续做后训练的实验室会继续把它收进口袋。
对于我们这些在这些模型上做生意的人,行动清单很无聊但很赚钱:重算你的 token 经济账,建自己的评测集,按“每周都出现一个接近前沿、价格只有零头的模型”的世界来设计架构。
把这种节奏内化掉的团队,会像我一样看待 GLM 5.3 这样的每一次发布:不过是个普通的星期二。
如果你想有人帮你把这套思路落到自己的营销技术栈上,联系我。没有炒作,只有数字说了算。


