GLM-5.3 今天发布:编程能力暴涨50%,开源模型第一次站上巅峰

智谱 GLM-5.3 正式发布,后训练 Scaling 实现编程能力 50% 提升,Terminal-Bench 从 4.6 飙到 28.3,开源模型编程能力首次登顶。深度解析技术路径与实战意义。

今天智谱发布了 GLM-5.3,同一天财联社、每经、IT之家都在报。我第一时间看完技术报告,说一句:这次不是堆参数,是训练方法论变了。

先说结论

GLM-5.3 和 GLM-5.2 同一个底座,没换架构、没加参数。纯靠后训练 Scaling,编程能力提升 50%。

Terminal-Bench 3.0 从 4.6 干到 28.3,开源模型第一。CyberGym 安全评测 83.5%,逼近闭源天花板 Mythos 5 的 83.8%。

一句话:开源模型在编程赛道,第一次有资格和闭源顶级模型坐在同一张桌子上。

什么是"后训练 Scaling"

这个词很重要,必须解释清楚。

传统 Scaling Law 是堆参数、堆数据、堆算力——模型越大越聪明。

后训练 Scaling 换了个思路:底座不动,靠更精细的训练策略榨出更多能力。

GLM-5.3 的做法:

  • 训练不再局限于孤立编程题
  • 扩展到完整工程流程:发现问题→分析方案→实施→验证→交付
  • 部分训练任务相当于资深工程师连续数天的工作量
  • 使用真实计算集群、存储系统、内部文档与代码库

类比:以前是让模型做练习题,现在是让它直接去公司实习。

四个方向的核心提升

1. 编程与Agent能力(重点)

评测GLM-5.2GLM-5.3提升幅度
Terminal-Bench 3.04.628.3+515%
DeepSWE v1.146.266.9+45%
Agents’ Last Exam23.828.5+20%
GDPval-AA v21769分覆盖44种职业

Terminal-Bench 28.3 分,开源模型排名第一。DeepSWE 66.9,比肩 Claude Fable 5。

编程体感较 GLM-5.2 提升 50%——这是智谱自己的原话,不是我编的。

2. 复杂项目交付

以前的模型写单个函数还行,面对完整项目就崩。

GLM-5.3 能处理:

  • 数万行代码、上百个文件、多个依赖系统
  • 极少人工干预下自主开发、反复验证、推进至可交付状态
  • 覆盖前端开发、Bug 修复、代码重构等真实任务

3. 网络安全能力(涌现)

评测GLM-5.2GLM-5.3对标
CyberGym83.5%Mythos 5: 83.8%
ExploitBench24.4%54.4%+123%

白盒代码审查、漏洞发现与验证能力接近 Mythos 5。

优势集中在漏洞利用链前端。更深入的攻防仍有提升空间。

4. 通用能力

  • 上下文窗口:1M tokens
  • 最大输出:128K tokens
  • 支持:思考模式、流式输出、Function Calling、上下文缓存、结构化输出、MCP

竞品对比

模型Artificial Analysis评分编程能力开源
GLM-5.3待测Terminal-Bench 28.3✅ 宽松许可证
GLM-5.253分Terminal-Bench 4.6
DeepSeek 顶级模型53分
Kimi K3高于53
Claude Fable 5高于53DeepSWE ~67
GPT 5.6高于53

GLM-5.2 和 DeepSeek 顶级模型在 Artificial Analysis 上同为 53 分。

GLM-5.3 的目标是通过后训练 Scaling 缩小与 Kimi K3、Claude Fable 5、GPT 5.6 的差距。

关键点:以上闭源模型全部不开放权重。GLM-5.3 将以宽松许可证开放。

对开发者意味着什么

如果你用 AI 写代码:

GLM-5.3 是目前开源阵营里编程能力最强的模型。等 API 上线后可以第一时间试用。

GLM Coding Plan 已经全量上线 GLM-5.3。订阅用户现在就能用。

如果你做 AI Agent 开发:

1M 上下文 + 128K 输出 + Function Calling + MCP,这组合在开源模型里几乎没有对手。

Agent 场景最吃上下文长度和工具调用能力,GLM-5.3 两个都是顶配。

如果你关注开源生态:

智谱延续宽松许可证策略。GLM-5.2 发布后智谱市值一度冲到 1370 亿美元。

开源 + 强编程能力 = 开发者生态飞轮转起来了。

我的看法

后训练 Scaling 这条路,之前大家都知道重要,但没人做到这个程度。

GLM-5.3 证明了一件事:底座模型的能力上限,远比我们以为的要高。 关键在于你怎么训练。

不换底座,纯靠训练策略优化就能实现 50% 的编程能力提升。

这对整个行业都是好消息——意味着未来模型能力的提升不完全依赖天价算力。

三个备选标题

  1. GLM-5.3 今天发布:编程能力暴涨50%,开源模型第一次站上巅峰(数字+悬念)
  2. 智谱 GLM-5.3 来了:Terminal-Bench 从 4.6 到 28.3,开源编程模型变天了(数字+威胁)
  3. 不换底座,编程能力涨50%:GLM-5.3 的后训练 Scaling 有多猛(反常识)

关注 varkm,一起学习,一起成长