今天智谱发布了 GLM-5.3,同一天财联社、每经、IT之家都在报。我第一时间看完技术报告,说一句:这次不是堆参数,是训练方法论变了。
先说结论
GLM-5.3 和 GLM-5.2 同一个底座,没换架构、没加参数。纯靠后训练 Scaling,编程能力提升 50%。
Terminal-Bench 3.0 从 4.6 干到 28.3,开源模型第一。CyberGym 安全评测 83.5%,逼近闭源天花板 Mythos 5 的 83.8%。
一句话:开源模型在编程赛道,第一次有资格和闭源顶级模型坐在同一张桌子上。
什么是"后训练 Scaling"
这个词很重要,必须解释清楚。
传统 Scaling Law 是堆参数、堆数据、堆算力——模型越大越聪明。
后训练 Scaling 换了个思路:底座不动,靠更精细的训练策略榨出更多能力。
GLM-5.3 的做法:
- 训练不再局限于孤立编程题
- 扩展到完整工程流程:发现问题→分析方案→实施→验证→交付
- 部分训练任务相当于资深工程师连续数天的工作量
- 使用真实计算集群、存储系统、内部文档与代码库
类比:以前是让模型做练习题,现在是让它直接去公司实习。
四个方向的核心提升
1. 编程与Agent能力(重点)
| 评测 | GLM-5.2 | GLM-5.3 | 提升幅度 |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6 | 28.3 | +515% |
| DeepSWE v1.1 | 46.2 | 66.9 | +45% |
| Agents’ Last Exam | 23.8 | 28.5 | +20% |
| GDPval-AA v2 | — | 1769分 | 覆盖44种职业 |
Terminal-Bench 28.3 分,开源模型排名第一。DeepSWE 66.9,比肩 Claude Fable 5。
编程体感较 GLM-5.2 提升 50%——这是智谱自己的原话,不是我编的。
2. 复杂项目交付
以前的模型写单个函数还行,面对完整项目就崩。
GLM-5.3 能处理:
- 数万行代码、上百个文件、多个依赖系统
- 极少人工干预下自主开发、反复验证、推进至可交付状态
- 覆盖前端开发、Bug 修复、代码重构等真实任务
3. 网络安全能力(涌现)
| 评测 | GLM-5.2 | GLM-5.3 | 对标 |
|---|---|---|---|
| CyberGym | — | 83.5% | Mythos 5: 83.8% |
| ExploitBench | 24.4% | 54.4% | +123% |
白盒代码审查、漏洞发现与验证能力接近 Mythos 5。
优势集中在漏洞利用链前端。更深入的攻防仍有提升空间。
4. 通用能力
- 上下文窗口:1M tokens
- 最大输出:128K tokens
- 支持:思考模式、流式输出、Function Calling、上下文缓存、结构化输出、MCP
竞品对比
| 模型 | Artificial Analysis评分 | 编程能力 | 开源 |
|---|---|---|---|
| GLM-5.3 | 待测 | Terminal-Bench 28.3 | ✅ 宽松许可证 |
| GLM-5.2 | 53分 | Terminal-Bench 4.6 | ✅ |
| DeepSeek 顶级模型 | 53分 | — | ✅ |
| Kimi K3 | 高于53 | — | ❌ |
| Claude Fable 5 | 高于53 | DeepSWE ~67 | ❌ |
| GPT 5.6 | 高于53 | — | ❌ |
GLM-5.2 和 DeepSeek 顶级模型在 Artificial Analysis 上同为 53 分。
GLM-5.3 的目标是通过后训练 Scaling 缩小与 Kimi K3、Claude Fable 5、GPT 5.6 的差距。
关键点:以上闭源模型全部不开放权重。GLM-5.3 将以宽松许可证开放。
对开发者意味着什么
如果你用 AI 写代码:
GLM-5.3 是目前开源阵营里编程能力最强的模型。等 API 上线后可以第一时间试用。
GLM Coding Plan 已经全量上线 GLM-5.3。订阅用户现在就能用。
如果你做 AI Agent 开发:
1M 上下文 + 128K 输出 + Function Calling + MCP,这组合在开源模型里几乎没有对手。
Agent 场景最吃上下文长度和工具调用能力,GLM-5.3 两个都是顶配。
如果你关注开源生态:
智谱延续宽松许可证策略。GLM-5.2 发布后智谱市值一度冲到 1370 亿美元。
开源 + 强编程能力 = 开发者生态飞轮转起来了。
我的看法
后训练 Scaling 这条路,之前大家都知道重要,但没人做到这个程度。
GLM-5.3 证明了一件事:底座模型的能力上限,远比我们以为的要高。 关键在于你怎么训练。
不换底座,纯靠训练策略优化就能实现 50% 的编程能力提升。
这对整个行业都是好消息——意味着未来模型能力的提升不完全依赖天价算力。
三个备选标题
- GLM-5.3 今天发布:编程能力暴涨50%,开源模型第一次站上巅峰(数字+悬念)
- 智谱 GLM-5.3 来了:Terminal-Bench 从 4.6 到 28.3,开源编程模型变天了(数字+威胁)
- 不换底座,编程能力涨50%:GLM-5.3 的后训练 Scaling 有多猛(反常识)
关注 varkm,一起学习,一起成长