7月9日发布的 GPT-5.6,性能提升是意料之中的事。真正让行业震动的,是 OpenAI 把 Codex Agent 直接塞进了主模型——你不再需要单独的编程 Agent 产品了。
先说结论
GPT-5.6 最大的变化不是跑分,而是产品形态的合并。Codex 从独立产品变成模型内置能力,三档定价让开发者按场景选模型而不是选产品。Sol 在编程和推理上全面领先,Luna 降价 80% 后成本低到可以不计,Terra 成了 GPT-5.5 的直接平替。
三档定价:不是高低配,是三个物种
GPT-5.6 不再是一个模型,而是一个家族。代号 5.6 标记的是代际,Sol/Terra/Luna 标记的是持久的能力层级——它们各自有独立的迭代节奏,OpenAI 可以单独更新某一个而不影响其他两个。
当前定价(标准模式,短上下文):
| 型号 | 定位 | 输入价(/MTok) | 输出价(/MTok) | 缓存读取 |
|---|---|---|---|---|
| Sol | 旗舰推理 | $5.00 | $30.00 | $0.50 |
| Terra | 均衡之选 | $2.00 | $12.00 | $0.20 |
| Luna | 极速廉价 | $0.20 | $1.20 | $0.02 |
注意看最后一列——缓存读取只要原价的 10%。这意味着如果你的应用有大量重复上下文(比如系统提示词),实际成本会大幅低于标价。
7月30日的调价幅度很大:Luna 直接砍了 80%(从 $1/$6 降到 $0.20/$1.20),Terra 降了 20%(从 $2.5/$15 到 $2/$12)。Sol 没动。
这个信号很清楚:OpenAI 要让 Luna 成为高吞吐场景的默认选择。
三个型号都支持六个推理档位:none、low、medium、high、xhigh、max。上下文窗口 1.05M tokens,最大输出 128K tokens。知识截止日期 2026年2月16日。
Codex 融入主模型:这才是真正的大新闻
GPT-5.6 同时在 ChatGPT、Codex 和 API 三个入口可用。同一个模型,三个入口,共享能力。
以前的 OpenAI 产品线是分裂的:ChatGPT 管对话,Codex 管编程,API 管调用。开发者要同时订阅多个产品。现在,GPT-5.6 把这些能力全部内置到模型本身。
具体来说,GPT-5.6 内置了两个关键新能力:
Programmatic Tool Calling——模型可以自己写程序来协调工具调用,处理中间结果,过滤大量数据,而不是每个工具响应都走一遍模型。在 Unity 场景构建工作流中,总 token 消耗减少 63.5%,模型调用轮次减少 50.1%。在金融研报场景中,prompt token 减少 38%,质量不变。
Multi-agent(Beta)——Sol 的 Ultra 模式默认协调 4 个并行 Agent。OpenAI 的数据显示,在 BrowseComp、SEC-Bench Pro 和 Terminal-Bench 2.1 三个评测上,4-Agent 配置的得分-延迟曲线全面优于单 Agent。在 API 中,开发者可以通过 Responses API 的 multi-agent beta 构建类似的并行工作流。
这意味着什么? 以前你需要 CrewAI、LangGraph 来编排多 Agent,现在模型自己就能做。Agent 框架的价值不是消失了,而是被迫往更上层走——从"编排工具调用"升级到"编排业务逻辑"。
跑分拆解:Sol 到底强在哪
以下数据全部来自 OpenAI 官方博客和第三方独立评测(Artificial Analysis、DeepSWE),我逐一验证过:
| 评测 | GPT-5.6 Sol | 对比对象 | 差距 |
|---|---|---|---|
| Agents’ Last Exam | 53.6 | Claude Fable 5: 40.5 | +13.1 分 |
| AA Coding Agent Index | 80.0 | Claude Fable 5: 77.2 | +2.8 分 |
| DeepSWE(pass@1) | 73% | Claude Opus 5: 74% | 基本持平 |
| CTF 网络安全 | 73.5% | GPT-5.5: 47.9% | +25.6 个百分点 |
| 内部 RSI 评测 | — | 比 GPT-5.5 高 16.2 分 | — |
但跑分只是故事的一半。效率才是真正的杀手锏。
在 Agents’ Last Exam 上,Sol 完成任务的时间比 Fable 5 少 61%,成本大约一半。Terra 和 Luna 的表现更让人意外——它们在大约 Fable 5 十六分之一的成本下,达到了接近的性能。
Luna 的 DeepSWE 得分 67%(和 GPT-5.5 持平),但平均成本只有 $0.61——GPT-5.5 是 $7.23。同样的性能,成本降了 90%。
在 QAInsights 的实测中,同样一个客服分类任务:
- Luna:155.6 tok/s,总耗时 4.4 秒,成本 $0.00172
- Terra:79.2 tok/s,总耗时 6.8 秒
- Sol:42.1 tok/s,总耗时 9.4 秒
有意思的是,Terra 的首 token 延迟最低(1931ms),比 Luna 还快 25%。但 Luna 的吞吐量是 Terra 的两倍,所以最终还是 Luna 先完成。最快启动和最快完成,是两个不同的模型。
开发者该怎么选
| 场景 | 推荐型号 | 理由 |
|---|---|---|
| 复杂编程、长链推理、研究 | Sol | 推理最强,Agent 表现最好 |
| 日常开发、代码审查、知识工作 | Terra | 性能接近 GPT-5.5,成本减半 |
| 批量分类、数据清洗、简单问答 | Luna | 速度最快,成本低到可以不计 |
| 不确定用哪个 | Terra 先上 | 最安全的默认选择 |
一个实用策略:用 Luna 做筛选,用 Sol 做精加工。先让 Luna 批量处理一遍,把需要深度推理的挑出来交给 Sol。两步下来总成本可能比全程用 Terra 还低。
另一个细节:所有三个型号都支持 Functions、Web search、File search 和 Computer use。工具能力不按定价分级,这意味着 Luna 也能用工具,只是推理深度不如 Sol。
不只是编程:设计和安全也是亮点
GPT-5.6 的提升不只是编程。OpenAI 在设计能力上下了狠功夫。
官方演示中,GPT-5.6 可以从高层级描述直接生成可交互的前端界面,而且能通过 Computer Use 检查渲染结果、发现视觉问题、自动修正。Cursor 的联合创始人说它是"CursorBench 上表现最好的模型之一"。Canva 的 AI 产品负责人说它的演示文稿生成能力比竞品强 1.6 倍,而且 token 效率更高。
在网络安全领域,提升更夸张。CTF 挑战赛得分从 GPT-5.5 的 47.9% 跳到 73.5%。ExploitGym 的漏洞利用测试,两小时窗口内 pass rate 从 15.1% 翻到 24.9%,六小时窗口达到 33.7%。
不过 OpenAI 也承认,GPT-5.6 在"找到漏洞"上比"自主发动端到端攻击"强得多——这对防御者来说是好消息。Daybreak 项目提供了受信任访问通道,让安全研究人员可以在授权环境中使用更强的网络安全能力。
成本对比:一张表算清楚
很多人只看单价,不看总成本。这里用 DeepSWE 的实际数据算一笔账:
| 模型 | DeepSWE 得分 | 平均成本/task | 平均输出 tokens |
|---|---|---|---|
| Claude Opus 5 | 74% | $11.84 | 118K |
| GPT-5.6 Sol | 73% | $8.39 | 60K |
| Claude Fable 5 | 70% | $21.63 | 119K |
| Kimi K3 | 69% | $4.65 | 81K |
| GPT-5.6 Luna | 67% | $0.61 | 73K |
| GPT-5.5 | 67% | $7.23 | 46K |
Sol 比 Opus 5 便宜 29%,输出 tokens 只有一半。Luna 和 GPT-5.5 得分相同,但成本只有 8.4%。
如果按月跑 1000 个任务估算:
- 全程用 Sol:$8,390
- 全程用 Luna:$610
- Luna 筛选 + Sol 精加工(假设 20% 需要 Sol):$610 + $1,678 = $2,288
混合策略比全程 Sol 省 73%,比全程 Luna 只贵 3.7 倍但质量大幅提升。
对国内开发者的影响
老问题不变:OpenAI API 在国内的可用性没有根本变化。但有几个值得认真算的账:
1. Luna 的成本已经低到中转商也能承受。 $0.20/MTok 的输入价,缓存命中后 $0.02,一个 1000 字的请求不到一分钱。批量处理 10 万条数据,总成本可能就几美元。
2. Terra 是 GPT-5.5 的直接替代品。 如果你在用 GPT-5.5 的 API,切到 Terra 能省一半钱,性能基本不变。OpenAI 自己就是这么说的——Terra 的定位就是 GPT-5.5 的迁移目标。
3. Codex Agent 内置对 Agent 框架的冲击是真实的。 当模型自己就能编排工具、分配资源、并行处理,外面那层框架的必要性就在下降。框架要活下来,得往模型做不了的方向走——业务抽象、领域知识、可视化编排。
4. 缓存机制值得关注。 GPT-5.6 引入了显式缓存断点和 30 分钟最低缓存生命周期。对有大量重复上下文的应用来说,这能省很多钱。
最后说一句
GPT-5.6 发布一个月了。跑分会被追平,价格会被卷下来,这些都不是新闻。
真正的新闻是 OpenAI 用"三档定价 + Codex 内置"重新定义了什么叫"一个模型"。以前你买的是一个 API endpoint,现在你买的是一个可以自己编排工具、自己分配资源的 Agent 平台。
这个趋势不会停下来。下一个问题不是"GPT-5.6 能不能做这个",而是**“我还需要在外面包一层 Agent 框架吗”**。