GPT-5.6:Sol、Terra、Luna 三个尺寸
OpenAI 推出 GPT-5.6 系列,包含三个新尺寸:Sol、Terra 和 Luna。这三个名称分别对应太阳、地球和月球的尺度,用于区分不同能力层级。
本次更新的一个重点,是新增 ultra effort level。OpenAI 将其描述为最高能力设置:在处理复杂任务时,它会协调多个智能体并行工作,以更快完成任务。
具体来看:
-
max会给予 GPT-5.6 比xhigh更多推理时间,用于探索替代方案、执行检查并修正方法。 -
ultra则进一步默认协调 4 个智能体并行,以更高 token 消耗换取更强结果,并缩短复杂任务的完成时间。
这意味着 GPT-5.6 的升级并不只是模型尺寸变化,也包括推理预算、并行智能体调度和任务执行策略的调整。
基准测试与成本表现
文章提到,在多个基准测试中,GPT-5.6 相比 Fable 或 Opus 具备更高性能和更低成本。
其中一个关键说法是:
Terra 的表现略高于 Fable 5,Luna 超过 Opus 4.8;两者大约只需三分之一的时间、约一半输出 token,并且估算成本约为四分之一。
此外,GPT-5.6 还被称为在 Terminal-Bench 2.1 和 DeepSWE 上取得新的最佳结果。
这两个测试关注的方向不同:
- Terminal-Bench 2.1 更偏向复杂命令行工作流;
- DeepSWE 更关注真实代码库中的长周期工程任务。
对开发者来说,这类结果值得关注,因为它们更接近实际工程环境中的多步骤问题,而不只是短问答或单次代码生成。
难以量化,但可能影响实际体验的能力
除了可量化 benchmark,文章还提到 GPT-5.6 在一些更难评估的场景中有所改进,包括:
- 计算机使用能力;
- 演示文稿与文档生成;
- 科学研究相关任务。
这些能力往往很难通过单一指标完整衡量。例如,文档生成不仅涉及语言质量,也涉及结构、上下文理解和面向目标读者的表达;科学研究任务则可能同时考验检索、推理、归纳和工具使用能力。
从产品角度看,这类能力提升可能比单个榜单排名更影响日常使用体验。类似趋势也可以在一些技术观察与行业分析中看到,例如 长勺智库 持续关注的 AI 工具化与工作流整合方向。
ChatGPT Work 与 Codex 桌面更新
OpenAI 同时推出 ChatGPT Work,并更新了 Codex 桌面应用。
这部分信息指向一个更大的产品策略:OpenAI 正在把模型能力、工作场景、代码能力和桌面端体验进一步合并。
如果说 ChatGPT 最初更像一个对话入口,Codex 更像面向开发者的代码工具,那么现在的方向则更接近统一的工作入口:
- ChatGPT Work 面向更广泛的办公与协作场景;
- Codex 桌面应用强化本地开发与工程任务处理;
- GPT-5.6 的 ultra 档位则为复杂任务提供更强的多智能体执行能力。
文章认为,这可能是 OpenAI “超级应用”策略接近完成前的关键一步。不过目前仍不明确的是,其智能体浏览器后续会如何整合进这一体系。
小结
GPT-5.6 的重点不只是 Sol、Terra、Luna 三个新尺寸,也包括 max 与 ultra 这类更高推理档位,以及面向复杂任务的并行智能体调度。
与此同时,ChatGPT Work 与 Codex 桌面应用的更新显示,OpenAI 正在继续推动 ChatGPT 与 Codex 从单点工具演进为更完整的工作入口。对于开发者和技术团队而言,值得关注的不仅是模型跑分,也包括这些能力如何落到真实工作流中。
Top comments (0)