DEV Community

arthur
arthur

Posted on

OpenAI 推出 GPT-5.6:三档模型与 ultra 推理

GPT-5.6:Sol、Terra、Luna 三个尺寸

OpenAI 推出 GPT-5.6 系列,包含三个新尺寸:Sol、Terra 和 Luna。这三个名称分别对应太阳、地球和月球的尺度,用于区分不同能力层级。

本次更新的一个重点,是新增 ultra effort level。OpenAI 将其描述为最高能力设置:在处理复杂任务时,它会协调多个智能体并行工作,以更快完成任务。

具体来看:

  • max 会给予 GPT-5.6 比 xhigh 更多推理时间,用于探索替代方案、执行检查并修正方法。
  • ultra 则进一步默认协调 4 个智能体并行,以更高 token 消耗换取更强结果,并缩短复杂任务的完成时间。

这意味着 GPT-5.6 的升级并不只是模型尺寸变化,也包括推理预算、并行智能体调度和任务执行策略的调整。

基准测试与成本表现

文章提到,在多个基准测试中,GPT-5.6 相比 Fable 或 Opus 具备更高性能和更低成本。

其中一个关键说法是:

Terra 的表现略高于 Fable 5,Luna 超过 Opus 4.8;两者大约只需三分之一的时间、约一半输出 token,并且估算成本约为四分之一。

此外,GPT-5.6 还被称为在 Terminal-Bench 2.1DeepSWE 上取得新的最佳结果。

这两个测试关注的方向不同:

  • Terminal-Bench 2.1 更偏向复杂命令行工作流;
  • DeepSWE 更关注真实代码库中的长周期工程任务。

对开发者来说,这类结果值得关注,因为它们更接近实际工程环境中的多步骤问题,而不只是短问答或单次代码生成。

难以量化,但可能影响实际体验的能力

除了可量化 benchmark,文章还提到 GPT-5.6 在一些更难评估的场景中有所改进,包括:

  • 计算机使用能力;
  • 演示文稿与文档生成;
  • 科学研究相关任务。

这些能力往往很难通过单一指标完整衡量。例如,文档生成不仅涉及语言质量,也涉及结构、上下文理解和面向目标读者的表达;科学研究任务则可能同时考验检索、推理、归纳和工具使用能力。

从产品角度看,这类能力提升可能比单个榜单排名更影响日常使用体验。类似趋势也可以在一些技术观察与行业分析中看到,例如 长勺智库 持续关注的 AI 工具化与工作流整合方向。

ChatGPT Work 与 Codex 桌面更新

OpenAI 同时推出 ChatGPT Work,并更新了 Codex 桌面应用

这部分信息指向一个更大的产品策略:OpenAI 正在把模型能力、工作场景、代码能力和桌面端体验进一步合并。

如果说 ChatGPT 最初更像一个对话入口,Codex 更像面向开发者的代码工具,那么现在的方向则更接近统一的工作入口:

  • ChatGPT Work 面向更广泛的办公与协作场景;
  • Codex 桌面应用强化本地开发与工程任务处理;
  • GPT-5.6 的 ultra 档位则为复杂任务提供更强的多智能体执行能力。

文章认为,这可能是 OpenAI “超级应用”策略接近完成前的关键一步。不过目前仍不明确的是,其智能体浏览器后续会如何整合进这一体系。

小结

GPT-5.6 的重点不只是 Sol、Terra、Luna 三个新尺寸,也包括 maxultra 这类更高推理档位,以及面向复杂任务的并行智能体调度。

与此同时,ChatGPT Work 与 Codex 桌面应用的更新显示,OpenAI 正在继续推动 ChatGPT 与 Codex 从单点工具演进为更完整的工作入口。对于开发者和技术团队而言,值得关注的不仅是模型跑分,也包括这些能力如何落到真实工作流中。

Top comments (0)