GPT-5.6 来了:Sol、Terra、Luna 三款新模型,但暂时轮不到你用
OpenAI 又放大招了。
这一次,它一口气预览了全新的 GPT-5.6 系列,三款模型同时亮相,还顺手在编码、生物、网络安全几条赛道上刷新了一串基准纪录。
不过,比性能更耐人寻味的是这次发布的"打开方式"——新模型不会马上对所有人开放,而是「应政府要求,先发给一小撮"受信任的合作伙伴"」试用,之后才会逐步放开。

图片来源于网络,版权归原作者所有,侵权请联系删除
下面我们拆开来看。
一、三款模型,各管一摊
GPT-5.6 这次走的是"分层"路线,三个名字各有定位:
- Sol(旗舰):系列里最强的那一个,主打深度推理和复杂任务。
- Terra(均衡):面向日常工作,性能号称能和上一代 GPT-5.5 掰手腕,价格却只要一半。
- Luna(轻量):最快、最便宜,用最低的价格提供"够用且强大"的能力。
OpenAI 还顺势改了命名逻辑:数字代表代际(5.6 就是这一代),Sol / Terra / Luna 则代表可以持续升级的能力层级。说白了,就是想让大家在"智能、速度、成本"之间挑得更清楚。
二、能力到底强在哪?
OpenAI 提前放出了一批评测结果,重点秀的是编码、生物、网络安全这三块的"智能体能力"。
编码:刷新 Terminal-Bench 2.1 纪录
Terminal-Bench 2.1 考的是命令行工作流——需要规划、反复迭代、还要协调各种工具。GPT-5.6 Sol 在这上面立了新标杆:

图片来源于网络,版权归原作者所有,侵权请联系删除
- GPT-5.6 Sol Ultra:91.9%
- GPT-5.6 Sol:88.8%
- GPT-5.5:80%+
参与对比的还有 Terra、Luna 和 GPT-5.5。
生物学:更便宜、更快
在 GeneBench v1 上,GPT-5.6 Sol 不仅跑赢了 GPT-5.5,而且用的 token 更少、延迟更低。

图片来源于网络,版权归原作者所有,侵权请联系删除

图片来源于网络,版权归原作者所有,侵权请联系删除

图片来源于网络,版权归原作者所有,侵权请联系删除
网络安全:OpenAI 最强的安全模型
在 ExploitBench 上,Sol 只用了约三分之一的输出令牌,就能与 Mythos Preview 打平。
在加州大学伯克利分校(联合 OpenAI 等前沿实验室创建)的 ExploitGym 基准上,Sol、Terra、Luna 三款模型都随着推理能力提升而展现出明显的安全能力增强。

图片来源于网络,版权归原作者所有,侵权请联系删除

图片来源于网络,版权归原作者所有,侵权请联系删除

图片来源于网络,版权归原作者所有,侵权请联系删除

图片来源于网络,版权归原作者所有,侵权请联系删除
需要强调的是:OpenAI 自己的"准备框架"判定 GPT-5.6 Sol 并未达到网络安全的"关键级别"。在针对 Chromium 和 Firefox 的测试里,它能识别出漏洞和利用原语,但在测试条件下没能自主拼出完整的攻击链。
三、最敏感的那个话题
OpenAI 说,作为与美国政府持续合作的一部分,它在正式发布前先把计划和模型能力预览给了政府;并且应政府要求,会先面向一小撮"受信任的合作伙伴"做有限预览,之后再逐步放开。
但 OpenAI 也罕见地把话说在了前头:
"这种政府访问流程不应该成为长期默认设置。"
理由很直接:这么做会让真正需要工具的用户、开发者、企业、网络安全防御者和全球合作伙伴拿不到最好的工具。
OpenAI 的解释是,这只是一个短期措施——目的是在接下来几周内尽快实现更广泛的可用性,同时它正在和政府一起,为网络安全行政命令、以及未来模型发布制定一套更正式的流程。
四、安全为什么被反复强调?
GPT-5.6 Sol 搭载了 OpenAI 迄今最强的安全防护体系。它的核心思路是:没有任何单一防线挡得住有预谋、会变招的滥用,所以要一层一层叠加。
这套"分层安全堆栈"大致包括:
- 模型层:GPT-5.6 经过训练,会拒绝任何被禁止的网络协助——哪怕用户试图隐藏意图或越狱。
- 实时层:网络与生物滥用分类器在生成的同时就在评估;高风险情况下生成会被暂停,交给更强的推理模型复核上下文,判定违规就在送达用户前拦下。
- 账户层:被标记的活动会触发账户级审查,帮助系统把"持续作恶"和"正当的双用途安全工作"区分开。
- 访问层:差异化访问控制,在不默认全面开放最敏感能力的前提下,保留正当的防御工作空间。
OpenAI 的目标是:在不限制代码审查、漏洞研究、补丁开发、调试、安全教育、防御测试这些正当用途的前提下,让被禁止的攻击行为变得更难、更不可预测、更容易被发现。
为了验证整套体系的鲁棒性,OpenAI 花了超过 70 万 A100 等效 GPU 小时做自动化红队测试,重点针对那些能跨场景泛化的"通用越狱"路径。同时还有第三方人工红队在整个预览期间持续参与。
参考链接:

还没有评论,来说两句吧...