GPT-5.6 来了:Sol、Terra、Luna 三款新模型,但暂时轮不到你用

刘波

GPT-5.6 来了:SolTerraLuna 三款新模型,但暂时轮不到你用

OpenAI 又放大招了。

这一次,它一口气预览了全新的 GPT-5.6 系列,三款模型同时亮相,还顺手在编码、生物、网络安全几条赛道上刷新了一串基准纪录。

不过,比性能更耐人寻味的是这次发布的"打开方式"——新模型不会马上对所有人开放,而是「应政府要求,先发给一小撮"受信任的合作伙伴"」试用,之后才会逐步放开。

GPT-5.6 来了:Sol、Terra、Luna 三款新模型,但暂时轮不到你用

图片来源于网络,版权归原作者所有,侵权请联系删除

下面我们拆开来看。


一、三款模型,各管一摊

GPT-5.6 这次走的是"分层"路线,三个名字各有定位:

  • Sol(旗舰):系列里最强的那一个,主打深度推理和复杂任务。
  • Terra(均衡):面向日常工作,性能号称能和上一代 GPT-5.5 掰手腕,价格却只要一半
  • Luna(轻量):最快、最便宜,用最低的价格提供"够用且强大"的能力。

OpenAI 还顺势改了命名逻辑:数字代表代际(5.6 就是这一代),Sol / Terra / Luna 则代表可以持续升级的能力层级。说白了,就是想让大家在"智能、速度、成本"之间挑得更清楚。


二、能力到底强在哪?

OpenAI 提前放出了一批评测结果,重点秀的是编码、生物、网络安全这三块的"智能体能力"。

编码:刷新 Terminal-Bench 2.1 纪录

Terminal-Bench 2.1 考的是命令行工作流——需要规划、反复迭代、还要协调各种工具。GPT-5.6 Sol 在这上面立了新标杆:

GPT-5.6 来了:Sol、Terra、Luna 三款新模型,但暂时轮不到你用

图片来源于网络,版权归原作者所有,侵权请联系删除

  • GPT-5.6 Sol Ultra:91.9%
  • GPT-5.6 Sol:88.8%
  • GPT-5.5:80%+

参与对比的还有 Terra、Luna 和 GPT-5.5。

生物学:更便宜、更快

在 GeneBench v1 上,GPT-5.6 Sol 不仅跑赢了 GPT-5.5,而且用的 token 更少、延迟更低。

GPT-5.6 来了:Sol、Terra、Luna 三款新模型,但暂时轮不到你用

图片来源于网络,版权归原作者所有,侵权请联系删除

GPT-5.6 来了:Sol、Terra、Luna 三款新模型,但暂时轮不到你用

图片来源于网络,版权归原作者所有,侵权请联系删除

GPT-5.6 来了:Sol、Terra、Luna 三款新模型,但暂时轮不到你用

图片来源于网络,版权归原作者所有,侵权请联系删除

网络安全:OpenAI 最强的安全模型

在 ExploitBench 上,Sol 只用了约三分之一的输出令牌,就能与 Mythos Preview 打平。

在加州大学伯克利分校(联合 OpenAI 等前沿实验室创建)的 ExploitGym 基准上,Sol、Terra、Luna 三款模型都随着推理能力提升而展现出明显的安全能力增强。

GPT-5.6 来了:Sol、Terra、Luna 三款新模型,但暂时轮不到你用

图片来源于网络,版权归原作者所有,侵权请联系删除

GPT-5.6 来了:Sol、Terra、Luna 三款新模型,但暂时轮不到你用

图片来源于网络,版权归原作者所有,侵权请联系删除

GPT-5.6 来了:Sol、Terra、Luna 三款新模型,但暂时轮不到你用

图片来源于网络,版权归原作者所有,侵权请联系删除

GPT-5.6 来了:Sol、Terra、Luna 三款新模型,但暂时轮不到你用

图片来源于网络,版权归原作者所有,侵权请联系删除

需要强调的是:OpenAI 自己的"准备框架"判定 GPT-5.6 Sol 并未达到网络安全的"关键级别"。在针对 Chromium 和 Firefox 的测试里,它能识别出漏洞和利用原语,但在测试条件下没能自主拼出完整的攻击链


三、最敏感的那个话题

OpenAI 说,作为与美国政府持续合作的一部分,它在正式发布前先把计划和模型能力预览给了政府;并且应政府要求,会先面向一小撮"受信任的合作伙伴"做有限预览,之后再逐步放开。

但 OpenAI 也罕见地把话说在了前头:

"这种政府访问流程不应该成为长期默认设置。"

理由很直接:这么做会让真正需要工具的用户、开发者、企业、网络安全防御者和全球合作伙伴拿不到最好的工具

OpenAI 的解释是,这只是一个短期措施——目的是在接下来几周内尽快实现更广泛的可用性,同时它正在和政府一起,为网络安全行政命令、以及未来模型发布制定一套更正式的流程。


四、安全为什么被反复强调?

GPT-5.6 Sol 搭载了 OpenAI 迄今最强的安全防护体系。它的核心思路是:没有任何单一防线挡得住有预谋、会变招的滥用,所以要一层一层叠加。

这套"分层安全堆栈"大致包括:

  • 模型层:GPT-5.6 经过训练,会拒绝任何被禁止的网络协助——哪怕用户试图隐藏意图或越狱。
  • 实时层:网络与生物滥用分类器在生成的同时就在评估;高风险情况下生成会被暂停,交给更强的推理模型复核上下文,判定违规就在送达用户前拦下。
  • 账户层:被标记的活动会触发账户级审查,帮助系统把"持续作恶"和"正当的双用途安全工作"区分开。
  • 访问层:差异化访问控制,在不默认全面开放最敏感能力的前提下,保留正当的防御工作空间。

OpenAI 的目标是:在不限制代码审查、漏洞研究、补丁开发、调试、安全教育、防御测试这些正当用途的前提下,让被禁止的攻击行为变得更难、更不可预测、更容易被发现。

为了验证整套体系的鲁棒性,OpenAI 花了超过 70 万 A100 等效 GPU 小时做自动化红队测试,重点针对那些能跨场景泛化的"通用越狱"路径。同时还有第三方人工红队在整个预览期间持续参与。


参考链接:

文章版权声明:文章内容均来源于各大短视频平台搜集以及修改和删减新增,如有侵权或者违规,请联系站长进行删除,如需转载或复制请以超链接形式并注明出处。

发表评论

快捷回复: 表情:
AddoilApplauseBadlaughBombCoffeeFabulousFacepalmFecesFrownHeyhaInsidiousKeepFightingNoProbPigHeadShockedSinistersmileSlapSocialSweatTolaughWatermelonWittyWowYeahYellowdog
验证码
评论列表 (暂无评论,13人围观)

还没有评论,来说两句吧...

目录[+]