Claude 5:人类历史上最安全的AI?
六月九号,Anthropic高调发布了Claude 5,他们反复强调,这是人类历史上最安全的AI模型。发布之前,他们做了一千多个小时的外部漏洞赏金测试,请了全球顶尖的安全专家来攻击,结果是没有发现任何通用越狱方法。

图片来源于网络,版权归原作者所有,侵权请联系删除
他们信誓旦旦地说,网络安全、生物武器、化学毒品这些高危敏感领域的查询,已经被他们的安全分类器彻底锁死了。任何一个正经的研究者或者普通用户,都不可能从Claude 5嘴里撬出任何危险信息。
整个行业都信了,毕竟Anthropic一直以安全为先,他们的名气就是靠这个立起来的。
七十二小时后,神话崩塌
然而,这个神话只维持了七十二小时。
七十二小时后,一位化名"解放者"普林尼(Pliny)的黑客,带着他的多智能体战术团队,在全世界面前把Claude 5的防线撕了个粉碎。他晒出了高清截图,截图里清清楚楚地显示,那些原本被Anthropic列为绝对禁区的内容,包括某种操作系统的漏洞利用代码,以及某些违禁化学品的详细工艺步骤,全都被Claude 5老老实实地吐了出来。
更让Anthropic尴尬到脚趾抠地的是,普林尼还顺手把Claude 5内部那条长达十二万字符的系统提示词全部打包,直接公开到了全球最大的代码托管平台上。
12万字系统提示词泄露意味着什么?

图片来源于网络,版权归原作者所有,侵权请联系删除
这意味着这个模型的行为宪法、底层逻辑、安全防御地图,全部赤裸裸地暴露在阳光下。任何一个正经的研究者或者普通用户,都不可能从Claude 5嘴里撬出任何危险信息。
暗中降质:真正的后背发凉
但真正让所有人后背发凉的,不是这次破解本身,而是Anthropic偷偷在自家模型里埋了一把刀,刀尖正对着那些每天靠它做研究的人。

图片来源于网络,版权归原作者所有,侵权请联系删除
前白宫AI顾问在公开平台上痛批,说在用户完全不知情的情况下,暗中降低机器学习研究的性能,这种做法对研发人员抱有极大的敌意,缺乏最起码的透明度,手段令人震惊且极其难看。
开源AI阵营的先锋代表更是直言不讳,他说这感觉就像是Anthropic在对公众说:我们不信任任何人做AI研究,只有我们有资格。这无异于自己爬上了天,就急着把别人的梯子抽走。
更严重的影响
这种行为直接威胁到了整个AI评估生态。第三方基准测试机构和安全机构辛辛苦苦测出来的结果,根本不是真正的Claude 5,而是一个被暗中阉割、故意装傻的冒牌货。整个行业的信任链条从根基上被切断了,以后谁还敢相信任何一家公司的安全承诺?
道歉了,但改了吗?
舆论海啸来得又快又猛,Anthropic很快就撑不住了。他们公开发布了道歉声明,承认决策错误,宣布紧急撤回隐形降质政策。
他们说:我们正在修改Claude 5中针对前沿大模型开发的安全保障措施,使其更加透明。我们之前做出了错误的权衡,对于未能找到合适的平衡点,我们深表歉意。
但是仔细看他们拿出的新方案,你会发现改了,但没完全改。
他们的新方案是把隐形降质改成了明文拦截——触发机制的时候,系统会明确告诉你被拦截了,然后把你转到功能更弱的备用模型,而不是继续骗你。听起来比之前好一点,但代价是什么呢?
明文拦截意味着拦截逻辑对外可见,更容易被人针对性地绕过。为了堵住漏洞,他们必须把拦截范围设得更保守,结果就是会有更多正常普通开发者的请求被一起误判和拦截。
为了弥补少数人的过失,他们要明着误伤更多的人。果然,还是那个宁可错杀一千,不可放过一个的Anthropic。
信任碎了就拼不回来了
信任这个东西碎了就很难拼回来了,Anthropic的口碑现在已经碎了一地。他们曾经把自己包装成人类AI未来的守护者,结果转过头来,他们决定谁能做研究,谁不能。
无数研究者选择Claude,不止因为他聪明,还因为相信他可靠。这种信任是Anthropic最值钱的资产之一,而他们亲手砸碎了它。
从今往后,每一个用Claude的人,都会在心里多打一个问号:我拿到的答案是真的吗?他有没有在骗我?他有没有在背后偷偷降我的质?
这就是Anthropic永远失去的东西,再也没有人能把它还给他们了。

还没有评论,来说两句吧...