Claude Opus 4.8自认是千问?AI蒸馏与数据污染的真相

刘波

Claude Opus 4.8自认是千问?AI蒸馏与数据污染的真相

今天AI圈最火的问题:Claude Opus 4.8到底有没有蒸馏千问?

Claude Opus 4.8自认是千问?AI蒸馏与数据污染的真相

图片来源于网络,版权归原作者所有,侵权请联系删除

起因:Claude自认是千问

起因是这样的。今天Anthropic发布了号称全球最强的AI模型Claude Opus 4.8,有人问它"你是谁",它居然回答它是千问

要知道前不久,Anthropic还在坚决抵制AI蒸馏行为,结果它自己就干这种事情。如果我们高呼美国大模型偷中国大模型确实很爽,但正好借这个机会讲一下数据污染AI蒸馏

先说结论

虽然Claude Opus 4.8说它是千问,但是不代表Claude就一定蒸馏了千问。AI是没有记忆的,也没有身份证,它就只是根据提示、上下文和训练数据回答了一个最像答案的答案。

所以这个事情有三种可能性

  1. Claude确实蒸馏了千问
  2. Claude的训练数据存在污染
  3. 以上两种情况都存在

什么是数据污染?

说人话就是大模型吃了不该吃的,或者吃了影响判断的数据

之前的大模型训练几乎都是真实数据,比如Anthropic之前买了很多本书进行扫描训练Claude,还引起了大量的版权纠纷。后来各家大模型训练的数据,大多数是自己的AI或者是别人的AI生成的数据。前者犯错的机率是比较小的,但是用后者来训练,那就很容易产生错误了。

引起AI产生错误的训练数据,就是数据污染

Claude Opus 4.8自认是千问?AI蒸馏与数据污染的真相

图片来源于网络,版权归原作者所有,侵权请联系删除

什么是AI蒸馏?

AI蒸馏其实也不复杂。你可以理解成一个强模型当老师,一个弱模型当学生。老师生成大量的答案,学生拿这些答案去学。最后学生虽然没有老师那么大那么贵,但是也能够学到大部分老师的能力。

AI蒸馏技术本身是不犯法的,而且目前几乎所有的AI都在做。

双标才是问题所在

这次Claude的舆论为什么这么大?其实就是因为它的双标

目前的AI行业早就进入了相互学习、相互污染、相互模仿的时代。也正因为这样,Claude的这次自称是千问才有意思。它未必证明了Anthropic蒸馏了千问,但是它确实暴露了一个更大的问题——

今天的大模型,能力的来源越来越说不清了。

整个行业的尴尬

AI行业目前最尴尬的地方就是:所有的AI都在用别人的知识训练自己,都不希望自己的模型被别人拿去训练。所有人都说自己是在学习,但当别人学习自己的时候,又会说对方是在偷。

这不是某一家公司的问题,这是目前整个AI行业都在面对的问题。

文章版权声明:文章内容均来源于各大短视频平台搜集以及修改和删减新增,如有侵权或者违规,请联系站长进行删除,如需转载或复制请以超链接形式并注明出处。

发表评论

快捷回复: 表情:
AddoilApplauseBadlaughBombCoffeeFabulousFacepalmFecesFrownHeyhaInsidiousKeepFightingNoProbPigHeadShockedSinistersmileSlapSocialSweatTolaughWatermelonWittyWowYeahYellowdog
验证码
评论列表 (暂无评论,13人围观)

还没有评论,来说两句吧...

目录[+]