Claude Opus 4.8自认是千问?AI蒸馏与数据污染的真相
今天AI圈最火的问题:Claude Opus 4.8到底有没有蒸馏千问?

图片来源于网络,版权归原作者所有,侵权请联系删除
起因:Claude自认是千问
起因是这样的。今天Anthropic发布了号称全球最强的AI模型Claude Opus 4.8,有人问它"你是谁",它居然回答它是千问。
要知道前不久,Anthropic还在坚决抵制AI蒸馏行为,结果它自己就干这种事情。如果我们高呼美国大模型偷中国大模型确实很爽,但正好借这个机会讲一下数据污染和AI蒸馏。
先说结论
虽然Claude Opus 4.8说它是千问,但是不代表Claude就一定蒸馏了千问。AI是没有记忆的,也没有身份证,它就只是根据提示、上下文和训练数据回答了一个最像答案的答案。
所以这个事情有三种可能性:
- Claude确实蒸馏了千问
- Claude的训练数据存在污染
- 以上两种情况都存在
什么是数据污染?
说人话就是大模型吃了不该吃的,或者吃了影响判断的数据。
之前的大模型训练几乎都是真实数据,比如Anthropic之前买了很多本书进行扫描训练Claude,还引起了大量的版权纠纷。后来各家大模型训练的数据,大多数是自己的AI或者是别人的AI生成的数据。前者犯错的机率是比较小的,但是用后者来训练,那就很容易产生错误了。
引起AI产生错误的训练数据,就是数据污染。

图片来源于网络,版权归原作者所有,侵权请联系删除
什么是AI蒸馏?
AI蒸馏其实也不复杂。你可以理解成一个强模型当老师,一个弱模型当学生。老师生成大量的答案,学生拿这些答案去学。最后学生虽然没有老师那么大那么贵,但是也能够学到大部分老师的能力。
AI蒸馏技术本身是不犯法的,而且目前几乎所有的AI都在做。
双标才是问题所在
这次Claude的舆论为什么这么大?其实就是因为它的双标。
目前的AI行业早就进入了相互学习、相互污染、相互模仿的时代。也正因为这样,Claude的这次自称是千问才有意思。它未必证明了Anthropic蒸馏了千问,但是它确实暴露了一个更大的问题——
今天的大模型,能力的来源越来越说不清了。
整个行业的尴尬
AI行业目前最尴尬的地方就是:所有的AI都在用别人的知识训练自己,都不希望自己的模型被别人拿去训练。所有人都说自己是在学习,但当别人学习自己的时候,又会说对方是在偷。
这不是某一家公司的问题,这是目前整个AI行业都在面对的问题。

还没有评论,来说两句吧...