当深度学习卷成今天这样,这些项目居然还在硬刚
说实话,每次有人问我“深度学习到底该学哪个框架”,我都想先叹口气。这行当变化实在太快了——昨天还在用TensorFlow 1.0,今天PyTorch已经杀疯了;前脚刚学会BERT怎么用,后脚GPT-4就能帮你写代码了。
但不管怎么变,有些项目是真的硬核,硬核到你不了解它们简直不好意思说自己是搞AI的。今天就聊聊我心目中那十个“顶顶有名”的深度学习项目,顺便夹带点私货和个人看法。
1. PyTorch:研究者心中的白月光
PyTorch这两年有多火就不用我多说了吧?基本上现在发论文,不提自己用了PyTorch都不好意思跟人打招呼。
Meta(原Facebook)家的这个框架,动态图机制简直是业界良心。你写代码时可以随时print中间变量,随时打断点调试,这在TensorFlow 1.0时代是想都不敢想的奢侈。
“说白了,PyTorch就是让科研狗能痛痛快快做实验,不用跟静态图较劲。”
最骚的是,PyTorch的生态已经卷到飞起——Transformers、PyTorch Lightning、torchtext、torchvision……几乎你需要的任何工具都有人帮你写好了。在学术界,它基本上已经吃掉了半壁江山。
2. TensorFlow:谷歌的亲儿子,想躺平都难
虽然PyTorch在科研界呼风唤雨,但TensorFlow在工业界的地位依然稳如老狗。
谷歌这家公司吧,你不得不服——人家有TPU这种专为深度学习定制的硬件,还有TensorFlow Extended(TFX)这种端到端的机器学习平台。论工程化能力,TensorFlow还是爸爸。
TensorFlow 2.0之后,总算把Eager Execution改成默认了,总算不那么反人类了。但讲真,我身边很多从TensorFlow转PyTorch的朋友都说:“回不去了,PyTorch写起来真的太顺手。”
不过谷歌最近在AI方面有点四面受敌的感觉——OpenAI微软那边ChatGPT炸了天,PyTorch又抢走了科研话语权。TensorFlow接下来怎么走还真不好说。
3. Hugging Face Transformers:这个图标像脸一样的项目,凭啥这么火
你绝对在各种地方见过这个黄色的emoji脸。
Hugging Face这公司有多离谱?它硬生生把Transformers这个模型库做成了深度学习界的“GitHub”——不对,比GitHub还夸张,几乎所有开源模型都在它家平台上。
BERT、GPT、T5、RoBERTa、DistilBERT……你能想到的预训练模型,几乎都能在Hugging Face上找到现成的权重和代码。
“毫不夸张地说,现在入门NLP,先学会用Hugging Face,比你啃三天原始论文还有用。”
他们家的pipeline功能简直丧心病狂——三行代码就能做情感分析、文本生成、问答系统。门槛低到让很多所谓“AI培训师”失业。
4. Keras:写给人类的深度学习API
提到Keras,必须先吐槽一下它的“认爹”历史。
最早是独立项目,后来被Google收购成了TensorFlow的官方高级API,再后来又从TensorFlow里独立出来,现在又可以跟PyTorch、MXNet等多个后端配合使用。
但不管怎么折腾,Keras的易用性始终是它最大的卖点。
model = Sequential([
Dense(64, activation='relu'),
Dense(10, activation='softmax')
])
model.compile(optimizer='adam', loss='categorical_crossentropy')
就这种简洁程度,入门深度学习的门槛简直低到令人发指。很多初学者第一行神经网络代码都是用Keras写的,包括我自己。
“说白了,Keras就是那种'我可以不用,但你不能没有'的存在。”
5. AlphaFold:诺奖级别的存在
这个必须单独拿出来说。
DeepMind(谷歌旗下AI公司)的AlphaFold,在蛋白质结构预测这个领域,基本上是掀桌子的存在。2020年的AlphaFold 2直接解决了生物学家搞了50年的难题——根据氨基酸序列预测蛋白质三维结构。
2024年的AlphaFold 3更是离谱,连DNA、RNA的小分子配体都给你预测出来了。
Science杂志直接把它评为年度科学突破。有多夸张?欧洲生物信息研究所(EBI)的数据显示,全球已经有超过2亿研究人员使用过AlphaFold的数据库。
“这玩意儿要是能早点出来,我当年读生物化学的时候也不至于挂科挂那么惨。”
6. CUDA:英伟达统治AI的幕后推手
严格来说CUDA不是深度学习框架,但它绝对是最重要的基础设施。
没有CUDA,英伟达的GPU就只是一块能玩游戏的显卡;有了CUDA,深度学习训练速度才能从“等到天荒地老”变成“也就是几小时的事”。
英伟达今天市值能突破万亿,CUDA生态绝对功不可没。所有主流深度学习框架都在CUDA上运行,包括TensorFlow、PyTorch、MXNet等等。
“某种意义上,深度学习行业就是在给英伟达打工——这句话虽然难听,但接近事实。”
不过AMD最近在ROCm上也在发力,Intel的oneAPI也在追赶。万一哪天CUDA不是唯一选择,那才热闹呢。
7. BERT:开启预训练时代的神作
2018年,谷歌发布了BERT(Bidirectional Encoder Representations from Transformers),这个模型一出来,整个NLP领域直接变天。
在此之前,word2vec、GloVe这种词向量是主流,但它们是静态的——同一个词在不同语境下向量是一样的。BERT不一样,它是双向的,能根据上下文理解词义。
“BERT之前,大家训练模型像在打工;BERT之后,大家fine-tuning像在捡钱。”
GPT-1/2/3也是预训练模型,但BERT走的是Encoder路线,更适合理解任务;GPT走的是Decoder路线,更适合生成任务。这两个路线基本定义了后来NLP模型的主流方向。
8. GPT系列:从“人工智障”到“ChatGPT”的逆袭
OpenAI的GPT系列,可能是这两年最出圈的技术没有之一。
从2018年GPT-1的1.17亿参数,到2019年GPT-2的15亿参数,再到2020年GPT-3的1750亿参数,参数量的指数增长让所有人都惊掉了下巴。
“GPT-2发布那会儿,很多人(包括我)还说'这玩意儿有啥用'。结果2022年底ChatGPT直接刷新了全世界对AI的认知。”
2024年的GPT-4更是离谱,推理能力、代码能力、多模态能力全面开花。虽然OpenAI不再Open,但不得不承认,它确实重新定义了AI的可能性。
9. Stable Diffusion:让AI绘画走进千家万户
2022年,Stability AI开源了Stable Diffusion,这个模型直接把AI绘画的门槛干到了显卡就能跑的程度。
在此之前,Midjourney、DALL·E 2虽然效果惊人,但要么需要排队等API,要么需要订阅付费。Stable Diffusion开源之后,所有人都在自己电脑上跑起了AI绘画。
“最离谱的是,开源社区的迭代速度比商业公司还快——ControlNet、LoRA、IP-Adapter……各种衍生版本层出不穷。”
ControlNet更是神中神,直接解决了AI绘画“控制不住”的世纪难题。现在做AI绘画,如果不提ControlNet,大概相当于做深度学习不知道神经网络是什么。
10. DeepMind AlphaGo系列:让AI走进大众视野
必须把AlphaGo放在最后,因为它是真正意义上的第一个全民级AI事件。
2016年AlphaGo击败李世石,2017年击败柯洁,彻底点燃了公众对人工智能的热情。那句“李世石、神之一手、AlphaGo 1:4落后”,至今想起来都热血沸腾。
后来的AlphaZero更是离谱——不学人类棋谱,从零开始自己训练,8小时就能碾压AlphaGo,12小时就能称霸围棋、国际象棋、日本将棋。
“很多人说AlphaGo是'弱人工智能',但你不得不承认,它在特定领域确实是的神一样的存在。”
写在最后
这十个项目吧,各有各的牛逼。
有的改变了一个行业(AlphaFold),有的重新定义了人机交互(GPT),有的降低了技术门槛(Hugging Face、Stable Diffusion),有的则是整个AI时代的基石(CUDA)。
作为一个在深度学习里摸爬滚打好几年的人,我的最大感受是:别追新,别焦虑,选一个方向扎实干,比啥都强。
框架会过时,但基础概念不会;模型会迭代,但数学原理不会。PyTorch今天火,明天可能出新的挑战者,但你会的那套东西,永远是你的。
行了,关于深度学习项目就先聊到这儿。如果你也是这行的老炮,欢迎评论区聊聊你觉得还有哪些项目该上榜的。


还没有评论,来说两句吧...