2016 年 AlphaGo 战胜李世石、2023 年 ChatGPT 引爆全球,背后都是同一个技术——深度学习(Deep Learning)。
深度学习是机器学习的一个子集,但它和传统机器学习有本质区别。传统机器学习需要人告诉它”特征是什么”——比如识别猫,要人先告诉它”猫有尖耳朵、有胡须、有尾巴”。深度学习不需要人告诉特征,它能自己从海量数据里”发现”特征。给它看 100 万张猫的图片,它自己就学会了”猫长什么样”。
这个”自己发现特征”的能力,靠的是一种叫”神经网络”的结构。神经网络模仿人脑神经元的连接方式——一层一层地处理信息,每一层负责提取不同的特征。第一层可能识别”边缘和线条”,第二层识别”眼睛和耳朵”,第三层识别”脸和身体”,最后一层告诉你”这是一只猫”。
“深度”这个词,就是指神经网络的层数很多——可以是几十层、几百层,甚至上千层。层数越多,能学到的特征越复杂,能解决的问题也越难。
深度学习有几个核心方向:
计算机视觉(CV):让机器”看懂”图像和视频。人脸识别、自动驾驶识别红绿灯、医疗影像诊断,都靠它。
自然语言处理(NLP):让机器”读懂”和”写出”人类语言。ChatGPT、文心一言、翻译软件、智能客服,都属于这一类。
语音识别和合成:让机器听懂人说话、让机器开口说话。Siri、小爱同学、有声书 AI 配音,都靠它。
多模态学习:让机器同时处理图像、文字、声音。GPT-4V 能看图说话、Sora 能根据文字生成视频,都是多模态学习。
深度学习的爆发有三个关键条件:第一,算力——GPU/TPU 让大规模并行计算变得便宜;第二,数据——互联网时代积累了海量图片、文字、视频;第三,算法——2010 年后的算法突破(ReLU 激活、Dropout、Transformer)让训练超深网络成为可能。
今天,深度学习已经渗透到几乎所有 AI 应用里。从你手机相册的”回忆”功能,到医院的癌症早筛,到工厂的视觉质检,背后都是深度学习。可以这么说:没有深度学习,就没有 2023 年开始的这波 AI 浪潮。