跳转到内容
← 返回核心概念
人工智能计算机科学 · 深度学习18 分钟阅读

深度学习架构

Deep Learning Architectures

2012 年 9 月,ImageNet 大规模视觉识别挑战赛(ILSVRC)的结果公布。多伦多大学的 AlexNet 以 15.3% 的 Top-5 错误率获胜,而第二名是 26.2%——超出约 11 个百分点。这不是渐进改进,是质的飞跃。 AlexNet 的核心是一个深度卷积神经网络,约 6000 万个参数、65 万…

深度学习CNNTransformer生成模型

2012 年 9 月,ImageNet 大规模视觉识别挑战赛(ILSVRC)的结果公布。多伦多大学的 AlexNet 以 15.3% 的 Top-5 错误率获胜,而第二名是 26.2%——超出约 11 个百分点。这不是渐进改进,是质的飞跃。

AlexNet 的核心是一个深度卷积神经网络,约 6000 万个参数、65 万个神经元,在两块 GTX 580 GPU 上训练了约一周。

值得一提的是,它把网络拆到两块 GPU 上并不是为了"加速",而是因为单块 GTX 580 只有 3GB 显存,装不下整个模型——这本身就说明,当时深度学习是被硬件死死卡住的。

这一刻被广泛认为是现代深度学习时代的起点——不是因为它发明了新概念,而是因为它用规模和 GPU 把已有思想变成了统治性技术。

破除误解:"深度"不只是"更多层"

深度学习的"深"不仅指神经网络有很多层。更根本的是,深层架构能自动学习层次化的特征表示(Hierarchical Representations)

  • 图像的第一层学习边缘和颜色
  • 第二层学习纹理和局部形状
  • 第三层学习物体部件
  • 更深层学习整体概念

这种从原始数据到抽象语义的自动表示学习,是深度学习超越传统机器学习(依赖人工特征工程)的核心原因。

而且"层数越多越好"本身就是个被实验推翻的直觉。2015 年的 ResNet 论文给出了著名的反例:一个 56 层的"普通"卷积网络,在训练集上的误差竟然比 20 层的还高。

注意,这里是训练误差升高,不是测试误差——所以问题不是过拟合(模型记住了训练集却泛化不了),而是更深的网络根本难以优化。后文的残差连接正是为解决这个"退化问题(Degradation Problem)"而生。

卷积神经网络(CNN):为图像而生

CNN 由 Yann LeCun 于 1989-1998 年期间开发(LeNet 用于手写数字识别),2012 年随 AlexNet 爆发。

CNN 的设计并非凭空而来,它的思想源头在神经科学。1950-60 年代,Hubel 和 Wiesel 通过记录猫视觉皮层的单个神经元,发现皮层里存在分工:一类"简单细胞"对特定朝向的边缘敏感,另一类"复杂细胞"则对边缘出现的具体位置不那么敏感(具有一定平移不变性)。这项工作让二人获得 1981 年诺贝尔生理学或医学奖。

1980 年,日本学者 Fukushima Kunihiko(福岛邦彦)把这个"简单细胞—复杂细胞"的层级结构搬进神经网络,提出 Neocognitron(神经认知机),它正是现代 CNN 卷积层与池化层的直接前身。换句话说,CNN 是把大脑视觉皮层的一个发现,工程化成了可训练的数学结构。

卷积层:用一组小的可学习滤波器(Kernel)在输入上滑动,每个滤波器提取一种特征:

(XK)[i,j]=mnX[i+m,j+n]K[m,n](\mathbf{X} * \mathbf{K})[i, j] = \sum_{m}\sum_{n} \mathbf{X}[i+m, j+n] \cdot \mathbf{K}[m, n]

卷积的关键属性: - 参数共享:同一滤波器在整张图上滑动,参数数量与图像大小无关 - 局部连接:每个神经元只连接输入的局部区域,符合图像的局部相关性 - 平移不变性:无论特征出现在图像什么位置,都能被检测到

池化层(Pooling):对局部区域取最大值或平均值,降低空间分辨率(下采样),增加感受野,减少计算量。

CNN 架构演化

架构年份深度亮点
AlexNet20128 层ReLU、Dropout、GPU 训练
VGGNet201416/19 层使用 3x3 小滤波器堆叠
GoogLeNet/Inception201422 层Inception 模块并行多尺度卷积
ResNet2015152 层残差连接(Skip Connection)解决梯度消失
EfficientNet2019可扩展系统化地平衡深度/宽度/分辨率

残差网络(ResNet)是 2015 年的重大突破。训练极深网络时面临梯度消失问题(梯度在反向传播时逐层缩小,远层几乎收不到梯度信号)。ResNet 引入跳跃连接(Skip Connection)

H(x)=F(x)+x\mathbf{H}(\mathbf{x}) = \mathbf{F}(\mathbf{x}) + \mathbf{x}

让网络学习"残差"而非完整映射。梯度可以直接通过恒等路径回传,使 152 层的网络训练成为可能。

ResNet 凭此拿下 ILSVRC 2015 冠军,集成模型的 Top-5 错误率降到 3.57%,相比 2014 年冠军 GoogLeNet 的 6.67% 几乎砍掉一半,已明显低于常被引用的约 5% 人类参考水平。ResNet-50、ResNet-101 至今仍是图像处理的基础骨干。

循环神经网络(RNN):处理序列数据

文本、语音、时间序列——数据有前后依赖关系。RNN 引入隐藏状态(Hidden State)在时间步之间传递信息:

ht=σ(Whhht1+Wxhxt+b)\mathbf{h}_t = \sigma(\mathbf{W}_{hh} \mathbf{h}_{t-1} + \mathbf{W}_{xh} \mathbf{x}_t + \mathbf{b})

长短期记忆网络(LSTM,Long Short-Term Memory):1997 年由 Hochreiter & Schmidhuber 提出。引入门控机制(输入门、遗忘门、输出门),解决 RNN 长程依赖问题(长序列的早期信息难以保持)。LSTM 在 2010 年代是序列任务(语言模型、机器翻译、语音识别)的主流架构,直到 Transformer 出现。

Transformer:统治当代 AI 的架构

2017 年,Google Brain 团队发表论文《Attention Is All You Need》,提出 Transformer 架构,彻底改变了 NLP 乃至整个深度学习领域。

这里有个常被误解的地方:这篇论文并没有"发明"注意力。早在 2014 年,Bahdanau、Cho 和 Bengio 就在机器翻译里引入了注意力机制,让解码器在翻译每个词时动态聚焦原文的不同部分。Transformer 真正的激进之处,是它把循环结构(RNN)整个拿掉,靠注意力来建模序列——论文标题"Attention Is All You Need"说的正是这件事。

Transformer 的核心是自注意力机制(Self-Attention)

Attention(Q,K,V)=softmax(QKTdk)V\text{Attention}(\mathbf{Q}, \mathbf{K}, \mathbf{V}) = \text{softmax}\left(\frac{\mathbf{Q}\mathbf{K}^T}{\sqrt{d_k}}\right) \mathbf{V}

其中 Q\mathbf{Q}(Query)、K\mathbf{K}(Key)、V\mathbf{V}(Value)都从输入线性变换得到。自注意力让序列中每个位置都能直接"看到"其他所有位置,不受距离限制。

Transformer 相对于 RNN 的优势: - 并行计算(RNN 必须顺序处理) - 全局依赖(RNN 长程依赖衰减) - 更易扩展到更大规模

多头注意力(Multi-Head Attention):并行运行多组注意力,每组关注不同的语义关系(语法、语义、指代……),结果拼接后线性变换。

代价:注意力不是免费的。 自注意力要让每个位置都和其他所有位置比较,计算量随序列长度 $n$O(n2)O(n^2) 增长。处理一篇短文还好,处理几十万 token 的长文档或高分辨率图像时,这个平方项就变成了真正的瓶颈——长上下文之所以昂贵,根子就在这里。

主流之外的挑战者。 正因为这个平方瓶颈,"Transformer 是否是终点"一直有争议。2023 年底,Gu 和 Dao 提出 Mamba,基于"选择性状态空间模型(Selective State Space Model)",把计算量压回随序列长度线性增长。论文报告 Mamba-3B 在语言建模上能匹敌两倍参数量的 Transformer。目前 Mamba 等状态空间模型尚未撼动 Transformer 的统治地位,但它提醒我们:当前架构是一个工程权衡,而非物理定律。

Transformer 迅速从 NLP 扩展到: - 视觉:Vision Transformer(ViT,2020)——把图像切成 16×16 的小块当作"词"来处理。但有个关键前提:ViT 只有在约 1 亿张图像以上的超大数据集上预训练时才超越 CNN;数据不够多时,它反而打不过 CNN,因为它缺少卷积自带的局部性与平移不变性这类"先验" - 多模态:CLIP(OpenAI,2021)——联合训练图像-文本表示 - 蛋白质结构预测:AlphaFold2(DeepMind,2020)——核心是基于注意力的 Evoformer 模块。在 CASP14 竞赛中,它对 97 个目标里的 88 个给出了最佳预测,全局距离测试(GDT)中位数达 92.4(满分 100),精度逼近 X 射线晶体学等实验手段

生成模型

生成对抗网络(GAN,Generative Adversarial Network):Ian Goodfellow 2014 年提出。生成器(Generator)和判别器(Discriminator)相互博弈:

  • 生成器:从随机噪声生成假数据,试图骗过判别器
  • 判别器:区分真实数据和生成数据,试图揭穿生成器

两者同时训练,形成动态博弈,最终生成器能生成以假乱真的样本。GAN 在图像生成(StyleGAN、DALL-E 前身)领域取得惊人成果,也是 Deepfake 技术的基础。

变分自编码器(VAE):学习数据的潜在空间表示(Latent Space),能生成新样本并做有意义的插值。

扩散模型(Diffusion Models):2020 年后成为图像生成的主流。训练过程逐步向数据添加噪声(前向过程),推断过程逐步去噪(反向过程)。

它的灵感直接来自物理学。2015 年,Sohl-Dickstein 等人在论文《用非平衡热力学做深度无监督学习》中,借用描述分子系统如何从有序走向无序的扩散过程,反过来构造"从噪声还原数据"的生成模型。

不过它真正变得实用是 2020 年,Ho 等人提出去噪扩散概率模型(DDPM),首次让扩散模型的图像质量追上当时统治图像生成的 GAN。今天 Stable Diffusion、DALL-E 2、Midjourney 都建立在这条技术路线上。

大语言模型(LLM):基于 Transformer 的自回归语言模型,通过预测下一个词来学习语言。GPT 系列(OpenAI)、BERT(Google)、LLaMA(Meta)代表了这一范式的最高成就。

代价与争议

规模该怎么用,本身就有争议:深度学习有条经验规律——"规模即性能",更大的模型、更多数据、更多算力往往带来更好的结果。但"规模"具体指什么,曾被严重误读。

2022 年,DeepMind 的 Hoffmann 等人发表 Chinchilla 论文,指出此前业界一味把钱砸在"加大参数量"上是错的:在固定算力预算下,模型参数和训练数据应当大致同比增长,经验上约每个参数配 20 个 token。

为验证这一点,他们用与 2800 亿参数的 Gopher 相同的算力,训练了只有 700 亿参数、却喂了 1.4 万亿 token 的 Chinchilla,结果全面胜出。这说明当时许多大模型并非"太大",而是相对其体量被严重喂不饱——把同样的算力分配得更聪明,比盲目堆参数更划算。

幻觉(Hallucination):大语言模型经常自信地生成事实错误的内容。这源于其训练目标(预测下一个词)与"准确表达真实世界信息"之间的不对齐。这是当前 LLM 最严峻的实际挑战之一。

版权与数据来源:生成模型在大量互联网数据上训练,包括有版权的作品。艺术家、作家群体对此提起了多起诉讼。法律如何平衡 AI 训练与版权保护,全球各司法管辖区仍在摸索。

跨域连接

  • GPU 与并行计算:当年把网络拆到两块显卡上不是为了加速,而是单卡显存装不下。这提示了一条至今成立的规律:架构的可行边界由显存与带宽划定,注意力的平方级开销之所以是硬瓶颈,也因为它先撞上的是显存而非算力。推论是:架构创新常常先表现为能不能装下,其次才是效果好不好。
  • 统计力学:扩散模型的前向过程把数据分布逐步推向高熵的噪声,反向学的是这条路径的时间反演。只要每步加噪足够小,反向条件分布就近似同族,因而可以用同一个网络反复去噪——这条数学骨架直接借自非平衡热力学。
  • 边际分析:固定算力预算下,参数与数据是两种要素,最优点落在两者边际产出相等处。一味加大参数却喂不饱数据,等于把预算全押在边际收益已经很低的那一侧;重新配比之后,更小的模型反而胜出。推论是:报告一个模型强不强,必须同时给出参数量与训练数据量。
  • 神经元:卷积层的层级结构确实借自视觉皮层的简单细胞与复杂细胞,但"受启发"不等于同构:生物视觉有大量自上而下的反馈,卷积网络主要是前馈的。因此把它当作大脑模型,会在遮挡与情境线索的场景上预测错。
  • 大模型与语言理解:幻觉不是缺陷,而是目标函数的直接后果——训练要求预测下一个词,从未要求说真话,事实性只是训练分布的副产品。可检验推论:靠加大规模压不掉幻觉,只能外挂检索与核查,或改变优化目标。同理,在训练分布之外提问,模型的自信程度并不会随之下降。

参考文献

  • Krizhevsky, A., Sutskever, I., & Hinton, G. ImageNet Classification with Deep Convolutional Neural Networks. NeurIPS, 2012. (AlexNet 原论文)
  • He, K., Zhang, X., Ren, S., & Sun, J. Deep Residual Learning for Image Recognition. CVPR, 2016. (ResNet,含 56 层退化问题与 ILSVRC 2015 结果)
  • Vaswani, A. et al. Attention Is All You Need. NeurIPS, 2017. (Transformer 原论文)
  • Goodfellow, I. et al. Generative Adversarial Nets. NeurIPS, 2014. (GAN)
  • Hubel, D. H., & Wiesel, T. N. Receptive fields, binocular interaction and functional architecture in the cat's visual cortex. The Journal of Physiology, 1962. (简单细胞/复杂细胞)
  • Fukushima, K. Neocognitron: A Self-organizing Neural Network Model for a Mechanism of Pattern Recognition Unaffected by Shift in Position. Biological Cybernetics, 1980. (CNN 前身)
  • Hochreiter, S., & Schmidhuber, J. Long Short-Term Memory. Neural Computation, 1997. (LSTM)
  • Bahdanau, D., Cho, K., & Bengio, Y. Neural Machine Translation by Jointly Learning to Align and Translate. ICLR, 2015. (注意力机制,早于 Transformer)
  • Dosovitskiy, A. et al. An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale. ICLR, 2021. (ViT)
  • Sohl-Dickstein, J. et al. Deep Unsupervised Learning using Nonequilibrium Thermodynamics. ICML, 2015. (扩散模型的物理起源)
  • Ho, J., Jain, A., & Abbeel, P. Denoising Diffusion Probabilistic Models. NeurIPS, 2020. (DDPM)
  • Jumper, J. et al. Highly Accurate Protein Structure Prediction with AlphaFold. Nature, 2021. (AlphaFold2)
  • Hoffmann, J. et al. Training Compute-Optimal Large Language Models. NeurIPS, 2022. (Chinchilla 缩放定律)
  • Gu, A., & Dao, T. Mamba: Linear-Time Sequence Modeling with Selective State Spaces. arXiv:2312.00752, 2023. (状态空间模型)