跳转到内容
← 返回核心概念
人工智能计算机科学 · 机器学习17 分钟阅读

神经网络

Neural Networks

1943 年,神经科学家 Warren McCulloch 和数理逻辑学家 Walter Pitts 发表了一篇论文,提出了第一个神经元的数学模型——受生物神经元启发的简单阈值函数。他们的目标是证明神经元可以计算任意逻辑函数。 八十多年后,这个思路衍生出的人工神经网络,正在重塑人类与计算机的关系。

神经网络反向传播深度学习感知机

1943 年,神经科学家 Warren McCulloch 和数理逻辑学家 Walter Pitts 发表了一篇论文,提出了第一个神经元的数学模型——受生物神经元启发的简单阈值函数。他们的目标是证明神经元可以计算任意逻辑函数。

八十多年后,这个思路衍生出的人工神经网络,正在重塑人类与计算机的关系。

破除误解:神经网络和生物大脑的相似性非常有限

"神经网络"这个名字引发了无尽的混淆——很多人以为人工神经网络是对人类大脑的忠实模拟。实际上,两者只在极抽象的层面上相似:都是由大量相互连接的计算单元组成,都通过调整连接强度来学习。

在几乎所有具体细节上,两者截然不同: - 生物神经元通过离散的电脉冲(脉冲频率编码)通信;人工神经元输出连续值 - 人脑有约 860 亿个神经元、约 101410^{14} 个突触(百万亿量级,常见估计);最大的 AI 模型有数千亿参数,但组织方式完全不同 - 生物学习机制至今未完全理解;反向传播是否在生物神经系统中发生,仍有争议

现代神经网络是数学优化工具,不是大脑的仿真。

为什么说反向传播"不像大脑"?一个具体障碍是权重传输问题(Weight Transport Problem)。反向传播在计算梯度时,反向通路必须精确复用前向通路的权重矩阵(两者对称)。

但真实神经元的前向突触与反向连接在物理上是分离的,没有已知机制能让它们时刻保持权重同步。

2016 年 Lillicrap 等人在《自然·通讯》提出反馈对齐(Feedback Alignment)作为回应:他们证明,即使反向通路用一组固定的随机权重,网络也能在训练中让前向权重逐渐"对齐"到有用方向,在 MNIST、CIFAR 等小数据集上接近反向传播——但在 ImageNet 这类大规模任务上仍明显逊色。这说明大脑即便不用标准反向传播,也可能存在别的高效误差传播机制,这是计算神经科学的活跃前沿。

核心:单个神经元

人工神经元(也叫节点单元)执行简单的计算:

z=i=1nwixi+b=wTx+bz = \sum_{i=1}^{n} w_i x_i + b = \mathbf{w}^T \mathbf{x} + b

a=σ(z)a = \sigma(z)

其中 x\mathbf{x} 是输入,w\mathbf{w} 是权重,$b$ 是偏置,σ\sigma激活函数。激活函数引入非线性:

激活函数公式特点/用途
Sigmoidσ(z)=11+ez\sigma(z) = \frac{1}{1+e^{-z}}输出 (0,1),早期常用,现已少用于隐藏层
Tanhtanh(z)=ezezez+ez\tanh(z) = \frac{e^z - e^{-z}}{e^z + e^{-z}}输出 (-1,1),零中心,比 Sigmoid 好
ReLUReLU(z)=max(0,z)\text{ReLU}(z) = \max(0, z)简单高效,2010 年代成为主流
Leaky ReLUmax(0.01z,z)\max(0.01z, z)解决 ReLU 的"死亡神经元"问题
GELU近似高斯误差线性单元Transformer 中广泛使用
Softmaxsoftmax(zi)=ezijezj\text{softmax}(z_i) = \frac{e^{z_i}}{\sum_j e^{z_j}}用于多分类输出层,输出为概率分布

没有非线性激活函数,多层神经网络等价于单层——因为线性函数的复合仍然是线性函数。激活函数是神经网络"学习复杂函数"能力的来源。

前馈神经网络:层的结构

将神经元排列为层(Layer):

输入层     隐藏层 1    隐藏层 2    输出层
 x_1  ----> O O O ---> O O O ---> O
 x_2  ----> O O O ---> O O O ---> O
 ...        ...         ...
```
  • 输入层:接收原始特征
  • 隐藏层:提取越来越抽象的特征表示("表示学习")
  • 输出层:产生最终预测

神经网络的"深度"指隐藏层数量。浅层网络(1-2 层)理论上能拟合任何函数(通用近似定理),但需要指数级神经元数量;深层网络更高效地表示复杂函数。

通用近似定理(Universal Approximation Theorem):具有至少一个隐藏层和足够多神经元的神经网络,能以任意精度逼近任意连续函数(在有界紧致集上)。这给出了神经网络理论上"为什么有效"的保证,但没有说明实践中需要多大的网络,以及如何训练。

训练:反向传播与梯度下降

神经网络学习的过程是:调整权重 W\mathbf{W} 和偏置 b\mathbf{b},最小化损失函数 $L$(衡量预测与真实标签的差距)。

梯度下降:沿着损失函数对参数的梯度方向(下坡方向)更新参数:

wwηLw\mathbf{w} \leftarrow \mathbf{w} - \eta \frac{\partial L}{\partial \mathbf{w}}

其中 η\eta学习率(Learning Rate),控制步长。

问题是:如何高效计算 Lw\frac{\partial L}{\partial \mathbf{w}}?神经网络有数百万参数,逐一有限差分计算代价不可接受。

反向传播(Backpropagation):应用链式法则,从输出层向输入层反向传播误差,高效计算所有参数的梯度。1986 年由 Rumelhart、Hinton、Williams 在 Nature 论文中推广(注:更早的独立发现包括 Werbos 1974 年的博士论文)。

算法流程: 1. 前向传播:给定输入,计算每层输出,直到得到最终预测 y^\hat{y} 2. 计算损失L=Loss(y^,y)L = \text{Loss}(\hat{y}, y)(如均方误差或交叉熵) 3. 反向传播:用链式法则逐层计算 LW(l)\frac{\partial L}{\partial \mathbf{W}^{(l)}}Lb(l)\frac{\partial L}{\partial \mathbf{b}^{(l)}} 4. 参数更新:梯度下降更新参数 5. 重复直到收敛

随机梯度下降(SGD):每次只用一个(或一小批)样本计算梯度,而非整个数据集。噪声更大,但更新更快,且噪声有时帮助跳出局部极小值。Adam(Adaptive Moment Estimation,2014 年,Kingma & Ba 提出)是目前最常用的优化器,自适应调整每个参数的学习率。

深层网络为何长期难以训练:梯度消失

反向传播在数学上是优雅的,但它曾有一个致命的实践难题:梯度消失(Vanishing Gradient)

1991 年,Sepp Hochreiter 在慕尼黑工业大学的毕业论文里给出了严格分析。链式法则把浅层参数的梯度写成一长串导数的连乘;只要每一项都小于 1,连乘的结果就会随层数指数级地缩小。

Sigmoid 激活函数恰好是重灾区:它的导数最大值只有 0.25。在一个十几层的网络里,前几层收到的梯度会被压缩到几乎为零,权重基本不再更新——网络的浅层"学不动"。

这正是上面激活函数表里 Sigmoid"现已少用于隐藏层"的真正原因,也是神经网络在 1990 年代一度停滞的技术根源之一。

ReLU 的流行很大程度上就是对这个问题的回应:当输入为正时它的导数恒为 1,连乘不再衰减,梯度能畅通地传回浅层。后来的残差连接(ResNet,2015)、批归一化(Batch Normalization,2015)等技巧进一步缓解了梯度消失及其反面"梯度爆炸",才让上百层的网络真正可以训练。

神经网络的历史:两次寒冬与两次春天

时期事件
1943–1969McCulloch-Pitts 神经元,Rosenblatt 感知机(1958),热情高涨
1969–1986Minsky & Papert 的《感知机》证明单层感知机连 XOR 都算不了(非线性可分问题),第一次 AI 寒冬
1986反向传播重新被重视,神经网络复苏
1995–2006SVM 等方法性能更好,第二次低潮
2006Hinton 提出深度信念网络预训练,深度学习重新兴起
2012AlexNet 把 ImageNet top-5 错误率从亚军的 26.2% 一举降到 15.3%,深度学习时代开始
2017–今Transformer 架构,大规模语言模型(GPT、BERT、LLaMA),AI 新纪元
2018 / 2024Bengio、Hinton、LeCun 共获图灵奖(2018);Hopfield 与 Hinton 因神经网络的奠基性贡献共获诺贝尔物理学奖(2024)

代价与争议

可解释性问题:神经网络是"黑箱"——难以理解为什么它对某个输入给出某个输出。特别在医疗、法律、金融等高风险领域,这是重大障碍。可解释 AI(XAI)方法(LIME、SHAP、Grad-CAM)提供部分解释,但没有根本解决。

对抗样本(Adversarial Examples):2013 年,Szegedy 等在《Intriguing Properties of Neural Networks》中发现,给图像添加人眼几乎不可见的微小扰动,就能让高性能分类器输出完全错误的结果。

次年,Goodfellow、Shlens 与 Szegedy 给出了最著名的例子:一张原本被以 57.7% 置信度判为"熊猫"的照片,叠加一层精心设计的噪声后,人眼看仍是熊猫,模型却以 99.3% 的置信度判成"长臂猿"。他们指出,这种脆弱性恰恰源于网络近乎线性的性质,而非过度复杂。这揭示了神经网络的鲁棒性缺陷,对自动驾驶等安全关键应用是严峻威胁。

计算成本与能耗:大型神经网络训练需要数百到数千块 GPU 运行数天乃至数月。GPT-4 的训练成本估计超过 1 亿美元(OpenAI 的 Sam Altman 在 2023 年的公开场合被问及是否花了 1 亿美元时,回答"不止这个数")。这种规模的计算需求使 AI 研究逐渐向大公司集中,引发公平获取和环境影响的担忧。

"越大越好"的趋势本身也有争议。Kaplan 等人 2020 年提出,模型性能随参数量、数据量、算力按平滑的幂律提升("缩放定律")。

但 2022 年 DeepMind 的 Chinchilla 工作(Hoffmann 等,训练了 400 多个模型)反驳道:在固定算力下,当时多数大模型其实"训练不足"——参数和数据应当同比例增长,经验上每个参数约配 20 个训练 token。按此标准,一个 700 亿参数的模型应训练约 1.4 万亿 token 才算算力最优。这场"把算力花在更大的模型,还是更多的数据上"的辩论,直接重塑了此后大模型的设计取向。

跨域连接

  • 线性变换:线性映射的复合仍是线性映射,这条初等事实直接判定了非线性激活的必要性——没有它,任意深的网络都塌缩回单层。通用近似定理补上另一半:单隐层已能逼近任意连续函数,但所需宽度可能指数增长,深度用复合换宽度。推论是表达力从来不是瓶颈,可优化性与样本效率才是。
  • 最优化:梯度消失是连乘的量级问题。反向传播把浅层梯度写成逐层雅可比的乘积,只要每项量级稳定小于一,结果就随深度指数衰减,正文提到那个导数上界不足四分之一的激活函数正是重灾区。于是有了统一解释:正区间导数为一的激活、残差通路与归一化,做的都是把这个乘积的量级拉回一附近。
  • 卷积神经网络:卷积的归纳偏置可以逐条写出来——局部性、权重共享、平移等变。它们不是普适真理而是关于数据的假设,在自然图像上成立,在没有空间结构的表格数据上不成立。推论因此对称:同等参数量下卷积在图像上远胜全连接,而把它搬到打乱列序也无所谓的数据上,反而更差。
  • 神经元:反向传播要求反向通路精确复用前向权重矩阵,而真实突触的前后向连接在物理上分离,没有已知机制维持这种同步。正文提到的反馈对齐说明随机反向权重也能让前向权重逐渐对齐,但在大规模任务上仍明显逊色。这是一条可证伪的预测:若大脑确实做类似的误差传播,就应能找到替代的权重协调机制。
  • 知觉生理学:视觉皮层与卷积网络都呈现由局部到整体的层级,但不变性并不相同,对抗样本正是判决性证据:人眼几乎看不见的微小扰动能让分类器从熊猫翻成长臂猿。这说明网络学到的是在训练分布上够用的判别方向,而非人类那种对高频扰动稳健的表征——层级相似并不蕴含鲁棒性相似。

参考文献

  • McCulloch, W. & Pitts, W. A Logical Calculus of the Ideas Immanent in Nervous Activity. Bulletin of Mathematical Biophysics 5, 1943.
  • Minsky, M. & Papert, S. Perceptrons: An Introduction to Computational Geometry. MIT Press, 1969.
  • Rumelhart, D., Hinton, G., & Williams, R. Learning Representations by Back-propagating Errors. Nature 323, 1986.
  • Hochreiter, S. Untersuchungen zu dynamischen neuronalen Netzen. Diploma thesis, Technische Universität München, 1991.(梯度消失问题的首次系统分析)
  • Krizhevsky, A., Sutskever, I., & Hinton, G. ImageNet Classification with Deep Convolutional Neural Networks. NeurIPS, 2012.
  • Szegedy, C. et al. Intriguing Properties of Neural Networks. ICLR, 2014.
  • Goodfellow, I., Shlens, J., & Szegedy, C. Explaining and Harnessing Adversarial Examples. ICLR, 2015.
  • LeCun, Y., Bengio, Y., & Hinton, G. Deep Learning. Nature 521, 2015.
  • Lillicrap, T., Cownden, D., Tweed, D., & Akerman, C. Random Synaptic Feedback Weights Support Error Backpropagation for Deep Learning. Nature Communications 7, 2016.
  • Goodfellow, I., Bengio, Y., & Courville, A. Deep Learning. MIT Press, 2016. (免费在线版)
  • Kaplan, J. et al. Scaling Laws for Neural Language Models. arXiv:2001.08361, 2020.
  • Hoffmann, J. et al. Training Compute-Optimal Large Language Models (Chinchilla). NeurIPS, 2022.
  • The Royal Swedish Academy of Sciences. The Nobel Prize in Physics 2024 — John J. Hopfield and Geoffrey E. Hinton. Scientific Background, 2024.

延伸阅读

  • Nielsen, M. Neural Networks and Deep Learning. 在线书籍,neuralnetworksanddeeplearning.com, 2015.