1943 年,神经科学家 Warren McCulloch 和数理逻辑学家 Walter Pitts 发表了一篇论文,提出了第一个神经元的数学模型——受生物神经元启发的简单阈值函数。他们的目标是证明神经元可以计算任意逻辑函数。
八十多年后,这个思路衍生出的人工神经网络,正在重塑人类与计算机的关系。
破除误解:神经网络和生物大脑的相似性非常有限
"神经网络"这个名字引发了无尽的混淆——很多人以为人工神经网络是对人类大脑的忠实模拟。实际上,两者只在极抽象的层面上相似:都是由大量相互连接的计算单元组成,都通过调整连接强度来学习。
在几乎所有具体细节上,两者截然不同: - 生物神经元通过离散的电脉冲(脉冲频率编码)通信;人工神经元输出连续值 - 人脑有约 860 亿个神经元、约 个突触(百万亿量级,常见估计);最大的 AI 模型有数千亿参数,但组织方式完全不同 - 生物学习机制至今未完全理解;反向传播是否在生物神经系统中发生,仍有争议
现代神经网络是数学优化工具,不是大脑的仿真。
为什么说反向传播"不像大脑"?一个具体障碍是权重传输问题(Weight Transport Problem)。反向传播在计算梯度时,反向通路必须精确复用前向通路的权重矩阵(两者对称)。
但真实神经元的前向突触与反向连接在物理上是分离的,没有已知机制能让它们时刻保持权重同步。
2016 年 Lillicrap 等人在《自然·通讯》提出反馈对齐(Feedback Alignment)作为回应:他们证明,即使反向通路用一组固定的随机权重,网络也能在训练中让前向权重逐渐"对齐"到有用方向,在 MNIST、CIFAR 等小数据集上接近反向传播——但在 ImageNet 这类大规模任务上仍明显逊色。这说明大脑即便不用标准反向传播,也可能存在别的高效误差传播机制,这是计算神经科学的活跃前沿。
核心:单个神经元
人工神经元(也叫节点或单元)执行简单的计算:
其中 是输入, 是权重,$b$ 是偏置, 是激活函数。激活函数引入非线性:
| 激活函数 | 公式 | 特点/用途 |
|---|---|---|
| Sigmoid | 输出 (0,1),早期常用,现已少用于隐藏层 | |
| Tanh | 输出 (-1,1),零中心,比 Sigmoid 好 | |
| ReLU | 简单高效,2010 年代成为主流 | |
| Leaky ReLU | 解决 ReLU 的"死亡神经元"问题 | |
| GELU | 近似高斯误差线性单元 | Transformer 中广泛使用 |
| Softmax | 用于多分类输出层,输出为概率分布 |
没有非线性激活函数,多层神经网络等价于单层——因为线性函数的复合仍然是线性函数。激活函数是神经网络"学习复杂函数"能力的来源。
前馈神经网络:层的结构
将神经元排列为层(Layer):
输入层 隐藏层 1 隐藏层 2 输出层
x_1 ----> O O O ---> O O O ---> O
x_2 ----> O O O ---> O O O ---> O
... ... ...
```- 输入层:接收原始特征
- 隐藏层:提取越来越抽象的特征表示("表示学习")
- 输出层:产生最终预测
神经网络的"深度"指隐藏层数量。浅层网络(1-2 层)理论上能拟合任何函数(通用近似定理),但需要指数级神经元数量;深层网络更高效地表示复杂函数。
通用近似定理(Universal Approximation Theorem):具有至少一个隐藏层和足够多神经元的神经网络,能以任意精度逼近任意连续函数(在有界紧致集上)。这给出了神经网络理论上"为什么有效"的保证,但没有说明实践中需要多大的网络,以及如何训练。
训练:反向传播与梯度下降
神经网络学习的过程是:调整权重 和偏置 ,最小化损失函数 $L$(衡量预测与真实标签的差距)。
梯度下降:沿着损失函数对参数的梯度方向(下坡方向)更新参数:
其中 是学习率(Learning Rate),控制步长。
问题是:如何高效计算 ?神经网络有数百万参数,逐一有限差分计算代价不可接受。
反向传播(Backpropagation):应用链式法则,从输出层向输入层反向传播误差,高效计算所有参数的梯度。1986 年由 Rumelhart、Hinton、Williams 在 Nature 论文中推广(注:更早的独立发现包括 Werbos 1974 年的博士论文)。
算法流程: 1. 前向传播:给定输入,计算每层输出,直到得到最终预测 2. 计算损失:(如均方误差或交叉熵) 3. 反向传播:用链式法则逐层计算 和 4. 参数更新:梯度下降更新参数 5. 重复直到收敛
随机梯度下降(SGD):每次只用一个(或一小批)样本计算梯度,而非整个数据集。噪声更大,但更新更快,且噪声有时帮助跳出局部极小值。Adam(Adaptive Moment Estimation,2014 年,Kingma & Ba 提出)是目前最常用的优化器,自适应调整每个参数的学习率。
深层网络为何长期难以训练:梯度消失
反向传播在数学上是优雅的,但它曾有一个致命的实践难题:梯度消失(Vanishing Gradient)。
1991 年,Sepp Hochreiter 在慕尼黑工业大学的毕业论文里给出了严格分析。链式法则把浅层参数的梯度写成一长串导数的连乘;只要每一项都小于 1,连乘的结果就会随层数指数级地缩小。
Sigmoid 激活函数恰好是重灾区:它的导数最大值只有 0.25。在一个十几层的网络里,前几层收到的梯度会被压缩到几乎为零,权重基本不再更新——网络的浅层"学不动"。
这正是上面激活函数表里 Sigmoid"现已少用于隐藏层"的真正原因,也是神经网络在 1990 年代一度停滞的技术根源之一。
ReLU 的流行很大程度上就是对这个问题的回应:当输入为正时它的导数恒为 1,连乘不再衰减,梯度能畅通地传回浅层。后来的残差连接(ResNet,2015)、批归一化(Batch Normalization,2015)等技巧进一步缓解了梯度消失及其反面"梯度爆炸",才让上百层的网络真正可以训练。
神经网络的历史:两次寒冬与两次春天
| 时期 | 事件 |
|---|---|
| 1943–1969 | McCulloch-Pitts 神经元,Rosenblatt 感知机(1958),热情高涨 |
| 1969–1986 | Minsky & Papert 的《感知机》证明单层感知机连 XOR 都算不了(非线性可分问题),第一次 AI 寒冬 |
| 1986 | 反向传播重新被重视,神经网络复苏 |
| 1995–2006 | SVM 等方法性能更好,第二次低潮 |
| 2006 | Hinton 提出深度信念网络预训练,深度学习重新兴起 |
| 2012 | AlexNet 把 ImageNet top-5 错误率从亚军的 26.2% 一举降到 15.3%,深度学习时代开始 |
| 2017–今 | Transformer 架构,大规模语言模型(GPT、BERT、LLaMA),AI 新纪元 |
| 2018 / 2024 | Bengio、Hinton、LeCun 共获图灵奖(2018);Hopfield 与 Hinton 因神经网络的奠基性贡献共获诺贝尔物理学奖(2024) |
代价与争议
可解释性问题:神经网络是"黑箱"——难以理解为什么它对某个输入给出某个输出。特别在医疗、法律、金融等高风险领域,这是重大障碍。可解释 AI(XAI)方法(LIME、SHAP、Grad-CAM)提供部分解释,但没有根本解决。
对抗样本(Adversarial Examples):2013 年,Szegedy 等在《Intriguing Properties of Neural Networks》中发现,给图像添加人眼几乎不可见的微小扰动,就能让高性能分类器输出完全错误的结果。
次年,Goodfellow、Shlens 与 Szegedy 给出了最著名的例子:一张原本被以 57.7% 置信度判为"熊猫"的照片,叠加一层精心设计的噪声后,人眼看仍是熊猫,模型却以 99.3% 的置信度判成"长臂猿"。他们指出,这种脆弱性恰恰源于网络近乎线性的性质,而非过度复杂。这揭示了神经网络的鲁棒性缺陷,对自动驾驶等安全关键应用是严峻威胁。
计算成本与能耗:大型神经网络训练需要数百到数千块 GPU 运行数天乃至数月。GPT-4 的训练成本估计超过 1 亿美元(OpenAI 的 Sam Altman 在 2023 年的公开场合被问及是否花了 1 亿美元时,回答"不止这个数")。这种规模的计算需求使 AI 研究逐渐向大公司集中,引发公平获取和环境影响的担忧。
"越大越好"的趋势本身也有争议。Kaplan 等人 2020 年提出,模型性能随参数量、数据量、算力按平滑的幂律提升("缩放定律")。
但 2022 年 DeepMind 的 Chinchilla 工作(Hoffmann 等,训练了 400 多个模型)反驳道:在固定算力下,当时多数大模型其实"训练不足"——参数和数据应当同比例增长,经验上每个参数约配 20 个训练 token。按此标准,一个 700 亿参数的模型应训练约 1.4 万亿 token 才算算力最优。这场"把算力花在更大的模型,还是更多的数据上"的辩论,直接重塑了此后大模型的设计取向。
跨域连接
- 线性变换:线性映射的复合仍是线性映射,这条初等事实直接判定了非线性激活的必要性——没有它,任意深的网络都塌缩回单层。通用近似定理补上另一半:单隐层已能逼近任意连续函数,但所需宽度可能指数增长,深度用复合换宽度。推论是表达力从来不是瓶颈,可优化性与样本效率才是。
- 最优化:梯度消失是连乘的量级问题。反向传播把浅层梯度写成逐层雅可比的乘积,只要每项量级稳定小于一,结果就随深度指数衰减,正文提到那个导数上界不足四分之一的激活函数正是重灾区。于是有了统一解释:正区间导数为一的激活、残差通路与归一化,做的都是把这个乘积的量级拉回一附近。
- 卷积神经网络:卷积的归纳偏置可以逐条写出来——局部性、权重共享、平移等变。它们不是普适真理而是关于数据的假设,在自然图像上成立,在没有空间结构的表格数据上不成立。推论因此对称:同等参数量下卷积在图像上远胜全连接,而把它搬到打乱列序也无所谓的数据上,反而更差。
- 神经元:反向传播要求反向通路精确复用前向权重矩阵,而真实突触的前后向连接在物理上分离,没有已知机制维持这种同步。正文提到的反馈对齐说明随机反向权重也能让前向权重逐渐对齐,但在大规模任务上仍明显逊色。这是一条可证伪的预测:若大脑确实做类似的误差传播,就应能找到替代的权重协调机制。
- 知觉生理学:视觉皮层与卷积网络都呈现由局部到整体的层级,但不变性并不相同,对抗样本正是判决性证据:人眼几乎看不见的微小扰动能让分类器从熊猫翻成长臂猿。这说明网络学到的是在训练分布上够用的判别方向,而非人类那种对高频扰动稳健的表征——层级相似并不蕴含鲁棒性相似。
参考文献
- McCulloch, W. & Pitts, W. A Logical Calculus of the Ideas Immanent in Nervous Activity. Bulletin of Mathematical Biophysics 5, 1943.
- Minsky, M. & Papert, S. Perceptrons: An Introduction to Computational Geometry. MIT Press, 1969.
- Rumelhart, D., Hinton, G., & Williams, R. Learning Representations by Back-propagating Errors. Nature 323, 1986.
- Hochreiter, S. Untersuchungen zu dynamischen neuronalen Netzen. Diploma thesis, Technische Universität München, 1991.(梯度消失问题的首次系统分析)
- Krizhevsky, A., Sutskever, I., & Hinton, G. ImageNet Classification with Deep Convolutional Neural Networks. NeurIPS, 2012.
- Szegedy, C. et al. Intriguing Properties of Neural Networks. ICLR, 2014.
- Goodfellow, I., Shlens, J., & Szegedy, C. Explaining and Harnessing Adversarial Examples. ICLR, 2015.
- LeCun, Y., Bengio, Y., & Hinton, G. Deep Learning. Nature 521, 2015.
- Lillicrap, T., Cownden, D., Tweed, D., & Akerman, C. Random Synaptic Feedback Weights Support Error Backpropagation for Deep Learning. Nature Communications 7, 2016.
- Goodfellow, I., Bengio, Y., & Courville, A. Deep Learning. MIT Press, 2016. (免费在线版)
- Kaplan, J. et al. Scaling Laws for Neural Language Models. arXiv:2001.08361, 2020.
- Hoffmann, J. et al. Training Compute-Optimal Large Language Models (Chinchilla). NeurIPS, 2022.
- The Royal Swedish Academy of Sciences. The Nobel Prize in Physics 2024 — John J. Hopfield and Geoffrey E. Hinton. Scientific Background, 2024.
延伸阅读
- Nielsen, M. Neural Networks and Deep Learning. 在线书籍,neuralnetworksanddeeplearning.com, 2015.