跳转到内容
← 返回先驱
当代先驱1947–16 分钟阅读

杰弗里·辛顿

Geoffrey Hinton

2024 年 10 月,瑞典皇家科学院宣布将当年的诺贝尔物理学奖授予杰弗里·辛顿(Geoffrey Hinton)和约翰·霍普菲尔德(John Hopfield),表彰他们"通过人工神经网络实现机器学习的基础性发现与发明"。一位计算机科学家获得物理学奖,本身就说明了这件事的不寻常:他们的工作跨越了物理学与计算机科学的边…

深度学习反向传播神经网络玻尔兹曼机人工智能安全

2024 年 10 月,瑞典皇家科学院宣布将当年的诺贝尔物理学奖授予杰弗里·辛顿(Geoffrey Hinton)和约翰·霍普菲尔德(John Hopfield),表彰他们"通过人工神经网络实现机器学习的基础性发现与发明"。一位计算机科学家获得物理学奖,本身就说明了这件事的不寻常:他们的工作跨越了物理学与计算机科学的边界,而评委会认为这是物理思想在新领域的延伸。

这一年,辛顿已经离开谷歌一年多,公开表达对人工智能安全的深切忧虑。他曾花了五十年推动一个领域走到台前,然后开始对它的未来发出警告。

破除误解:反向传播不是他发明的,但他让它真正工作

"反向传播之父"是辛顿常见的标签,但更准确的表述是:他是让反向传播在深度网络上实际有效的关键推动者之一。

反向传播算法(backpropagation,计算多层神经网络中梯度的链式法则应用)的思想由多人独立发现,最重要的早期工作包括:Seppo Linnainmaa(1970 年代,自动微分)、Paul Werbos(1974 年博士论文),以及 1986 年 Rumelhart、Hinton、Williams 合著的那篇《通过反向传播误差来学习表示》(Learning Representations by Back-propagating Errors),使这一算法在心理学与人工智能社区广为人知并被实践证明有效。

辛顿的贡献在于:在深度网络被大多数人认为"无法训练"的年代,他坚持推进,并找到了使训练变得可能的关键技术。

现场:被主流遗弃的信徒

杰弗里·埃弗里斯特·辛顿 1947 年 12 月 6 日生于英国伦敦,祖先中有乔治·布尔(布尔代数的创立者,计算机逻辑基础)。他在剑桥大学读实验心理学,随后在爱丁堡大学取得人工智能博士学位(1978 年)。

1970 到 1980 年代,神经网络研究极不流行。主流 AI 研究是符号主义:把知识表达为逻辑规则,让计算机进行符号推理。联结主义(神经网络是这个阵营的核心方法)被认为效果太差、理论基础太弱,难以获得资助。

辛顿在这段时期辗转于多所大学,始终坚持神经网络研究。1987 年他加入多伦多大学,此后数十年在那里建立了自己的研究团队,并在 2012 年之后看到了一切发生翻转。

核心一:玻尔兹曼机(1983–1985)

1983 到 1985 年间,辛顿与 Terry Sejnowski 共同开发了玻尔兹曼机(Boltzmann Machine):一种受统计物理启发的随机神经网络,节点以概率方式激活,通过最小化系统"能量"来学习数据的概率分布。

这是使用统计物理方法分析神经网络的早期系统性尝试,也是 2024 年诺贝尔物理学奖评委会引用的核心贡献之一。它的直接后代包括受限玻尔兹曼机(RBM),以及后来深度学习时代的逐层预训练方法。

核心二:反向传播的复兴(1986)

1986 年,Rumelhart、Hinton 与 Williams 在 Nature 发表了那篇引用次数极高的论文。文章用清晰的语言证明:多层神经网络可以用反向传播算法有效地学习内部表示(internal representations),而这些表示能捕捉到训练数据中的结构性规律。

这篇文章没有立刻点燃神经网络复兴——那需要等到 2000 年代末更大规模的数据和计算力到来——但它确立了反向传播在深度网络上的理论正当性,并将辛顿推向了该领域的中心。

核心三:2012 年的翻转——AlexNet

2012 年,辛顿的博士生 Alex Krizhevsky 和 Ilya Sutskever,在辛顿的指导下,在 ImageNet 大规模视觉识别挑战赛(ILSVRC)上提交了 AlexNet——一个深度卷积神经网络,借助 GPU 并行计算实现训练。AlexNet 以压倒性的优势(错误率比第二名低约 10 个百分点)赢得了比赛,彻底改变了计算机视觉乃至整个人工智能领域的方向。

这之后,深度学习迅速成为主流,辛顿等人坚守了三十年的阵地突然成了最热门的地方。2013 年 3 月,辛顿与两位学生组建的公司 DNNresearch 被谷歌以约 4400 万美元收购(这个数字源自 2013 年的多个新闻报道,但具体细节有出入,应以公开财务记录为准)。

奖项:图灵奖与诺贝尔奖

  • 2018 年 ACM 图灵奖:与约书亚·本吉奥(Yoshua Bengio)和扬·勒丘恩(Yann LeCun)共同获得,表彰深度神经网络的概念与工程突破。三人并称深度学习的"三巨头"(three godfathers)。
  • 2024 年诺贝尔物理学奖:与约翰·霍普菲尔德共同获得,表彰使用统计物理方法推动机器学习的奠基性工作。

离开谷歌与 AI 安全警告

2023 年 5 月,辛顿宣布从谷歌退休,随即公开表达对人工智能安全的忧虑。他的主要担忧包括:大型语言模型可能已经发展出某种人类不完全理解的内部"推理"能力;AI 系统可能被用于大规模信息操纵;长期来看,超越人类智能的系统对人类的控制构成根本挑战。

他承认,他在推动深度学习数十年后,如今对自己推动的东西感到忧虑——这种公开的自我质疑,在科学界并不常见。

批评者指出,辛顿的一些警告缺乏具体的技术论据,带有"存在主义 AI 风险"社群的思维方式,而该社群的预测在历史上多次被证明过于悲观或时间框架严重错误。支持者则认为,来自该领域最资深人物的公开担忧,本身就是推动监管讨论的重要信号。

生平年表

年份事件
194712 月 6 日生于英国伦敦,祖先中有布尔代数创立者乔治·布尔
1970剑桥大学实验心理学学士
1978爱丁堡大学人工智能博士(研究神经网络,当时极不流行)
1982加入卡内基梅隆大学(CMU)计算机科学系
1983开始与 Sejnowski 合作开发玻尔兹曼机
1986与 Rumelhart、Williams 在 Nature 发表反向传播论文
1987加入多伦多大学,此后长期在此建设研究团队
1992与 Radford Neal 合作,开发用于神经网络的蒙特卡洛方法
2006在 Science 发表深度信念网络逐层预训练方法
2012AlexNet 在 ImageNet 竞赛中以压倒性优势获胜
2013加入 Google(Google 收购其研究组)
2018与 Bengio、LeCun 共同获得 ACM 图灵奖
20235 月:从 Google 退休,公开表达 AI 安全忧虑
2024与 Hopfield 共同获得诺贝尔物理学奖

反向传播的理论地位:仍有未解之谜

反向传播在工程上是深度学习的支柱,但其理论性质仍有许多不清楚的地方:

为什么梯度下降能找到好的解:深度网络的损失函数面(loss landscape)是一个极高维度的非凸空间,按照经典优化理论,随机梯度下降应该极容易陷入局部最优。但实践中,即使网络有数十亿参数,训练往往能找到表现极好的解。这为什么成立,目前没有令人满意的完整理论。Choromanska et al.(2015)等研究提出了若干解释,但没有一个被普遍接受。

泛化之谜:理论上,参数数量远超训练样本数量的神经网络应该严重过拟合。但现实中"过参数化"(over-parameterized)的网络往往泛化性极好,这违反了经典统计学习理论的预测。"双下降"(double descent)现象(Belkin et al., 2019)表明,模型复杂度与测试误差之间的关系,不是经典理论预测的 U 形曲线,而是更复杂的非单调关系。

这些理论缺口,是理论机器学习领域当前最活跃的研究问题之一。辛顿自己也承认,我们目前在很大程度上是在凭经验使用深度学习,真正的理论理解远远滞后于工程实践。

深度学习寒冬中的坚守

理解辛顿的成就,必须理解他所处的逆境。神经网络研究在 1970 年代之后经历了两次"AI 寒冬"——资助枯竭、主流研究者转向符号主义。

辛顿在第一次寒冬(1970 年代末–1980 年代初)选择坚守联结主义,主要原因之一是他对认知科学的理论承诺:他真的相信大脑的学习机制是分布式权重调整,而不是符号规则推理。这不只是一个技术选择,更是一个关于心智本质的哲学立场。

第二次寒冬(1990 年代初)到来时,许多与他合作的研究者转向支持向量机(SVM)等方法——当时后者在多数基准测试上优于浅层神经网络。辛顿没有放弃,但也承认:没有足够的数据和算力,深度网络确实无法超越更简单的方法。他等待的,是数据和算力的规模跨越临界点。

2006 年,他在 Science 发表"深度信念网络"的预训练方法,为后来的深度学习复兴打开了门——但真正的爆发要等到 2012 年的 AlexNet 和 GPU 加速训练。

辛顿与深度学习三巨头

辛顿、本吉奥(Yoshua Bengio)和勒丘恩(Yann LeCun)共同获得了 2018 年图灵奖,被称为深度学习的"三巨头"(three godfathers),但三人的研究风格和关注点有明显差异:

  • 辛顿:更关注神经网络的生物学合理性和无监督学习,晚年转向胶囊网络(Capsule Networks)和离开谷歌后的认知模型研究。
  • 本吉奥:在序列建模(早期 RNN、词向量 word2vec 的前驱工作)和生成模型(GAN 的理论分析)方面贡献突出,同时是 AI 伦理的积极倡导者。
  • 勒丘恩:卷积神经网络(CNN)的核心开发者(LeNet,1989),在 Meta 担任首席 AI 科学家,对"AI 存在风险"的叙事持更为怀疑的态度,与辛顿公开产生分歧。

三人对 AI 安全风险的判断存在显著差异,这些差异反映了深度学习研究社区内部真实存在的认识分歧。

跨域连接

  • 伊辛模型:玻尔兹曼机把网络状态的概率写成能量的指数形式,学习于是变成调节耦合权重、让模型的统计量与数据对齐——这套框架整个借自相互作用自旋系统。借来的还有它的困难:配分函数难算,训练必须依赖采样,而采样受混合时间限制。这条限制正是这类模型难以放大的根源。
  • 神经可塑性:分布式表示的核心主张是概念不驻留在单个单元里,而在激活模式中。这条主张有可检验的后果:损伤应表现为渐进降级与相似性混淆,而不是词条被随机删除。他坚持联结主义并非只出于工程直觉,而是押在一个关于大脑如何存放知识的经验判断上。
  • 统计学:经典学习理论把泛化误差与模型容量挂钩,预测过参数化必然过拟合;实测曲线却不是那条 U 形。这说明"容量"这个变量选错了——起作用的是优化过程偏好哪一类解,而不是解空间有多大。推论可直接检验:模型与数据完全不变,只换优化器或初始化,泛化就会变。
  • AI 治理与监控:他的警告依赖一个经验判断——能力增长快过理解速度,因此监管必须在证据齐备之前动手。这与预防原则结构相同,也继承了它的老毛病:在缺乏可证伪预测时,门槛该定在哪里没有依据。所以对双方都该提同一个要求:说出什么样的观察会让你改变看法。
  • 蒙特卡洛方法:玻尔兹曼机的梯度里含有一项对模型分布的期望,只能用马尔可夫链近似。链混合得慢,梯度估计就带偏,训练看起来在动其实没学到东西——统计物理的技术难点在这里原样变成了机器学习的工程瓶颈。后来的对比散度等做法,都是在这条约束上做妥协。

Transformer 与注意力机制:辛顿之后的深度学习

辛顿的工作奠定了深度学习的基础,但深度学习最近一轮的爆发式发展,主要依赖于他实验室之外的架构创新:

注意力机制(Attention Mechanism,2014–2015):由 Bahdanau 等人在机器翻译中提出,让模型能够在生成输出时动态聚焦于输入序列的不同部分,突破了早期序列到序列(seq2seq)模型对固定大小上下文向量的限制。

Transformer(2017):Google Brain 团队的"Attention is All You Need"论文完全放弃了循环结构(RNN/LSTM),只用注意力机制处理序列,实现了可并行训练,大幅提升了规模化效率。GPT、BERT 以及后来的所有大型语言模型,都基于 Transformer 架构。

辛顿本人对 Transformer 的态度颇为复杂:他认为 Transformer 在工程上高度成功,但对其"是否在做真正的推理"持怀疑——这也是他近年研究方向(如 Forward-Forward 算法,作为反向传播的替代,2022 年提出)背后的动机:他认为生物神经网络不可能使用反向传播,真正的智能可能需要不同的学习原理。

辛顿的"幡然醒悟":如何理解他的转变

辛顿在离开谷歌后的公开言论,常被媒体描述为"AI 教父后悔了",但这种表述过于简化。

他的转变有几个层次: - 技术层面:他承认,现代大型语言模型的能力超出了他此前的预期,并认为这些系统可能已经发展出某种形式的"推理能力"(尽管他自己对此措辞谨慎)。 - 风险层面:他对 AI 被用于信息操纵、自动化决策中的偏见放大,以及长期的"超对齐"(superintelligence alignment)问题表示担忧。 - 自我反思:他承认曾相信欧洲和北美会负责任地引领 AI 发展,而中国会跟随——他认为这个假设现在值得重新审视。

但他也明确表示,他不后悔做了这些研究,因为如果有影响深远的技术要被发明出来,他宁愿这件事发生在尽可能考虑安全性的研究者手中。这不是悔恨,而是一种带着不安的责任感。

参考文献

  • Rumelhart, D. E., Hinton, G. E., & Williams, R. J. Learning Representations by Back-propagating Errors. Nature 323 (1986): 533–536.
  • Hinton, G. E. & Sejnowski, T. J. Learning and Relearning in Boltzmann Machines. In Parallel Distributed Processing, Vol. 1. MIT Press (1986).
  • Krizhevsky, A., Sutskever, I., & Hinton, G. E. ImageNet Classification with Deep Convolutional Neural Networks. NeurIPS (2012). (AlexNet 论文)
  • Nobel Prize 2024 Physics citation: nobelprize.org/prizes/physics/2024/hinton/facts/
  • ACM Turing Award 2018: awards.acm.org