跳转到内容
← 返回先驱
人工智能1960–16 分钟阅读

杨·勒坤

Yann LeCun

1989 年,贝尔实验室的一位年轻法国研究员把一张手写数字的灰度图像送入一个神经网络,网络输出了正确的数字识别结果。这不是第一次有人尝试用神经网络识别字符,但这一次的网络有一个根本不同的结构——它利用了图像的空间局部性,用共享权重的小型过滤器扫描整张图像,而不是把图像"拍平"成一维向量。 这种结构叫卷积神经网络(Con…

深度学习卷积神经网络计算机视觉图灵奖

1989 年,贝尔实验室的一位年轻法国研究员把一张手写数字的灰度图像送入一个神经网络,网络输出了正确的数字识别结果。这不是第一次有人尝试用神经网络识别字符,但这一次的网络有一个根本不同的结构——它利用了图像的空间局部性,用共享权重的小型过滤器扫描整张图像,而不是把图像"拍平"成一维向量。

这种结构叫卷积神经网络(Convolutional Neural Network,CNN)。这个名字来自信号处理中的卷积运算。设计它的人叫 Yann LeCun(杨·勒坤),生于 1960 年 7 月 8 日,法国。

破除误解:CNN 不是 LeCun 凭空发明的

卷积神经网络的思想有更早的来源。日本研究者福岛邦彦(Kunihiko Fukushima)在 1980 年提出的 Neocognitron 已包含了层次化局部感受野的核心思想。Geoffrey Hinton 的反向传播算法(1986 年 Rumelhart、Hinton、Williams 联合发表)为训练多层网络提供了可行的学习算法。

LeCun 的贡献在于把这些想法结合并工程化——他把反向传播应用于卷积结构,设计了端到端可训练的 LeNet,并证明它可以在真实数据(手写邮政编码)上可靠地工作。1989 年在贝尔实验室,LeNet 被部署用于美国银行支票的手写数字识别,是神经网络第一次大规模商业部署之一。1996 年起,NCR 等公司把基于 LeNet 的支票读取系统投入银行日常使用,到 2001 年前后每天读取的支票据估计达数千万张量级。

卷积为什么省参数:三个设计决策的账

LeCun 的设计可以拆成三个各自回答一个具体问题的决策,理解了这笔账,就理解了 CNN 的全部精髓:

问题一:参数爆炸。 一张 32×32 的灰度图有 1024 个像素。如果按当时的标准做法把它拍平成一维向量,接一个哪怕只有 100 个单元的全连接层,仅这一层就有约 10 万个参数;叠几层后参数量轻松破百万,而 1990 年代的训练集只有几千张图——参数比样本还多,过拟合不可避免。局部连接的回答是:视觉特征本来就是局部的(一条边、一个角只涉及相邻几个像素),让每个神经元只看一小块输入(如 5×5 的感受野),第一层每个单元立刻从 1024 个输入降到 25 个。

问题二:同一个特征要重复学。 局部连接之后还有一个浪费:左上角的一条竖边和右下角的一条竖边是同一个特征,却让两组参数分别去学。权重共享的回答是:让同一个 5×5 的过滤器扫过整张图像的所有位置,一张特征图只用 25 个参数(加一个偏置)。这等于把"特征在哪里出现不重要"这个先验直接写进结构里——平移等变性不必再从数据中费力学习,省下的样本全部用于学习"特征长什么样"。

问题三:位置精度与不变性的矛盾。 识别"7"需要知道笔画结构,但不该对一两个像素的平移敏感。池化(下采样)的回答是:在每个小区域里只保留最强响应,用牺牲精确位置换取对小位移和形变的容忍,同时逐层扩大有效感受野。

三个决策合起来,LeNet-5 用约 6 万个可训练参数就完成了整个识别系统——比同任务的全连接网络小了几个数量级,也因此能在几千张样本上训练成功。这就是"把领域知识编码为结构约束"相对于"让数据自己学出一切"在样本稀缺时代的决定性优势。

法国学派的平行再发现

反向传播的发明史本身是一段"多点同时发现"的历史。1986 年 Rumelhart、Hinton、Williams 的论文让它广为人知,但 LeCun 在巴黎独立走过了另一条路:1983–84 年做 DEA(硕士阶段)研究时,他就提出了一个训练多层网络的规则;1985 年,他以法语发表了这一算法的早期版本——形式上与反向传播等价,但反向传播的是隐层单元的"虚拟目标值"而非梯度。此后他与合作者(包括其博士导师方面的 Françoise Fogelman-Soulié 团队)将其完善为基于梯度的标准形式。1987 年在巴黎第六大学(Université Pierre et Marie Curie)取得博士学位后,他赴多伦多大学随 Hinton 做博士后,1988 年加入 AT&T 贝尔实验室——这才有了 1989 年开篇那一幕。

这段平行史的意义在于:反向传播不是某一个人的灵光,而是当多层网络的价值被普遍看到时,多个研究者用不同语言(链式法则、最优控制、虚拟目标)殊途同归得到的同一个算法。LeCun 后来多次强调这一点,反对把深度学习叙事简化为个别天才的故事。

现场:LeNet 与黑暗年代的坚守

1998 年,LeCun 发表了 LeNet-5 论文,系统描述了卷积神经网络的完整架构:卷积层(提取局部特征)、池化层(降低分辨率与平移不变性)、全连接层(分类决策)。

这篇论文领先了时代约 15 年。

1990 年代到 2000 年代初,支持向量机(SVM)成为机器学习的主流方法,神经网络被学术界普遍视为"死路"。LeCun、Hinton、Bengio 这三位后来并称"深度学习教父"的研究者,在这段时期都处于学术主流的边缘——他们的研究经费紧张,论文频繁被顶会拒稿,学生被劝告不要选神经网络方向。

LeCun 在这段时期坚持推进无监督学习和能量模型(Energy-Based Models)的研究,并持续倡导卷积结构的优越性。他是少数在 2000 年代仍然坚信大规模神经网络会成功的研究者之一。

转折:2012 年与 ImageNet 革命

2012 年,Hinton 的学生 Alex Krizhevsky 用 GPU 加速训练的深度卷积网络 AlexNet 在 ImageNet 竞赛中以巨大优势胜出,错误率比传统方法低 10 个百分点以上。深度学习的时代正式开始。

这场革命印证了 LeCun 多年前的研究方向。2013 年,Facebook(现 Meta)为争夺人才,聘请 LeCun 出任 AI 研究部门(FAIR,Facebook AI Research)的首任主任。LeCun 同时保留了在纽约大学(NYU)的教职,担任 Silver Professor。

FAIR 在 LeCun 主导下产出了多项有影响力的工作:用于图像分割的 Mask R-CNN(Facebook 工程团队与 FAIR 合作)、用于问答的 DrQA、以及大量关于自监督学习的理论探索。

技术立场与争议

LeCun 是深度学习界最活跃也最具争议的公共知识分子。他在 X(原 Twitter)上的发言经常引发论战。

反对"大语言模型是通向 AGI 之路":LeCun 长期坚持,当前基于自回归文本生成的大语言模型有根本性局限——它们缺乏对世界的因果模型,缺乏持续学习能力,缺乏对物理世界的感知与推理。他认为,真正接近人类智能的路径是世界模型(World Model):系统能预测行动的后果,并用此进行规划。他的 I-JEPA(Image Joint Embedding Predictive Architecture,2023)是这一方向的具体探索。

与 Geoff Hinton 的公开分歧:Hinton 在 2023 年离开 Google,警告 AI 可能对人类存在威胁,呼吁监管。LeCun 多次公开表示不同意,认为当前 AI 系统与人类智能的差距被夸大,AI 安全担忧是"premature"(过早的)。这场分歧在两位图灵奖得主之间展开,是 AI 领域最受关注的学术-公共辩论之一。

2025 年:离开 Meta,押注世界模型

2025 年 11 月,LeCun 宣布将于当年底离开工作 12 年的 Meta(2013 年以 FAIR 创始主任身份加入),创办新公司 AMI Labs(Advanced Machine Intelligence),继续推进他在 FAIR 与 NYU 发展起来的长期研究路线——以 JEPA 架构和世界模型为核心的"高级机器智能",Meta 以合作方身份参与其中。2025 年 12 月的报道显示,该公司正以约 30 亿欧元估值洽谈约 5 亿欧元融资(以报道口径为准,融资进展可能变化)。同年他还获得了伊丽莎白女王工程奖(2025 年,表彰对深度学习的贡献)。

这一选择在行业语境里有明确含义:当大语言模型路线吸走几乎全部资本与人才时,LeCun 用创业这种成本最高的方式,为"自回归文本生成不是通向人类水平智能的路径"这一判断下了注。他的具体技术主张是:智能系统需要学习世界的内部模型,能预测行动的后果并据以规划,而不是在符号序列上做下一个词的概率外推——I-JEPA(2023)及其后续的视频版本正是沿着这条线的尝试。这个判断是对是错,目前没人知道;它可能成为下一个卷积网络,也可能成为又一次领先时代的过早押注。

2018 年图灵奖

2018 年,LeCun 与 Geoff Hinton、Yoshua Bengio 共同获得 ACM 图灵奖,表彰他们对深度学习的奠基性贡献。这是图灵奖历史上第一次同年颁给三位在同一研究方向上长期合作又各有独立贡献的研究者。

代价与争议

工业界与学术界的张力:LeCun 同时担任 Meta AI 高级副总裁和 NYU 教授,有人批评这种双重角色导致他对 Meta 商业利益的潜在偏袒,以及对开源 AI(Meta 的 LLaMA 模型开源策略)的辩护是否真的从公众利益出发。

对 AI 风险的低估争议:许多 AI 安全研究者认为 LeCun 对大规模 AI 风险的低估立场在实质上为过快推进 AI 商业化提供了背书,可能危害公众利益。LeCun 反驳说,夸大 AI 能力和风险同样是一种有害的误导。

世界模型方向的争议:LeCun 近年提出的 I-JEPA 和世界模型框架被部分研究者认为过于依赖预测误差最小化,而对奖励学习和真正的因果推理关注不足。这与他对强化学习(RL)路线的长期怀疑态度有关——他认为 RL 的样本效率太低,不是通向 AGI 的可扩展路径。这场争论目前没有定论,但推动了自监督学习领域的活跃进展。

跨域连接

  • 知觉生理学:视觉皮层里有一类细胞只对特定位置、特定朝向的边缘反应,另一类则对小幅位移容忍。卷积与池化正是这两级的工程化:权重共享让同一个探测器扫过全图,池化换来对小位移的不敏感。要点在于,平移不变性被写进了结构而不必从数据里学——这正是样本有限时它胜过全连接网络的原因。
  • :权重共享的数学内容是对平移群的等变——先平移再卷积,等于先卷积再平移。把已知的对称性写成等变约束,参数量随之下降,泛化随之改善。这条配方还能换对称性再用一遍:换成旋转就得到旋转等变网络,换成节点置换就得到图神经网络。架构设计由此有了可推导的来源。
  • 筛查与早期发现:真实部署的门槛不是平均准确率,而是错误代价的不对称与拒识率能否调节:把阈值推到高精确率、把不确定样本交给人,是自动识别与筛查共用的部署形态。推论对评估很关键——只报单一准确率的系统,无法据以判断能否上线,因为它没告诉你代价怎么分布。
  • 预测加工:预测加工把大脑刻画成不断预测感觉输入、只把预测误差往上传的系统;世界模型是同一想法的工程版——学习目标不是复现数据,而是预测在给定行动下世界会变成什么样。分歧点因此可以说清楚:预测下一个符号不需要区分"我做了什么"与"世界自己变了什么",而规划需要。
  • 梯度下降与反向传播:端到端训练的前提是整条流水线对参数可微,一旦中间有一环不可微——硬阈值、离散选择、采样——梯度就断了,只能换成近似或改用别的学习信号。这条约束解释了深度学习架构的形状:被留下来的模块几乎都是可微的,不是因为它们最好,而是因为别的过不去。

人物小记:风格与个性

LeCun 以直言不讳著称,在学术界和工业界都是有争议的人物。他积极在社交媒体上与反对者辩论,曾与多位 AI 安全研究者正面交锋,也曾为 Meta 的 LLaMA 开源策略公开辩护。他认为,"封闭 AI"(只有大科技公司才能使用的 AI)比"开放 AI"风险更高,因为封闭会集中权力,而开放会分散。

他的法语口音在英语世界的 AI 社区是一个标志性特征,他本人对此调侃自如。他是 NYU Courant 数学研究所的 Silver Professor,一职位既体现了他对数学基础的重视,也反映了他在学术界的长期根基。

FAIR(Meta AI Research)在他主导期间形成了一种独特的研究文化:公开发表大量论文、开源模型和代码,而非像 Google 和 OpenAI 那样把研究成果留作商业竞争优势。这一开放文化来自 LeCun 本人的信念,也影响了整个 AI 开源生态。Meta 在 2023 年开源的 LLaMA 系列模型,在 AI 社区引发了关于开源 AI 利弊的深度讨论。

参考文献

  • LeCun, Y., Boser, B., Denker, J. et al. Backpropagation Applied to Handwritten Zip Code Recognition. Neural Computation 1(4), 1989.
  • LeCun, Y., Bottou, L., Bengio, Y., Haffner, P. Gradient-Based Learning Applied to Document Recognition. Proceedings of the IEEE 86(11), 1998.(LeNet-5 论文)
  • LeCun, Y., Bengio, Y., Hinton, G. Deep Learning. Nature 521, 2015.(三位图灵奖得主合著的深度学习综述)
  • LeCun, Y. A Path Towards Autonomous Machine Intelligence. openreview.net, 2022.(世界模型愿景)
  • Fukushima, K. Neocognitron: A Self-Organizing Neural Network Model for a Mechanism of Pattern Recognition Unaffected by Shift in Position. Biological Cybernetics 36(4), 1980.(CNN 先驱架构)
  • LeCun, Y. Une procédure d'apprentissage pour réseau à seuil asymétrique. Proceedings of Cognitiva 85, Paris, 1985.(反向传播的法国平行版本,法语发表)
  • Lecun, Y. Modeles connexionnistes de l'apprentissage. PhD Thesis, Universite Pierre et Marie Curie, 1987.(LeCun 博士论文,法语)
  • Krizhevsky, A., Sutskever, I., Hinton, G. ImageNet Classification with Deep Convolutional Neural Networks. NeurIPS, 2012.(AlexNet 论文,印证了 LeCun 方向的里程碑)
  • Assran, M. et al. Self-Supervised Learning from Images with a Joint-Embedding Predictive Architecture. CVPR, 2023.(I-JEPA 论文,LeCun 世界模型方向的最新实践)

延伸阅读

  • LeCun, Y., Misra, I. Self-Supervised Learning: The Dark Matter of Intelligence. ai.facebook.com, 2021.