跳转到内容
← 返回化学家
生物化学1918–201312 分钟阅读

弗雷德里克·桑格

Frederick Sanger

历史上获得过两次诺贝尔奖的人屈指可数,而在同一个领域——化学——拿过两次的,至今只有一个人:弗雷德里克·桑格。 可这个改变了生物学面貌的人,却出了名地低调。他自称不擅长交际、不善演讲,只想躲在实验室里安静地动手做实验。他后来回忆,自己只是"在实验室里瞎折腾"的那类科学家。正是这种近乎执拗的动手钻研,让他先后破解了两个看…

蛋白质测序DNA测序胰岛素两次诺贝尔化学奖基因组学

历史上获得过两次诺贝尔奖的人屈指可数,而在同一个领域——化学——拿过两次的,至今只有一个人:弗雷德里克·桑格。

可这个改变了生物学面貌的人,却出了名地低调。他自称不擅长交际、不善演讲,只想躲在实验室里安静地动手做实验。他后来回忆,自己只是"在实验室里瞎折腾"的那类科学家。正是这种近乎执拗的动手钻研,让他先后破解了两个看似不可能的难题:先读出蛋白质的"字母顺序",再读出 DNA 的"字母顺序"。

破除误解:他读出的不是"一种蛋白质长什么样",而是"序列本身有意义"

在桑格之前,人们大致知道蛋白质由 20 种氨基酸串成,但普遍以为这些氨基酸的排列大概是随机或没有固定次序的。

桑格证明了一件革命性的事:每一种蛋白质都有一个唯一、精确、固定的氨基酸序列——不多一个、不少一个、顺序丝毫不乱。

他在 1940 年代末选了胰岛素下手——这种由班廷与贝斯特在三十年前分离、用于治疗糖尿病的激素。经过近十年艰苦工作,到 1955 年他完整测出了胰岛素的 51 个氨基酸排列顺序(分布在 A、B 两条肽链上),这是人类第一次读出一个蛋白质完整的"序列"。他还搞清了两条肽链之间是靠二硫键连接的——这正是 dorothy-hodgkin 后来用 X 射线晶体学解出胰岛素三维结构时所依据的化学骨架。

这个突破的深远之处在于:它告诉世界,蛋白质的功能写在它精确的序列里。"序列决定结构、结构决定功能"这条现代分子生物学的中心信条,由此奠基。1958 年,桑格因此获得他的第一个诺贝尔化学奖。

第二座高峰:读出生命的源代码

测完蛋白质,桑格把目光投向了更根本的东西——DNA。如果蛋白质是产品,DNA 就是写着如何制造产品的图纸。能不能把图纸上的字母(A、T、C、G)一个个读出来?

经过多年探索,到 1977 年,桑格和同事发展出双脱氧链终止法(即"桑格测序法")——一种快速、准确读取长段 DNA 序列的方法。它的巧思在于:故意掺入一些会"卡住"DNA 合成的特殊字母,让链在不同位置随机终止,再按长度排开,就能逐位读出序列。

凭此,1980 年桑格获得他的第二个诺贝尔化学奖,与 Walter Gilbert、Paul Berg 分享。

桑格测序法此后统治了 DNA 测序近三十年,正是它最终读出了完整的人类基因组——2003 年宣告完成的人类基因组计划,其主力技术就建立在桑格的方法之上。可以说,今天整个基因组学、精准医疗的大厦,地基是他打下的。

数字:十年读 51 个字母,三十年后读出 30 亿个

桑格两次得奖,中间隔了二十二年。把两次工作的"读取速度"摆在一起,才看得出这中间发生了什么量级的变化。

第一次:51 个氨基酸,用了大约十年。 胰岛素由两条链组成,A 链 21 个残基、B 链 30 个残基,合计 51 个。桑格与图皮(Hans Tuppy)在 1951 年先攻下 B 链的 30 个残基,A 链的 21 个到 1952 年才完成——A 链更难,因为它内部还有一个链内二硫键在捣乱。完整结构(含二硫键连接方式)到 1955 年才定下来。平均下来,大约每年读出五个氨基酸。

他靠的工具组合非常具体。核心试剂是 FDNB(1-氟-2,4-二硝基苯,后来直接被叫作"桑格试剂"):它会与肽链游离的 N 端氨基反应,接上一个二硝基苯基。妙处在于这个基团是亮黄色的——被标记的那一端从此在层析纸上肉眼可见。

流程是:用 FDNB 标住 N 端 → 把肽链部分水解成一堆长短不一的片段 → 用当时刚由 Gordon、Martin 与 Synge 引入的分配层析把片段分开 → 完全水解带黄色标记的那个片段,看它释放出哪一个二硝基苯基氨基酸,从而确定该片段的头一个残基 → 换不同的水解条件,得到另一批互相重叠的片段 → 靠重叠部分把顺序拼回去。

这是一件纯粹的手工推理活儿:没有仪器读出序列,序列是从上百个片段的重叠关系里推出来的。

第二次:1977 年的双脱氧链终止法。 这一次读的是 DNA,而且方法可自动化:

方法单次可读长度通量每 1000 个碱基的成本
手工蛋白测序(1950s)约 51 个残基/十年
桑格 DNA 测序(1977 起)500–800 bp,准确率常 > 99.99%一次几十到几百个反应约 500 美元(2011 年前后)
次代测序(2005 起)每条读段 50–400 bp单次运行数亿条读段不到 0.5 美元

注意中间那一栏的取舍:桑格法读得长、准,但一次只能读几十上百个片段;次代测序每条读得又短又稍差,却能同时读几亿条。 人类基因组计划靠的是前者的读长与准确度,此后的大规模测序靠的是后者的通量——两种技术不是替代关系,而是分工。

而最值得记住的一点是:桑格两次突破用的其实是同一个想法。

蛋白测序时,他让肽链在随机位置断开,得到一堆长度不同的片段,再靠长度与重叠关系还原顺序。DNA 测序时,他让新链在随机位置停下(掺入的双脱氧核苷酸缺少 3′-OH,无法再接下一个),得到一堆彼此只差一个碱基的嵌套片段,按长度排开,序列就直接从这把"梯子"上读出来。

"制造受控的随机中断,再按长度排序"——同一个方法论用了两次,各得一次诺贝尔奖。 这也是为什么桑格常被称为"方法学家"而不是理论家:他改变生物学的方式,是让原本读不出来的东西变得可读。

争议与时代:荣誉之外的诚实

桑格的故事里少有戏剧性的争斗,更多是科学本身的曲折。

  • "序列"观念的接受:在他证明蛋白质有确定序列之前,学界对此并无共识;他用胰岛素这一个铁证,扭转了整个领域的认识。
  • 测序方法的竞争:1980 年的诺奖之所以与 Gilbert 分享,是因为 Maxam 与 Gilbert 同期(1977)发展了另一套化学降解测序法——用二甲基硫酸酯、肼等试剂对特定碱基做部分化学修饰,再在修饰位点切断骨架。两套方法一度并存,但化学法依赖的这些试剂毒性大、步骤难以自动化;桑格法只需一套酶反应加四种双脱氧核苷酸,很快被做成了自动测序仪。"最聪明的方法"未必赢,能被机器重复几百万次的方法往往笑到最后。
  • 拒绝封爵:桑格婉拒了爵位,理由是不想被人称作"Sir"。他始终把自己定位为一个普通的实验工作者。

为纪念他,英国设立了桑格研究所(Wellcome Sanger Institute),它在人类基因组计划中承担了最大份额的测序工作——这个名字,成了基因组时代的一个坐标。

跨域连接

  • 蛋白质化学:在他之前,蛋白质常被当作组成不定的统计性聚合物。他用二硝基氟苯标记末端残基、再分段水解拼接,测出胰岛素的确定序列——反复测定给出同一答案,本身就是判决性证据:若蛋白质真是随机混合物,每次结果都该不同。蛋白质由此成为可精确书写的信息分子。
  • 序列比对:序列一旦成为离散字符串,"两条序列有多像"就变成可计算的问题,动态规划的全局与局部比对算法随之出现。但比对分数里嵌着一套替换代价与空位罚分,也就是嵌着一个进化模型——换一套打分矩阵,"最优"比对就会换一个。算法输出的精确程度,受限于假设的合理程度。
  • 分子系统发育:序列让分类摆脱了形态依赖。同源基因间的差异数可当作分歧时间的代理量,亲缘关系于是从相似度判断变成统计推断——这正是核糖体 RNA 测序把古菌从"细菌"里分出来的原因:它们在显微镜下与细菌无异,序列却讲了另一个故事。
  • 古 DNA:古代样本中的 DNA 断成几十碱基的短片段并带特征性脱氨损伤,桑格法的长读长在这里派不上用场,必须靠高通量短读长测序加严格的污染控制。结果是人群迁徙这类过去只能从陶器与语言推测的问题,如今由基因组直接裁定——历史学的证据等级被一门化学方法改写了。
  • 临床基因组学:测序成本崩塌后,罕见病诊断在技术上已接近查表。真正的瓶颈转移到了解释:每个人携带数以百万计的变异,其中绝大多数落在"意义未明"一栏,因为判定致病性需要功能实验或大样本关联,而这两者都不会随测序一起变便宜。读取能力的增长速度,超过了解读能力。

参考文献

  • Sanger, F. & Tuppy, H. "The amino-acid sequence in the phenylalanyl chain of insulin." Biochemical Journal, 49(4), 1951. DOI: 10.1042/bj0490463(胰岛素测序原始论文
  • Sanger, F., Nicklen, S. & Coulson, A. R. "DNA sequencing with chain-terminating inhibitors." Proceedings of the National Academy of Sciences, 74(12), 1977. DOI: 10.1073/pnas.74.12.5463(桑格测序法原始论文
  • Ryle, A. P., Sanger, F., Smith, L. F. & Kitai, R. "The disulphide bonds of insulin." Biochemical Journal, 60, 1955.
  • Maxam, A. M. & Gilbert, W. "A new method for sequencing DNA." Proceedings of the National Academy of Sciences, 74(2), 1977. DOI: 10.1073/pnas.74.2.560
  • Shendure, J. & Ji, H. "Next-generation DNA sequencing." Nature Biotechnology, 26, 2008. DOI: 10.1038/nbt1486
  • García-Sancho, M. Biology, Computing, and the History of Molecular Sequencing, Palgrave Macmillan, 2012.

延伸阅读

  • The Royal Swedish Academy of Sciences. "The Nobel Prize in Chemistry 1958 & 1980 — Frederick Sanger." Nobel Foundation.
  • Brownlee, G. G. Fred Sanger – Double Nobel Laureate: A Biography, Cambridge University Press, 2014.