一个直觉:你按计算器算 sin,机器其实只会加减乘除
在计算器上按下 ,屏幕立刻跳出 。但芯片里并没有一个"正弦零件"——它只会做加、减、乘、除这四样最朴素的运算。超越函数不能直接硬算,必须先改写成芯片认得的四则运算。
它怎么算出正弦的?办法不是把无穷级数一项项加到宇宙尽头,而是两步:先做自变量归约(把角度折进一个小区间,利用 对 的周期与对称),再换成多项式 ,只截前几项。误差用余项控制,小到屏幕显示不出来;、、,机器走的也是同一条路。
这就是泰勒定理在干的事:任何足够光滑的函数,在一点附近都能用多项式逼近,而且每多算一项,误差就小一截。它把"算不动"的超越函数,拆成了计算机唯一会算的加减乘除。1715 年布鲁克·泰勒在《直接与反增量方法》(Methodus Incrementorum Directa et Inversa)里写下这套展开时,当然想不到三百年后全世界的芯片都靠截断多项式加自变量归约来算三角函数。
定理陈述
泰勒定理(Taylor's Theorem)是分析学中用多项式逼近光滑函数的基本定理。它不只给出那串熟悉的系数 ,更重要的是同时给出余项 :逼近停在第 $n$ 项时,误差究竟有多大。没有余项的"泰勒公式"只是一份菜单;有了余项,它才变成可以停手的算法。
设函数 $f$ 在点 $a$ 的某邻域内 $n+1$ 次可微,则对邻域内的任意 $x$:
其中 是余项(误差),有以下几种常见形式。拉格朗日形式最常用,因为它把误差写成再高一阶的导数乘上 ,便于直接估界。
拉格朗日余项:存在 介于 $a$ 和 $x$ 之间使得
积分余项:
皮亚诺余项:(当 )
三种写法回答的问题不同。拉格朗日余项给定量估计,积分余项把误差写成精确积分,皮亚诺余项只说"比 $n$ 次项更高阶"。计算器与数值库用的是截断多项式,不是无穷和:选定 $n$、用拉格朗日余项保证 小于显示精度,再配合自变量归约,就算完了。
直觉理解
泰勒定理说的是:任何光滑函数在局部都可以用多项式逼近。在 $x = a$ 附近,函数 $f(x)$ 的行为主要由它在 $a$ 点的值 $f(a)$ 决定。如果考虑更精细的变化,还需要 $f'(a)$(斜率)、$f''(a)$(弯曲程度)、$f'''(a)$(弯曲的变化率)……每增加一项,逼近就更精确。泰勒多项式是"最佳局部多项式逼近"——在所有 $n$ 次多项式中,泰勒多项式在 $a$ 附近的误差最小。
展开中心取 $a = 0$ 时,同一条公式习惯上叫麦克劳林级数(Maclaurin series)。它不是另一条定理,只是泰勒定理在原点的特例;科林·麦克劳林(Colin Maclaurin)1742 年在《流数论》(A Treatise of Fluxions)里系统使用了这一写法。当 且余项趋于零时,有限的泰勒多项式才升格为泰勒级数。余项若不趋于零,级数写得再整齐,也不等于原来的函数。
证明思路
利用罗尔定理的推广
证明的骨架是反复用罗尔定理,把"函数在两端为零"推进到"某阶导数在中间一点为零"。先定义辅助多项式 ,这里 $t$ 是变量、$x$ 固定。对 $t$ 求导时乘积法则会造出一长串交叉项,但它们两两消去,最后只剩下最高阶:
再造第二条辅助函数 ,其中常数 $M$ 选得恰好使 $g(a) = 0$。因为 ,又有 $g(x) = 0$,于是 $g$ 在 $a$ 与 $x$ 两端都为零。反复应用罗尔定理:$g$ 两端为零则 $g'$ 在中间某点为零,$g'$ 再两端为零则 $g''$ 再有零点,如此推到 。
最终存在 使得 。把 $g$ 的定义代回去,就定出 ,而这正是拉格朗日余项里的那一因子。证明并不构造出函数的"真身",它只说明:只要高阶导数存在,误差就必须长成那一阶的形状。
历史背景
布鲁克·泰勒(Brook Taylor,1685—1731)在 1715 年于伦敦出版《直接与反增量方法》(Methodus Incrementorum Directa et Inversa),把有限差分的增量演算写成正反两套手续,并在其中发表了今天所称的泰勒级数。他当时的语言是增量与流数,不是 -;原始表述给出了展开的形式,却几乎没有严格的收敛性讨论,余项也尚未写成可估界的表达式。
科林·麦克劳林(Colin Maclaurin,1698—1746)在 1742 年的《流数论》里系统讨论了展开中心取在原点的情形。后世把它叫麦克劳林级数,容易让人以为那是另一条定理。它不是:麦克劳林级数就是泰勒定理在 $a = 0$ 时的同一条公式,只是中心选得特别整齐,系数写成 而已。泰勒的书更早十二年,麦克劳林本人也把这一写法追溯到泰勒与斯特灵等人。
真正把"能写下来"变成"能控制误差"的,是十八世纪末到十九世纪初的分析严格化。拉格朗日在 1797 年的《解析函数论》(Théorie des fonctions analytiques)里强调泰勒展开的重要性,并引入了拉格朗日余项——用 $n+1$ 阶导数在某中间点的值给出误差的显式表达式。柯西在 1823 年前后的分析讲义里给出积分余项,并用不等式把收敛写成可检验的命题。泰勒级数的严格理论,是这场运动的重要一环,而不是 1715 年那本书里已经完成的成品。
应用
泰勒定理是数值分析和应用数学的基础工具,因为它把"不会算的函数"换成"会算的多项式",并且告诉你停在哪一项是安全的。函数逼近是最直接的用途:、、 在硬件里都不是查一张无穷表,而是先做自变量归约,再截断泰勒多项式。数值分析里的有限差分、数值积分误差阶,几乎都从余项读出来。
物理学里的小角度近似 ,不过是在 $0$ 处取到一次项;势能在平衡点附近的二次展开,则是取到二阶。优化里的牛顿法用二阶泰勒展开求极值,微分方程的幂级数解法则把未知函数直接写成泰勒级数再比较系数。极限计算中,把函数展开到足够阶数,常常比反复套洛必达更清楚:哪一阶抵消、哪一阶留下,余项自己会说。
与其他定理的关系
泰勒定理不是从天上掉下来的一条孤立公式,它的假设、证明与特例都挂在更早的定理上。取 $n=0$,它就是微分中值定理;积分余项则要靠微积分基本定理才能从导数还原成积分。
- 微积分基本定理:泰勒定理的积分余项形式由 FTC 推导
- 罗尔定理:泰勒定理的证明核心是罗尔定理的反复应用
- 中值定理:泰勒定理取 $n = 0$ 即为微分中值定理
- 幂级数理论:泰勒级数是解析函数理论的基础
- 魏尔斯特拉斯逼近定理:闭区间上的连续函数可以用多项式一致逼近——那是全局逼近,泰勒定理管的是一点附近的局部逼近,两条路并不互相替代
具体示例
指数函数: 在 $a = 0$ 处的所有导数都是 $1$,因此
这个级数对所有实数 $x$ 都收敛——余项里的 $(n+1)!$ 增长快过任何固定的 ,所以 。它是"处处等于自己的泰勒级数"的样板,但不能推广成所有光滑函数的命运。
正弦函数: 在 $a = 0$ 处的导数循环为 ,因此
这同样是处处收敛的级数。计算器求 时仍不会去加无穷项:先把角度归约到 的一个小邻域,再截前几项,用拉格朗日余项保证显示位正确。
小角度近似:(当 $x$ 很小时)——这是泰勒多项式取到一次项($n = 1$)的结果。因为 的二阶导在 $0$ 处为零,余项可精确到三阶:。角度稍大,一次项就不够用,必须把立方项接回来。
对数函数: 在 $a=0$ 处的泰勒多项式是 。与 不同,这一展开只在有限半径内把无穷级数当函数用:复平面里最近的奇点在 $x=-1$,实轴上通常只在 $|x|<1$ 内收敛(端点 $x=1$ 是条件收敛的特例)。半径以外硬把项数加多,近似不会自动变好——有限的泰勒多项式在半径外仍可能局部可用,但无穷级数本身在那里发散。
泰勒级数与解析函数
如果函数 $f$ 在点 $a$ 的某邻域内等于其泰勒级数的和:
则称 $f$ 在 $a$ 处解析。解析函数是泰勒定理的"完美"情形——余项在 时趋于零。并非所有无穷可微函数都是解析的。经典反例:
$f$ 在 $x = 0$ 处无穷可微,且所有导数都是 $0$,但 $f$ 在 时不为零——其泰勒级数恒为零,不等于函数本身。光滑只保证泰勒多项式存在,不保证无穷级数能把函数接回来;解析是更强的条件。这个反例常被用来提醒:把 与解析画等号,是微积分课上最容易留下的误判。泰勒定理给出的是有限阶逼近及其余项,并不自动颁发"无穷级数等于函数"的证书。
多元泰勒定理
泰勒定理可以推广到多元函数。设 在 处 $k+1$ 次可微,则一次项变成梯度、二次项变成 Hessian,更高阶用多重指标打包:
其中 是多重指标, 是混合偏导数。多元泰勒展开在优化理论(牛顿法、拟牛顿法)和物理学(势能展开)中有重要应用:方向 一旦离开展开中心太远,余项同样会反客为主。一次项给出梯度方向上的线性变化,二次型的正定性则决定这一点是谷还是鞍——优化算法读的正是这一截局部几何。
泰勒展开的收敛性
泰勒级数的收敛性是一个微妙的问题,而且首先要分清两件事:有限的泰勒多项式处处有定义,无穷级数才谈得上收敛半径。收敛半径 $R$ 由柯西-阿达马公式给出:
其中 。在收敛圆 $|x - a| < R$ 内,泰勒级数绝对收敛;在收敛圆外发散;在收敛圆上情况复杂——可能收敛也可能发散。这条半径描述的是无穷级数,不是那截拿去算 的有限多项式。
奇点决定收敛半径:复分析中,泰勒级数的收敛半径往往等于展开中心到最近奇点的距离——这是一条很好用的经验法则,严格表述属于复变函数,实轴上的光滑性单独推不出 $R$。例如 在 $x = -1$ 处有奇点,因此在 $x = 0$ 处的泰勒级数收敛半径为 $1$;相比之下 在有限平面没有奇点,级数处处收敛。半径说的是"无穷项能否当作函数",不是"截断多项式能不能用"。
渐近展开:当泰勒级数不收敛时,它仍然可能是有用的渐近展开——截断到有限项可以给出函数的良好近似,即使级数本身发散。物理学中大量使用渐近展开——微扰级数通常是发散的,但截断到几阶后给出极好的近似。这再次提醒:计算器靠的是截断加归约,不是把发散级数硬加到无穷。
泰勒定理在优化中的应用
泰勒定理是优化理论的核心工具。无约束优化中,目标函数 在当前点 的二阶泰勒展开写成下面这一条,一次项是梯度、二次项是 Hessian:
其中 $H$ 是 Hessian 矩阵。牛顿法令展开的梯度为零,得到 ——这是局部最优步长,前提是二次型靠得住。二次型一旦失真,牛顿步就会迈出泰勒展开仍然可信的那一小团。
拟牛顿法(如 BFGS)用低秩更新近似 Hessian,避免了二阶导数的计算。信赖域方法限制步长在泰勒展开可靠的范围内——当展开不够精确时缩小信赖域。泰勒定理还提供了优化算法的收敛性分析工具:通过展开的余项估计算法的收敛速率,一阶方法与二阶方法的快慢差别,往往就写在余项的阶里。
泰勒展开在微分方程中的应用
泰勒定理是微分方程数值解法的基础,因为它把"下一步走多远"的误差写成步长的幂。有限差分、龙格-库塔、幂级数解法,走的都是同一条展开逻辑。
有限差分法:导数的数值近似 由泰勒展开推导,误差为 $O(h)$。高阶方法(如中心差分 ,误差 )也来自泰勒展开:把 $f(x+h)$ 与 $f(x-h)$ 一并写出,偶次项抵消,精度就升一阶。
龙格-库塔方法:经典的四阶龙格-库塔方法通过在每个步长内多次计算斜率组合来匹配泰勒展开到 ——局部截断误差因此是 。阶数不是拍脑袋定的,而是看展开能对到哪一项。
幂级数解法:对于常微分方程,可以直接假设解为幂级数 ,代入方程后比较系数确定 ——这本质上是泰勒展开方法。半径仍然可能有限:系数一旦由方程递推出来,收敛范围要另验,不能默认它像 那样处处收敛。
跨域连接
- 数值方法:差分格式的阶数与余项都是展开的直接产物,中心差分的截断误差随步长平方下降,而舍入误差随步长的倒数上升。推论是:存在一个最优步长,再往小取精度反而变差——这条曲线可以实测出来,不必靠猜。
- 简谐运动:任何势能在极小点附近展开时一阶项为零,二阶项给出线性回复力,于是小振幅下一切振动都是简谐的。推论是:频率只由二阶导数决定、与振幅无关;一旦观察到频率随振幅漂移,就说明三阶及以上的项已不可忽略。摆的周期在大角度下变长,正是这条判据最容易复现的一例。
- 气体定律:真实气体的状态方程按密度展开,理想气体律是零阶项,第一项修正的系数刻画两体相互作用。推论是:低密度下偏离随密度线性增长,所以量这条直线的斜率就能反推分子间作用的强弱,而不必先假定势的形状。
- 理性预期:宏观模型要在稳态附近做一阶展开,才能变成可解析求解的线性系统。推论是:这一步按定义抹掉了非线性,因此对远离稳态的大冲击系统性失效——问题不出在参数估计,而出在展开的有效半径之外。补救办法只能是换全局解法,而不是再多估几个参数。
- 潮汐:潮汐力是引力场在天体尺度上的一阶差分,因而随距离的三次方衰减,而不是平方。推论是:引力弱得多的月球对潮汐的贡献却超过太阳——决定潮汐的是场的梯度而非场本身,这一点可由潮汐的周期直接分辨。
参考文献
- Brook Taylor, Methodus Incrementorum Directa et Inversa (1715).
- Colin Maclaurin, A Treatise of Fluxions (1742).
- Joseph-Louis Lagrange, Théorie des fonctions analytiques (1797).
- Walter Rudin, Principles of Mathematical Analysis (3rd ed., 1976), Chapter 8.
- Tom M. Apostol, Calculus, Vol. 1 (2nd ed., 1967), Chapter 7.
- 陈纪修等, 《数学分析》(第二版), 高等教育出版社, 2004.
- Lars Hörmander, The Analysis of Linear Partial Differential Operators I (1983).
泰勒定理用多项式 在一点附近逼近光滑函数,并给出余项的精确估计。它是数值计算(如计算器求 、)、误差分析与许多物理近似(如小角度近似 )的基础。