Karl Theodor Wilhelm Weierstrass · 1815–1897

魏尔斯特拉斯

他先造出一条处处没有切线的曲线,再把分析里所有含糊的话逐句换成不等式

f(x)=n=0bncos(anπx)f(x) = \sum_{n=0}^{\infty} b^n \cos(a^n \pi x)
1872 · 处处连续,处处没有导数;条件是 0 < b < 1、a 为奇数、ab > 1 + 3π/2

魏尔斯特拉斯 1815 年 10 月 31 日生于威斯特法伦的奥斯滕费尔德,父亲是市长秘书,后来在税务部门供职,一家人因此常常搬家。父亲替他选好了公务员的前程,1834 年把他送进波恩大学学官房学——法律、行政与财政。他在那里击剑、喝酒,四年没有通过一场考试就回了家;他弟弟彼得后来对米塔-列夫勒形容那一幕:卡尔回家时的样子太可怕了,四年,一场考试都没有。1838 年 10 月他转去明斯特学院,只想快点拿一个中学教师资格,却在那里遇上古德曼——当时德国讲椭圆函数最好的人之一,为他一个人开了模函数与解析球面学两门课。1840 年春的资格考试,古德曼出的主题是模函数的展开,评语写着这份答卷让申请人当之无愧地跻身于那些戴着荣冠的发现者之列,还说让他去当中学教师无论对他自己还是对科学都极不合适。这句话魏尔斯特拉斯当时没有看到。此后十三年他在中学教书:德意志克罗内六年、布劳恩斯贝格七年,课表上除了数学还有物理、植物、地理、历史、德语、书法,甚至体操。数学放在夜里做。有一天早晨他没去上课,校长找到他住处,他还坐在灯下。

1854 年,三十九岁的中学教师在《克雷尔杂志》第 47 卷上发表《关于阿贝尔函数的理论》,解开了雅可比反演问题的超椭圆情形。数学界从没听说过这个人。柯尼斯堡当年 3 月 31 日授他名誉博士,雅可比的学生里歇洛亲自到布劳恩斯贝格送证书,说我们都在魏尔斯特拉斯先生这里找到了老师;1856 年他去了柏林,1864 年 7 月 2 日当上正教授,在讲台上一直讲到 1889 年。他一辈子做的事可以收进一句话:把分析从图像里搬出来,搬到不等式上。极限不再是「不断趋近」,而是给出 ε 就要交出 δ;收敛分成了逐点与一致两种,「一致收敛」这个词出自他 1841 年的手稿;实数不再是直觉里的一条线,而是用有理数造出来的东西。而他证明这场清理非做不可的办法,是 1872 年 7 月 18 日在柏林科学院拿出的一条曲线:处处连续,却处处没有切线。他自己发表得极少——他的数学是在课堂上讲出来的,学生的笔记抄本一份份传遍欧洲,康托尔、施瓦茨、米塔-列夫勒、弗罗贝尼乌斯、胡尔维茨、柯瓦列夫斯卡娅都出自这间教室。

魏尔斯特拉斯肖像
照相凹版,摄者不详,1897 年前 · 史密森学会图书馆迪布纳科学技术史图书馆「科学家肖像」收藏(编号 SIL14-W002-02),Wikimedia Commons,公有领域。原件是一张 16 × 12.3 厘米的印本,椭圆晕影的下方另贴着一条他的亲笔签名「Weierstraß」,这里只取上半幅。照片上是他晚年的样子——柏林大学的讲台他站了三十三年,听课的人从欧洲各地赶来,而他四十一岁之前一直在中学教书。

生平

  1. 1815
    生于奥斯滕费尔德

    10 月 31 日,威斯特法伦。父亲是市长秘书,后转入税务部门,一家人随任所搬迁。

  2. 1834
    被父亲送进波恩大学

    学的是官房学:法律、行政、财政。四年里他一场考试都没通过。

  3. 1838
    转入明斯特学院

    10 月。本想快点拿到教师资格,却遇上了古德曼——椭圆函数与幂级数从此成了他一生的题目。

  4. 1840
    教师资格考试

    主题《论模函数的展开》。古德曼的评语说他当之无愧地跻身于戴着荣冠的发现者之列。

  5. 1842
    德意志克罗内的中学

    六年。除数学外还教物理、植物、地理、历史、德语、书法与体操。

  6. 1848
    布劳恩斯贝格

    七年。学校有图书馆,校长鼓励研究,他夜里写论文。1850 年病倒,此后十二年头晕不断。

  7. 1854
    《关于阿贝尔函数的理论》

    《克雷尔杂志》第 47 卷。三十九岁的中学教师一夜成名;3 月 31 日柯尼斯堡授予名誉博士。

  8. 1856
    到柏林

    7 月进皇家工业学院,随后在柏林大学开课,并当选柏林科学院院士。

  9. 1861
    讲课时晕倒

    12 月 16 日。此后一年停课,再往后他坐着讲,由学生在黑板上代写。

  10. 1864
    柏林大学正教授

    7 月 2 日。与库默尔、克罗内克三人把柏林变成了世界各地年轻人来学数学的地方。

  11. 1870
    两件事都发生在这一年

    7 月 14 日在科学院拿出狄利克雷原理的反例;秋天柯瓦列夫斯卡娅来到柏林,大学不准她听课,他私下教了四年。

  12. 1872
    那条没有切线的曲线

    7 月 18 日读于柏林科学院。题目就叫《论一个实变量的连续函数,它对该变量的任何值都不具有确定的微商》。

  13. 1876
    《单值解析函数的理论》

    初等因子与乘积定理:任给一串跑向无穷的点,总有整函数恰好在那里为零。同一篇里还有本性奇点附近的取值定理。

  14. 1885
    七十岁那年的两条定理

    逼近定理:闭区间上的连续函数都能被多项式一致逼近。同年还有林德曼–魏尔斯特拉斯定理。

  15. 1897
    卒于柏林

    2 月 19 日,肺炎。最后三年坐在轮椅上。

展品厅

绝大多数展品都可以亲手把玩——这是本馆的立馆之本;少数以叙述为主的,做成故事展签。

镇馆之宝 · 亲手玩

一条处处没有切线的曲线

横向缩十三倍、纵向放大两倍,画面回到原样——所以哪一点上都安放不下一条切线。

f(x)=n=0bncos(anπx)f(x) = \sum_{n=0}^{\infty} b^n \cos(a^n \pi x)

微积分立起来之后的两百年里,「连续的曲线总该有切线,至多几个尖点上没有」是一句不必证明的话,安培 1806 年还专门写文章想把它证出来。1872 年 7 月 18 日,魏尔斯特拉斯在柏林科学院读了一篇题目极长的报告:《论一个实变量的连续函数,它对该变量的任何值都不具有确定的微商》。开篇第一句是:直到最近,人们还普遍认为一个单值而连续的实变量函数总有一阶导数,它的值只在个别点上才会不定或者变成无穷大。接着他给出反例:f(x) = Σ bⁿcos(aⁿπx),其中 0 < b < 1,a 是奇数,而且 ab > 1 + 3π/2。三个条件各管一件事:b < 1 让级数一致收敛,于是 f 连续;a 是大奇数,让每一层的波纹比上一层密得多;ab > 1 + 3π/2 ≈ 5.712389 让波纹密得比幅度降得快——差商于是每换一档就被放大一次,永远停不下来。这件演示取 b = 1/2、a = 13,乘积 6.5 正好越过他本人那条苛刻的门槛。放大时能看清那台机器:x 方向缩 13 倍、y 方向放大 2 倍,画面回到原样,因为 f(ax) = [f(x) − cos(πx)]/b 是一条恒等式;而同一个点上的差商,步长每缩 13 倍就乘上 6.5(在 x = 0 处逐档算出来是 4.0000、26.3778、171.4846、1114.6522、7245.2398、47094.0586,相邻两档之比 6.5944、6.5011、6.5000、6.5000、6.5000)。这条曲线在当时是丑闻。埃尔米特 1893 年 5 月 20 日写信给斯蒂尔杰斯:我带着恐惧与战栗掉头不看这堆没有导数的连续函数的可悲瘟疫。可它不是怪物而是常态——后来证明,在连续函数的空间里,处处可微的那些反倒是稀罕的例外。类似的例子此前也有:波尔查诺 1830 年代造过一条,手稿迟至二十世纪二十年代才为人所知;魏尔斯特拉斯自己在这篇报告里说,黎曼早在 1861 年就断言 Σ sin(n²x)/n² 处处不可微,而后来查明这条断言并不完全对。

拖放大倍数:x 缩 13 倍、y 放大 2 倍,图形回到原样;右边看同一点上的差商怎么每档乘 6.5

这条曲线是 f(x) = Σ bⁿcos(aⁿπx)。每一项都光滑,加起来却处处没有切线:b 小于 1 保证级数一致收敛,所以 f 连续;a 是大奇数,每一层的波纹比上一层密得多;而 ab 越过 1 + 3π/2 = 5.7124 之后,波纹密得比幅度降得快,差商就再也停不下来。把放大倍数往右拖:x 方向缩 a 倍、y 方向放大 1/b 倍,画面回到原样——这不是眼花,是恒等式 f(ax) = [f(x) − cos(πx)]/b。右栏是同一点上的差商:步长每缩 a 倍,它的幅度就乘上约 ab,b=1/2、a=13 那一档在 x = 0 处是 4.0000、26.3778、171.4846、1114.6522、7245.2398、47094.0586,比值一路 6.50(换个点比值会上下跳,幅度照样一档档涨上去)。第二个预设 b=1/2、a=3 不满足他本人那条苛刻条件,只满足哈代 1916 年放宽后的 ab ≥ 1——曲线看着温和些,可照样没有一处可导。

「一致」两个字是怎么加上去的

柯西 1821 年证过:连续函数之和还连续。阿贝尔举出了反例,而补上的那个词是魏尔斯特拉斯的。

fn(x)Mn,nMn<|f_n(x)| \leq M_n, \quad \sum_n M_n < \infty

柯西 1821 年的《分析教程》里有一条定理:一串连续函数加起来,只要收敛,和也连续。1826 年阿贝尔在二项级数那篇论文的脚注里说这条定理似乎有例外,并给出了一个:Σ (−1)ⁿ⁺¹ sin(nx)/n。每一项都是处处连续的正弦,可这个级数在 (−π, π) 上收敛到 x/2,在 x = π 处却收敛到 0——和函数在那里断开了。错在哪儿?错在当时「收敛」只有一种。级数在每一个点上各自收敛是一回事;所有点一起、用同一个 N 就位是另一回事,后者才叫一致收敛。这件演示把区别摆成一个可读的数:取部分和 S_N,量它与和函数的最大偏差。阿贝尔那条级数,无论 N 取 5、10、20 还是 200,最大偏差都恰好是 π/2 = 1.570796,一分都不往下走:x 从左边走向 π 时,部分和连续地滑向 S_N(π) = 0,而极限那边是 π/2,这道缝谁也合不上。换一条 Σ cos(nx)/n²:每一项的绝对值不超过 1/n²,而 Σ1/n² = 1.644934 收敛,尾部就被 Σ 1/n² 的尾巴一口气按住——N = 5、10、20、50 时最大偏差是 0.181323、0.095166、0.048771、0.019801,与上界 Σ 1/n² 的尾巴一位不差——因为最大偏差正好落在 x = 0 处,那里每个余弦都等于 1,尾部被原样加了起来。这就是以他命名的 M 判别法:拿一列与 x 无关的常数把每一项罩住,只要常数的级数收敛,函数的级数就一致收敛。「一致收敛」这个说法出自他 1841 年的手稿《幂级数论》,而那篇直到 1894 年才印出来;他的老师古德曼 1838 年已经用过意思相近的话。有了这个词,「极限还连不连续」「能不能逐项积分」「能不能逐项求导」才第一次有了准话。

虚线是极限函数,浅色带是它上下各 ε 的「管子」,粗线是取前 N 项的部分和。一致收敛的意思是:给定 ε,存在一个 N,使整条曲线一次性落进管子里。阿贝尔 1826 年那条级数做不到——N 取多少都一样,最大偏差恒等于 π/2 = 1.570796:x 从左边走向断点时部分和连续地滑向 0,而极限那边是 π/2,这道缝谁也合不上。换成「M 判别法」那一档就两样了:每一项被一列与 x 无关的常数 1/n² 罩住,而 Σ1/n² 收敛,于是最大偏差被尾部 Σ M_n 按着往下走——而且这一档的实测与上界一位不差,因为最大偏差正好落在 x = 0 处,那里每个余弦都等于 1。第三档 xⁿ 是最干脆的反例:每个点各自都收敛到 0,可 x = 1 处极限是 1,最大偏差永远是 1。

「取得到」这三个字

有界数列必有收敛的子列,闭区间上的连续函数一定取得到最大值——办法都是对半分下去。

把一个有界数列装进一个区间,对半分开,无穷多项总得落在其中一半里;留下那一半,再对半分。区间长度每次减半,套出唯一一个点,而每一轮都能从里面挑出一项,这些项就组成一个收敛的子列。这就是波尔查诺–魏尔斯特拉斯定理。演示用的数列是 x_n = sin n:有界,不收敛,因为 n 除以 2π 的余数在圆周上均匀分布。按「左半只要还有无穷多项就留左半」的规则对折十二次,挑出来的子列下标是 4、5、11、17、30、36、55、80、99、143、256、300,值一路逼近 −1。同一把锤子还能证另一件事:闭区间上的连续函数一定取得到最大值——对半分,留下上确界较大的那一半,套出来的点上函数值就是最大值。演示里取 f(x) = sin 3x + 0.4 cos 7x 于 [0, 2],对折十六次得到 x = 0.77830505,最大值 0.99044858。这两条今天叫波尔查诺–魏尔斯特拉斯定理与最大值定理(前者波尔查诺 1817 年已经用过,可他的东西几乎没人看见,是魏尔斯特拉斯的课堂让它们变成分析的标准工具)。要紧的是「取得到」这三个字,少一个条件就不成立:同一条曲线放到半开区间上,上确界还在,取到它的那个点却没了。而这正是他 1870 年 7 月 14 日在柏林科学院做的事——狄利克雷原理默认「能量最小的那条曲线存在」,他造出一条泛函,下确界是 0,没有任何一条容许的曲线取到,馆里狄利克雷那件展品讲的就是这一击。存在性从此不能再靠「总该有吧」。

三档用的是同一个动作:把区间对半分,留下「还有东西」的那一半,再对半分。第一档是数列 sin n——有界,不收敛,可每一轮都能从留下的那一半里挑出一项,下标还严格递增,于是挑出了一条收敛到 −1 的子列,这就是波尔查诺–魏尔斯特拉斯定理。第二档换成闭区间上的连续函数,每轮留下上确界较大的那一半,十六次对折之后 x = 0.77830505、最大值 0.99044858:最大值不只是存在,而且被某个点真的取到了。第三档把「连续」这个条件抽掉一点:h 在 x = 1 处掉到 0,区间套照样收向 1,上确界照样是 1,可没有一个点取到它。「取得到」这三个字要靠条件挣来——魏尔斯特拉斯 1870 年 7 月 14 日拆掉狄利克雷原理,拆的正是这一处。

七十岁那年的逼近定理

任何一条连续曲线——哪怕处处没有切线——都是一串多项式的一致极限。

maxaxbf(x)p(x)<ε\max_{a \leq x \leq b} |f(x) - p(x)| < \varepsilon

1885 年,七十岁的魏尔斯特拉斯在柏林科学院发表《论一个实变量的所谓任意函数的解析可表示性》,分两期刊出。结论是:闭区间上的任何连续函数,随便给一个 ε,都有一条多项式与它处处相差不到 ε。这与十三年前那条没有切线的曲线正好凑成一对——连续函数里有的是粗糙到没有一处切线的东西,可它们每一条都能被最光滑的东西一致逼近到任意精度。他自己的证法是先抹平:把 f 与一个高斯核卷积,宽度 k 越小越贴近原函数,而卷出来的东西是整函数,再把它的幂级数截断就得到多项式。抹平这一步的误差可以现算:逼近 |x − 1/2| 时 k = 0.3、0.1、0.03、0.01 的最大误差是 0.167943、0.056418、0.016926、0.005642,与理论值 k/√π = 0.169257、0.056419、0.016926、0.005642 逐位相符(k = 0.3 那一档略小,因为区间外的常数延拓把两端的误差削掉了一点)。演示里还给了伯恩斯坦 1912 年的构造,那是这条定理最出名的另一份证明:B_n f(x) = Σ f(k/n)·C(n,k)·x^k·(1−x)^(n−k),用概率的话说就是「抛 n 次硬币,正面的比例大约是 x,那就取 f(正面比例) 的平均值」。逼近 |x − 1/2| 时最大误差正好落在 x = 1/2,n = 100 时实测 0.039795,与 1/√(2πn) = 0.039894 只差千分之二。慢是真慢,可定理说的是能,不是快:能好到多快是切比雪夫那一支的问题,馆里他那件交错定理讲的正是它。把那条不可微的曲线也放进来逼近,同样成立,只是更慢,而且它的误差根本量不准:误差曲线抖得比任何网格都细,取样越密读数越大——n = 500 时,四百个取样点量到 0.52,两万个量到 0.62,而曲线本身的幅度是正负 2。演示里那一档印的因此是「取样点上的最大误差」,是下界,不是上确界。

粗线是目标函数,细线是逼近它的那条曲线,下面那一条是两者之差。定理说的是:随便给一个 ε,总有一条多项式与目标处处相差不到 ε。魏尔斯特拉斯 1885 年的证法是先抹平——把目标与一个高斯核卷积,核越窄越贴近原函数,而卷出来的东西在整个复平面上解析,截断它的幂级数就是多项式。逼近 |x − 1/2| 时这一步的误差可以对表:k = 0.1 时实测 0.056418,理论值 k/√π = 0.056419。伯恩斯坦 1912 年给的是显式多项式,最大误差落在拐角处,n = 100 时实测 0.039795,与 1/√(2πn) = 0.039894 只差千分之二。第三个按钮换上那条处处没有切线的曲线:它同样是多项式的一致极限,只是慢得多——这正是这条定理与十三年前那条曲线凑成的一对,最粗糙的东西也能被最光滑的东西逼近,而「能好到多快」是另一个问题,馆里切比雪夫那件交错定理讲的就是它。

先挑好零点,再把函数造出来

随便给一串跑向无穷的点,总有一个整函数恰好在那里为零——难处在于直接乘起来会塌掉。

Ep(z)=(1z)exp(z+z22++zpp)E_p(z) = (1-z)\exp\left(z + \frac{z^2}{2} + \cdots + \frac{z^p}{p}\right)

多项式可以按零点写成一串因子的乘积。整函数——在整个复平面上都解析的函数——行不行?1874 年 12 月 16 日,魏尔斯特拉斯在给柯瓦列夫斯卡娅的信里把这个问题写了下来:任给一列 a₁、a₂、……,只要它们的绝对值跑向无穷,是不是总有一个整函数恰好在这些点上为零、别处不为零?1876 年的《单值解析函数的理论》给出了答案:有。难处在于直接把因子乘起来往往不收敛。取零点 1、2、3、……,乘积 ∏(1 − x/n) 的对数约等于 −x 乘调和级数,而调和级数发散,于是乘积一路塌到 0:x = 0.5 时 N 取 10、100、1000、10000,裸乘积是 0.176、0.0564、0.0178、0.00564,正按 1/√N 往下掉,极限处处是 0,一个零点也没留住。他的办法是给每个因子配一个不改变零点位置的指数配重,也就是初等因子 E_p(z) = (1−z)·exp(z + z²/2 + … + z^p/p)。配上之后同一串因子就收敛了:同样那几个 N,乘积是 0.762107、0.753888、0.753044、0.752959,一路收敛到极限 e^(γx)/Γ(1−x) = 0.752950。要几阶配重,取决于零点跑得多快:零点取平方数 1、4、9、…… 时 Σ1/n² 收敛,裸乘积就够用;零点取全体非零整数时按正负配对,两项一乘正好凑成 1 − x²/n²,那就是欧拉 1735 年的正弦积 sin(πx)/(πx)。庞加莱认为这些初等因子是魏尔斯特拉斯对函数论最大的贡献。下游也很硬:阿达马 1893 年把它收紧成有限阶整函数的因子分解,而 1896 年素数定理的两份证明,正是把这一条用在 ζ 函数上——素数的分布最后落在「ζ 的零点摆在哪里」这句话上。

黑点是指定的零点,虚线是把因子直接乘起来的结果,实线是每个因子配上 E_p(z) = (1−z)·exp(z + z²/2 + … + z^p/p) 之后的结果,粗浅线是极限函数。指数配重不改变零点的位置——它在 z = 0 附近把因子拉回 1,好让无穷乘积收敛。第一档零点取 1、2、3、…,Σ1/n 发散,裸乘积按 N 的负 x 次方一路塌向 0:x = 0.5 处取二十万个因子只剩 0.00126,而配重之后稳稳停在 0.752950,正是 e^(γx)/Γ(1−x)。第二档零点取平方数,Σ1/n² 收敛,裸乘积自己就收敛到 sin(π√x)/(π√x),这一档根本用不着配重。第三档把正负零点配成一对,两个配重互相抵消,剩下 1 − x²/n²——那就是欧拉 1735 年的正弦积。要几阶配重取决于零点跑得多快,这套「按需配重」后来被阿达马 1893 年收紧成有限阶整函数的因子分解,而 1896 年素数定理的两份证明,用的正是它在 ζ 函数上的那一版。

他的数学是讲出来的

一个被大学挡在门外的学生、三百多张照片,和一叠被烧掉的信。

1870 年秋,二十岁的索菲娅·柯瓦列夫斯卡娅从海德堡来到柏林。大学连旁听都不允许她——因为她是女性。她去找魏尔斯特拉斯,他先出了几道题试她,都是他给自己讨论班出的难题,她一周之内做完了。此后四年他私下教她:她一周到他家两次,他一周去她那里一次,讲的就是他在大学里正讲的内容,从超椭圆函数一直讲到变分法。1874 年,靠三篇论文——偏微分方程、阿贝尔积分、土星环的形状——哥廷根授予她博士学位,最优等,而她本人没有到场。第一篇里那条存在唯一性定理今天叫柯西–柯瓦列夫斯卡娅定理。她后来在斯德哥尔摩当教授,1888 年拿下巴黎科学院的鲍丹奖,1891 年 2 月 10 日死于肺炎,四十一岁。他给葬礼送去一个白百合花圈,缎带上写着「献给索尼娅,魏尔斯特拉斯」;随后他烧掉了她写给他的所有信,而他写给她的一百六十多封留了下来。另一样东西也留了下来:1885 年他七十岁生日,欧洲各地的学生、朋友与同行凑成一本相册送给他,三百多张肖像照,其中一张是馆里隔壁的切比雪夫。这本相册后来在柏林的一家博物馆里无人过问地躺了七十多年,1994 年才由博林整理出版。两样东西摆在一起,正是他留下的东西该有的样子:他自己写的书不多,七卷《数学著作集》里有一大半是讲义与从未发表的讲稿。他的数学长在别人身上。

故事展签故事展签:他没写多少书。他的数学是讲出来的,是被别人抄下来带走的。

传承

他的工作没有留在十八世纪——每条链的终点,都是你今天正在使用的东西。

1872 年那条处处没有切线的曲线「连续就该可微」不再是常识布朗运动的路径、期权定价里的价格曲线,以及材料科学里的表面粗糙度
把「无限接近」逐句换成不等式ε–δ 与实数的构造今天每一本数学分析的第一章
逐点收敛与一致收敛分家M 判别法与逐项积分、逐项求导的条件傅里叶级数的收敛判据与数值积分里的误差估计
有界数列必有收敛子列存在性要证,不能默认变分法的直接方法与今天的最优化算法
连续函数都能被多项式一致逼近逼近论有了立足的地基数值计算、信号处理与统计学习里的函数逼近
按零点造整函数的初等因子阿达马 1893 年的有限阶因子分解1896 年素数定理的两份证明

语录

直到最近,人们还普遍认为:一个单值而连续的实变量函数,总有一阶导数,它的值只在个别的点上才会不定或者变成无穷大。

—— 《论一个实变量的连续函数,它对该变量的任何值都不具有确定的微商》开篇 · 1872 年 7 月 18 日读于柏林科学院 · 大意。这句话说完,他就把反例写了出来

我越是思考函数论的原理——而我不停地在想——就越是确信:它必须建立在代数真理的地基上。

—— 致施瓦茨的信,1875 年 10 月 3 日 · 大意。同一封信接着说,绕道「超越的」东西是走错了路,哪怕黎曼靠它发现了那么多重要性质

一个数学家如果身上没有一点诗人气质,就绝不会成为完全的数学家。

—— 致柯瓦列夫斯卡娅的信,1883 年 8 月 27 日 · 大意。米塔-列夫勒在 1900 年巴黎国际数学家大会上引用过这句话