Andrey Nikolaevich Kolmogorov · 1903–1987

柯尔莫哥洛夫

在他之前,概率被当成一门「特殊」的学问;他把它放回数学里——一个事件的概率,就是一个集合的测度。而同一支笔还写下了扩散方程、留得住的轨道,和「这一个串有多少信息」

Pψ{Θ1Θ<Θ2}=14Θ1Θ2cosΘdΘP_\psi\{\Theta_1 \le \Theta < \Theta_2\} = \tfrac{1}{4}\int_{\Theta_1}^{\Theta_2} \lvert \cos\Theta \rvert \, d\Theta
1933 年《概率论基础》第 45 页。球面上均匀取一点,问它落在某条子午圆上时纬度怎么分布——答案不是均匀的,是这条带余弦的密度。波莱尔当年拿它当佯谬;柯尔莫哥洛夫的回答是:对一个概率等于零的孤立假设谈条件概率本来就不允许,要谈,先说清你把整个球面分成了哪一族

安德烈·尼古拉耶维奇·柯尔莫哥洛夫 1903 年 4 月 25 日生于坦波夫。母亲在生他时去世,父亲是个被流放的农学家、没有参与他的抚养,1919 年死于战事;把他带大的是母亲的妹妹薇拉·雅科夫列夫娜,童年在雅罗斯拉夫尔附近的图诺什纳,姓氏随母亲一支。1920 年他进莫斯科大学,同时修数学、冶金与俄国史,还写过一篇认真的论文考十五、十六世纪诺夫哥罗德的地产。让他一举成名的是一个反例:1922 年 6 月,十九岁的他造出一个可和函数,它的傅里叶级数几乎处处发散——在此之前人们普遍以为不会有这种东西。1925 年毕业,同一年他发表了八篇文章,全是本科生时写的,其中与辛钦合写的那一篇是他第一篇概率论文。此后在卢津门下做研究,1929 年取得博士学位,1931 年成为莫斯科大学教授。1929 年夏天,他与亚历山德罗夫一起乘船沿伏尔加河南下、再翻过高加索到亚美尼亚的塞凡湖,走了三个星期;那一路上他做的正是「状态连续、时间也连续」的马尔可夫过程——《数学年刊》编辑部收到那篇稿子的日子印在末页上:1930 年 7 月 26 日。1933 年,柏林的施普林格印出七十几页的《概率论基础》,概率论从此是测度论的一章。

他的题目之广,二十世纪很难找出第二个。1941 年两篇关于湍流的短文立下了那两条相似性假设,今天所说的柯尔莫哥洛夫标度就出自那里,每一个湍流模型仍以它为标尺;1954 年他在阿姆斯特丹的国际数学家大会上讲动力系统,那篇报告后来长成了 KAM 理论;1957 年他与学生阿诺尔德一起解决了希尔伯特第十三问题的连续函数版本;1965 年他提出用「最短程序有多长」来量一个具体对象的信息,那就是今天所说的柯尔莫哥洛夫复杂度。他与亚历山德罗夫 1935 年在莫斯科郊外的科马罗夫卡合买了一所房子,此后几十年多半住在那里。晚年他把很大一部分精力放在中学教育上:编教学大纲、写课本,还亲自给孩子们上课。1939 年当选苏联科学院院士,1962 年得巴尔赞国际奖,1964 年当选英国皇家学会外籍会员,1965 年得列宁奖。1987 年 10 月 20 日卒于莫斯科。本馆此前提到他四次,而这四次里有两次不是正文:两次写在希尔伯特二十三问那张单子的注脚里(第六题「算是交出的一块」、第十三题「1957 年柯尔莫哥洛夫与阿诺尔德证明……」),是别人那张单子上的两格;另外两次一次是影响图谱上的灰点、一次是专题线上的空心点——那是馆里自己记下的「这个人还不在」

柯尔莫哥洛夫肖像
1973 年,他在爱沙尼亚塔林的一次信息论会议上写自己的报告稿 · 特伦斯·L. 费恩摄 · Wikimedia Commons,CC BY 2.5(上传者挂的是三选一的多重许可,这里取不带传染性的那一档;会议名称上传者自陈未必准确)。同一批照片里还有一张是他站在黑板前讲这份稿子,黑板上写着 H_k(x) = min ℓ(M) 与 K(n) ≤ k——那正是本馆第五件展品讲的东西。二十世纪的照片几乎全还压着版权:公有领域里一张能用的都没有,最好的两张一张只有 230 像素宽且是传染性许可,一张是横幅

生平

  1. 1903年4月25日
    生于坦波夫

    母亲在生他时去世,父亲没有参与抚养。姓氏随母亲一支。

  2. 1910 年代
    在图诺什纳长大

    带大他的是母亲的妹妹薇拉·雅科夫列夫娜,地方在雅罗斯拉夫尔附近。

  3. 1920
    进莫斯科大学

    同时修数学、冶金与俄国史,还写过一篇考诺夫哥罗德地产的论文。

  4. 1922年6月
    十九岁的那个反例

    造出一个可和函数,它的傅里叶级数几乎处处发散。此前人们普遍以为不会有这种东西。

  5. 1925
    毕业,一年八篇

    全是本科生时写的。与辛钦合写的那一篇是他第一篇概率论文。此后在卢津门下做研究。

  6. 1929年夏
    伏尔加河上的三个星期

    与亚历山德罗夫乘船南下、再翻高加索到塞凡湖。那一路他做的是状态与时间都连续的马尔可夫过程。同年取得博士学位。

  7. 1930年7月26日
    《数学年刊》收到那篇稿子

    《概率论中的解析方法》,第 104 卷 415–458 页。日期印在末页:「Eingegangen am 26. 7. 1930.」

  8. 1931
    莫斯科大学教授

    此后一直在莫大;1930 年代末莫大一批人进了斯捷克洛夫研究所,他兼掌那里的概率统计部。

  9. 1933
    《概率论基础》

    柏林,Julius Springer,《数学及其边缘领域的成果》第 2 卷第 3 号,七十几页六章。概率论从此是测度论的一章。

  10. 1939
    当选苏联科学院院士

    1941 年获第一批国家奖之一。

  11. 1941
    两篇湍流

    《苏联科学院报告》上的两篇短文,立下了小尺度湍流的相似性假设,今天所说的柯尔莫哥洛夫标度出自那里。

  12. 1954年9月9日
    阿姆斯特丹音乐厅的那一小时

    下午两点半到三点半,闭幕式之前的最后一讲。会程表上写着「应组委会邀请的报告」,主席是斯考滕。

  13. 1957
    希尔伯特第十三问题

    连续函数的版本:任何多元连续函数都拼得出来,材料只用二元的。与学生阿诺尔德一起做的。

  14. 1965
    《关于「信息量」概念的三条路》

    《信息传输问题》第 1 卷第 1 号 3–11 页。组合的、概率的,再加上他新添的算法的那一条。

  15. 晚年
    他去教中学

    编教学大纲、写课本,亲自给孩子们上课,这件事占去他很大一部分精力。

  16. 1987年10月20日
    卒于莫斯科

    同年获罗巴切夫斯基奖。

展品厅

绝大多数展品都可以亲手把玩——这是本馆的立馆之本;少数以叙述为主的,做成故事展签。

镇馆之宝 · 亲手玩

那条圆上的分布,取决于你怎么切整个球

球面上均匀取一点,问「它在这条大圆的哪儿」——这个问题本身没有答案,除非你先说清把球分成了哪一族。

Pψ{Θ1Θ<Θ2}=14Θ1Θ2cosΘdΘP_\psi\{\Theta_1 \le \Theta < \Theta_2\} = \tfrac{1}{4}\int_{\Theta_1}^{\Theta_2} \lvert \cos\Theta \rvert \, d\Theta

1933 年那本书第五章的标题是「条件概率与条件数学期望」,而他在序言里说,全书在行家熟悉的那一圈想法之外的东西有三样,「尤其是第五章」。第 2 节的标题干脆就是「一个波莱尔佯谬的解释」。设置很简单:球面上均匀取一点,取一对对径点作两极,于是每条子午圆由经度唯一确定;他特别提醒,因为经度只从 0 跑到 π、也就是考察的是整条子午圆而不是半圆,所以纬度 Θ 必须从 −π 跑到 +π。波莱尔的问题是:已知点落在某条子午圆上,纬度怎么分布?他写道「容易算出」,答案是四分之一乘以余弦的绝对值——不是均匀的。而如果你坚持认为它应该均匀,就得到一个矛盾。他给的解释是这一件的主句:「这件事说明,对一个孤立给出的、概率等于零的假设谈条件概率,是不允许的:只有当这条子午圆被看作整个球面按给定两极分解成子午圆族中的一个元素时,才能在它上面得到 Θ 的一个概率分布。」演示把这句话的另一半也画了出来:同一条大圆,换一族分解就换一个答案。把它看作子午圆族里的一条,密度是带余弦的(两极处所有子午圆挤成一点,密度在那里是零);把它看作与它平行的那一族圆里的一条,密度就是均匀的。要紧的是这不是「带子太宽」造成的假象——两族的面积元都在横向可分离,所以带子多窄都一样,把带宽拖到最小,两条读数照旧岔开。条件概率从此不再是一个数,而是一个随机变量,而且只对一整族分解才说得清。

换一族分解,看同一条圆上的密度怎么变;再把带宽拖到最小,看读数动不动

球面上均匀取一个点。问「已知它落在这条大圆上,它在圆上哪儿」——这个问题本身没有答案,因为那条圆的概率是零。 波莱尔问的正是这个;柯尔莫哥洛夫 1933 年那本书第五章第 2 节给的答案是:要有答案,先说清你把整个球面分成了哪一族。 把这条圆看作子午圆族里的一条(两极落在它上面),密度是 ¼|cos Θ|——两极那里所有子午圆挤成一点,所以密度在那里是 0; 把它看作平行圆族里的一条(两极垂直于它),密度就是均匀的。 同一个球面、同一个均匀测度、同一条圆,两个答案。 现在这一档 P(|Θ| ≤ π/4) = 0.353553, 换一族分解是 0.250000。 要紧的是这不是「带子太宽」造成的:两族的面积元都在横向可分离, 所以无论 δ 多小,两条密度一分都不变——把滑块拖到底,两条带子缩到同一条圆上, 读数照旧岔开。他的原话是:对一个孤立给出的、概率等于零的假设谈条件概率,是不允许的

链走到连续时间,就成了两条偏微分方程

一条对终点求导,一条对起点求导;他把后向那条叫「第一」,今天的叫法正好反着。

ft=y[Af]+2y2[B2f]\frac{\partial f}{\partial t} = -\frac{\partial}{\partial y}\left[A\,f\right] + \frac{\partial^2}{\partial y^2}\left[B^2 f\right]

馆里马尔可夫那一页讲的是一步一步走的链:状态有限、时间离散。1931 年这一篇把它推到连续时间,而且他在提要里自己把新意写死了:「作者系统地考察了随机确定过程中最简单的情形,首先是那些按时间连续的——方法的本质新意正在于此:至今人们通常把一个随机过程看作一串离散的『事件』。」接下来两句交代了工具:可能状态的集合有限时,过程由常微分方程组刻画;状态由一个或几个连续参数定义时,解析工具就成了抛物型偏微分方程,「拉普拉斯的正态分布作为最自然最简单的情形出现」。那两条方程在原刊上都加了方框。第 447 页的式 (125) 叫「第一基本微分方程」,求导是对起点的时刻与位置;第 450 页的式 (133) 叫「第二基本微分方程」,求导是对终点的。今天前者叫后向方程、后者叫前向方程(也叫福克-普朗克),而且一般先讲前向——值得记一笔的是,在他自己这篇里先推出来、编号在前的是后向那条。演示拿这两条各算一遍同一个数:从给定的起点分布出发,到时刻 T 落进某个区间的概率。前向把整条分布往前推,到点了在那个区间上积分;后向把区间的示性函数往回推,得到「从 x 出发能落进去的概率」,再对起点分布求平均。两条路必须用不同的网格,否则是假对照:同一张网格上这两个差分格式恰好互为转置,差会是机器零,那种「吻合」什么也证明不了。分开之后差是万分之一的量级,而常系数那一档还有正态分布的闭式可以第三方对账。

馆里马尔可夫那一页讲的是一步一步走的链:状态有限、时间离散。 1931 年这一篇把它推到连续时间——他在提要里自己写明, 「方法的本质新意正在于此:至今人们通常把一个随机过程看作一串离散的『事件』」。 状态也连续之后,工具就从矩阵变成了抛物型偏微分方程,而且是两条: 一条对终点求导(今天叫前向,也叫福克-普朗克),一条对起点求导(今天叫后向)。 演示拿它们各算一遍同一个数——从 p₀ 出发,T 时刻落进 E = [0.5, 1.5] 的概率。 前向把整条分布往右推,到点了在 E 上积分;后向把 E 的示性函数往回推, 得到「从 x 出发能落进 E 的概率」这条曲线,再对 p₀ 求平均。 现在前向 0.347333、后向 0.347376,差 4.30e-5,而常系数这一档有闭式可比:0.347346 两条路是故意走不同网格的:同一张网格上这两个差分格式恰好互为转置, 恒等式会被构造出来,差是机器零——那样的「吻合」证明不了方程算对了。 还有一件值得记:在他自己那篇里,先推出来、叫「第一」的是后向那条, 与今天的叫法正好反着。

一整条轨道也能有分布

无穷多个坐标的空间上到底有没有那个测度,是要证的——他证了:有限维的那些分布只要彼此相容,就有,而且唯一。

Cov(Bs,Bt)=min(s,t)\operatorname{Cov}(B_s, B_t) = \min(s, t)

1933 年之前,「随机过程」这四个字指的是一串随机变量:你可以问任意有限个时刻的联合分布,却没法问「这一整条轨道服从什么分布」——因为无穷多个坐标的空间上,一个概率测度存不存在本身就是个问题。他在序言里点名的三件新东西,第一件就是第三章第 4 节「无穷维空间里的概率」。结论是:给一族彼此相容的有限维分布(任取有限个时刻有一个联合分布;少看一个时刻、把它积掉,得到的正是少一个时刻的那一个),就存在唯一一个测度住在整个无穷维乘积空间上,把它们全部实现出来。这一条与上一件互为注脚——1931 年那篇第四章第 16 节的标题正是「巴施里耶的情形」,讲的就是布朗运动那一档;而「布朗运动是一个合法的数学对象」这句话的许可证,就是这里。演示用的是莱维的逐次加细构造:先定两端,再往每个二分点上填一个正态,标准差是那一段长度四分之一的平方根。要看的是相容性——加细只往中间插点,已经定下的点一个也不动,它们的联合分布也一分不变。核这件事不靠抽样:这个构造把每个时刻的值写成一组独立正态的确定线性组合,协方差矩阵是精确算出来的,拿它去对维纳过程本该有的那个 min(s, t),每一层上的最大差都在 10 的负 17 次方量级。图里还有一行值得看:二次变差不随加细掉到零,而是稳稳停在 1——这正是这条轨道处处不可微的那句话,也正是非得用测度论不可的理由。

「随机过程」这四个字在 1933 年之前指的是一串随机变量; 要说「这一整条轨道服从什么分布」,得先证明无穷多个坐标的空间上真有那个测度。 他在序言里点名的三件新东西,第一件就是这个(第三章第 4 节):只要各个有限维分布彼此相容,那个测度就存在,而且唯一。 相容是什么意思,这张图就是:往中间插一个点,已经定下的点一个也不动(铜色的是上一层留下的),而且它们的联合分布一分不变。 右边那一栏是账:拿八个固定时刻 k/8,从第 6 层的系数精确算出协方差矩阵 (莱维构造把每个 B(t) 写成独立正态的确定线性组合,所以这一步不是抽样,是算), 再去对维纳过程本该有的 min(s, t)——现在最大的差是 精确的 0,每一层都是这个数量级。 按「换一条路径」,上面的曲线整个换一条,这三个数一个也不动。 下面还有一行值得看:二次变差 Σ(ΔB)² 不随加细掉到零,而是稳在 1(现在是 0.9196,期望恒为 1、标准差 0.1768)—— 这正是这条轨道处处不可微的那句话,也正是非得用测度论不可的理由。

扰动之后并不是全乱

整个区域除去一块测度小于 ε 的集合,仍然由不变环面铺着——ε 要多小都行,只要扰动够小。

λαpβ=2Wpαpβ0\left|\frac{\partial \lambda_\alpha}{\partial p_\beta}\right| = \left|\frac{\partial^2 W}{\partial p_\alpha \partial p_\beta}\right| \neq 0

1954 年 9 月 9 日下午,他在阿姆斯特丹的国际数学家大会上作了一小时的报告。庞加莱以来,人们知道的是坏消息:三体这样的系统不可积,扰动会把规则的运动搅乱;本馆庞加莱那一页讲的正是这件事。这一篇讲的是同一件事的另一半。可积的那一半很清楚:哈密顿量只依赖动量时,相空间被一族不变环面铺满,每个环面上是带两个频率的条件周期运动,而两个频率随环面变。他要的条件只有一个,写在第 323 页上:频率对动量的雅可比行列式不为零,也就是环面与环面之间频率真的在变。结论那一段是这一件的主句:对任何 ε 大于零,都存在一个 δ,使扰动小于 δ 时,整个区域除去一个测度小于 ε 的集合,仍然由不变的二维环面组成,每个环面上仍是带两个周期的条件周期运动。留得下来的是哪些环面?他在第 321 页写道,由丢番图逼近论知道,那个条件对几乎所有无理数都成立,真正出事的只是被分数「反常地好」地逼近的那一撮。演示把这笔账摆了出来:在每个既约分数两边挖掉一小段,挖掉的总量不超过一个与那小段宽度成正比的数(系数是两个 ζ 值的商),所以宽度趋于零时剩下的测度趋于 1——稠密,却几乎没有分量。左边那幅相图用的是标准映射(不是他的东西,是这类现象最省事的样板):扰动小的时候一条条曲线横贯整幅,那就是环面的截口;扰动大起来先从有理频率那里裂出岛链,最后连频率是黄金分割的那条也断掉。这篇报告后来由他的学生阿诺尔德与莫泽各自补完,三个人的姓氏第一个字母凑成了 KAM。

馆里庞加莱那一页讲的是「差之毫厘,失之千里」——三体问题里,扰动会把规则的运动搅乱。这一件讲的是同一件事的另一半:并不是全乱。1954 年 9 月 9 日下午,他在阿姆斯特丹把结论摆了出来:可积系统的相空间由一族不变环面铺满, 加一个小扰动之后,整个区域除去一个测度小于 ε 的集合,仍然由不变环面组成—— ε 要多小都行,只要扰动够小。左边那幅相图上,K 小的时候一条条曲线横贯整幅, 那就是环面的截口;K 大起来,先从有理频率那里裂出岛链, 到 K ≈ 0.971635 连频率是黄金分割的那条也断了(这个数是格林 1979 年算的)。 留得下来的是哪些?在每个 p/q 两边挖掉半宽 C/q^2.5 的一段,挖掉的总量不超过 2C·ζ(1.5)/ζ(2.5) = 0.038947, 现在实际挖掉 0.037358,剩下 0.962642。 右下那幅把这件事画成了一条线:C 趋于 0 时剩下的测度趋于 1—— 出事的频率虽然稠密,却几乎没有分量。 左下那条轴要看仔细:它只画得出 q ≤ 20 的那些段, 因为 q 再大一点,挖掉的那一段就比一个像素还窄——稠密与有分量,在这条轴上本来就画不到一起。 他自己的说法是:由丢番图逼近论知道,这个条件对几乎所有无理数都成立; 真正出事的只是那些被分数「反常地好」地逼近的。

这一个串有多少信息

香农量的是信源,他量的是这一个对象:能把它印出来的最短程序有多长。代价是这个长度算不出来。

KA(yx)Kφ(yx)+CφK_A(y \mid x) \le K_\varphi(y \mid x) + C_\varphi

1965 年那一篇开头把三条路并排摆出来:组合的(一个有 N 个元素的集合里指定一个,信息量是 log₂N)、概率的(香农的熵),以及他新添的第三条——算法的。定义是:y 相对于 x 的复杂度,就是从 x 得到 y 的最短程序的长度。这个定义显然依赖于「编程方法」,而他那篇的「基本定理」正是为此:存在一个部分递归函数,使得对任何别的编程方法都有「用它得到的复杂度不超过用别的方法得到的加上一个常数」,而那个常数只依赖于两种方法、不依赖于对象。换句话说,换一把尺子只会整体差一个常数,所以这个长度确实是这个对象自己的属性。代价他同页也写明了:一般说来部分递归函数不是处处有定义的,也没有固定办法判断一个程序会不会停,所以这个函数不可能有效地算出来,哪怕已知它处处有限。算不出来,可还是能数。长度不超过 m 的描述一共只有 2 的 m+1 次方减一个,所以能压掉 k 位以上的串占比不到 2 的 1−k 次方——这条上界与用什么压缩办法毫无关系。演示把它和一种具体的办法(原样写/写成周期/写成几段)并排画出来:具体办法离上界还远得很,而更要紧的是,串越长,只能原样写出来的比例越高。他自己在末页的说法是:如果一个很大的集合能用一段与 log₂N 相比可以忽略的程序确定下来,那么它的几乎所有成员的复杂度都接近 log₂N,而这样的元素正是这个集合的「随机」成员。「随机」头一次成了可以说一个具体对象的话。他还在同一篇里提到,莫斯科大学概率论教研室做过猜文学作品下一个字母的试验,得到的上界在 0.9 与 1.4 之间波动——本馆香农那一页第五件讲的正是同一种试验,香农 1951 年给英文估出的是 1 位上下。

馆里香农那两页量的是信源:一个会吐符号的东西,平均每个符号带多少位。 可「这一个串有多少信息」呢?1965 年他给的答案是:看能把它印出来的最短程序有多长。换一种编程方法只会差一个与对象无关的常数 (那是他那篇的「基本定理」),所以这个长度是这个对象自己的属性。 代价是它算不出来——他在同一页写明,这个函数即便处处有限也不是一般递归的。 这里能算的是数数,而数数已经够说出最要紧的那句话: 长度不超过 m 的描述一共只有 2^(m+1) − 1 个,所以能压掉 k 位以上的串占比不到 2^(1−k)——这条上界与用什么压缩办法毫无关系。 图上铜色那条就是它;蓝色那条是另外实现的一种具体办法(原样写/写成周期/写成几段)真做到的, 离上界还远得很。要看的是右边那一栏:n = 1665536 个串里有 65250 个(99.56%)只能原样写出来, 而且 n 越大这个比例越高。他在那篇末尾的说法是:几乎所有成员的复杂度都接近 log₂N,而这样的元素正是这个集合的「随机」成员—— 「随机」头一次成了说一个具体对象的话,不必再提它从哪个概率分布里来。

音乐厅里那一小时,和只剩一个标题的那一篇

同一张一小时报告的名单上,两个 1903 年生的人。一篇长成了 KAM,另一篇在会刊上只有一行字。

1954 年的国际数学家大会在阿姆斯特丹开。会刊里的秘书报告写着,大会总部设在皇家热带研究所,各分会场都在附近,而开幕式与闭幕式在阿姆斯特丹的音乐厅。会程表的最后一页是这样排的:九月九日星期四下午两点半到三点半,音乐厅,范巴尔勒街,主席斯考滕,柯尔莫哥洛夫讲《动力系统的一般理论与经典力学》,底下注明「应组委会邀请的报告」;三点三刻,同一个厅,闭幕式。也就是说,他讲的是闭幕之前的最后一场。报告的第一句话不是数学:「要我在这个大厅里、在大会的闭幕会上作报告,对我来说是件意外的事——这个厅我原先知道的,更多是门格尔贝格指挥演奏世界音乐名作的地方。」第二段他把话接到五十四年前:在那次著名的 1900 年大会上,希尔伯特说过,数学的统一、它不可能分裂成互不相干的枝杈,是由我们这门学问的本性决定的;而最能证明这句话的,是每个阶段都会冒出一些节点,在那里,为了解决很具体的问题,最不相干的几门数学的概念与方法被迫纠缠到一起。他接下来讲的就是这样一个节点:度量与谱的动力系统理论,怎么用到经典力学的保守系统上。那一小时后来长成了 KAM 理论。同一张一小时报告的名单上还有一个 1903 年生的人:约翰·冯·诺依曼,《数学中未解决的问题》,第 348 页。翻到那一页,上面只有三行字——标题、名字,和一句「这次讲演没有留下讲稿」。两个同年生的人,同一届大会,一个的一小时长成了一整门理论,另一个的一小时只剩下一个标题。冯·诺依曼两年五个月之后去世,五十三岁。还有一件事写在同一本会刊的名单上。那一届的一小时报告整整二十场,而代表名单上苏联一共只有四个名字(政府与科学院两栏写的是同样的四个人)——这四个人占了其中三场:亚历山德罗夫讲《近二十年的集合论拓扑学》(第 177 页),尼科尔斯基讲《用多项式逼近函数的若干问题》(第 371 页),柯尔莫哥洛夫讲最后那一场。亚历山德罗夫就是二十五年前与他同船沿伏尔加河南下的那个人——那一路上他做的,正是后来登在《数学年刊》上、本馆第二件展品讲的连续时间的马尔可夫过程。另外,他那一场的篇名在会刊的目录里是这样印的:先是一行俄文的转写,后面括号里才是法文的《动力系统的一般理论与经典力学》——他是用俄语讲的,正文也是俄文排的。

故事展签故事展签:一张会程表、一句开场白,和会刊上那一页只有三行字的讲演。

传承

他的工作没有留在十八世纪——每条链的终点,都是你今天正在使用的东西。

1933:把概率定义成测度、把条件概率定义成相对于一族分解的随机变量条件期望、鞅、随机过程由此都有了统一的说法,整门学问不再是一堆特殊技巧今天每一次统计推断、每一个 A/B 测试、每一个机器学习模型背后写的都是这套语言——概率密度、抽样、置信区间全在里面
1931:把马尔可夫的链推到连续状态与连续时间,给出前向与后向两条抛物型方程扩散过程成了可算的东西;伊藤此后把随机微分方程建立起来,期权定价的方程正是这一条的变形今天的期权、风险计量与金融工程,底下跑的还是这两条方程
1933:有限维分布只要彼此相容,无穷维空间上那个测度就存在——布朗运动从此是合法的数学对象随机微分方程与滤波理论接着立起来,卡尔曼 1960 年把它写成了矩阵形式惯导与卫星定位里的传感器融合、工业上的自动控制与最优控制,用的都是这一支
1954:可积系统加一个小扰动,除去一块测度任意小的集合,不变环面仍然在阿诺尔德与莫泽此后补完,成了 KAM 理论;哪些运动长期留得住,第一次有了判据太阳系的长期稳定性、深空探测的低能转移轨道、粒子加速器里束流能存多久,问的都是这件事
1965:一个对象的信息量,就是能把它印出来的最短程序的长度——换一把尺子只差一个常数算法信息论与最小描述长度原则由此而来;「随机」头一次成了说一个具体对象的话可计算性的边界、压缩算法能到哪儿、一串密钥够不够乱,都要回到这个量上
1941:湍流里能量怎样从大涡一级级传到小涡,他用两条相似性假设定下了小尺度那一段的标度此后每一个湍流模型与大涡模拟都拿它当标尺天气预报、发动机与飞行器的气动、风洞与数值模拟里,它是最先要对上的那条线

他在哪几条专题里

专题是按技术组织的演进线,一条从概念提出拉到今天的器物。这里一个字都没手写, 全是 tracks.ts 推出来的。

语录

对一个孤立给出的、概率等于零的假设谈条件概率,是不允许的:只有当这条子午圆被看作整个球面按给定两极分解成子午圆族中的一个元素时,才能在它上面得到 Θ 的一个概率分布。

—— 1933 年《概率论基础》第五章第 2 节「一个波莱尔佯谬的解释」,第 45 页。据柏林施普林格原刊影像译出

作者系统地考察了随机确定过程中最简单的情形,首先是那些按时间连续的——方法的本质新意正在于此:至今人们通常把一个随机过程看作一串离散的「事件」。

—— 1931 年《概率论中的解析方法》提要,《数学年刊》第 104 卷第 415 页。据 GDZ 所存原刊影像译出

要我在这个大厅里、在大会的闭幕会上作报告,对我来说是件意外的事——这个厅我原先知道的,更多是门格尔贝格指挥演奏世界音乐名作的地方。

—— 1954 年国际数学家大会报告《动力系统的一般理论与经典力学》开场,会刊第一卷第 315 页。同一张一小时报告的名单上,冯·诺依曼那一篇在第 348 页只留下一个标题

一般说来部分递归函数不是处处有定义的,也没有固定的办法判断把程序用到一个对象上会不会有结果。因此这个函数不可能有效地算出来,即便已知它对一切 x 与 y 都是有限的。

—— 1965 年《关于「信息量」概念的三条路》,据 1968 年《国际计算机数学杂志》第 2 卷所载英译(转载自 Problems of Information Transmission)第 165 页译出