两万个字母,八千六百三十八个元音
他把《叶甫盖尼·奥涅金》的开头拆成元音和辅音两种符号,数了两万个——为的是证明一件与诗毫无关系的事。
1913 年 1 月 23 日在物理数学部宣读,刊于《帝国科学院消息》第六辑第七卷第三号 153–162 页。第一句就把范围划死了:「本研究涉及普希金小说《叶甫盖尼·奥涅金》中的一段两万个俄文字母的序列,不计 ъ 和 ь,它占满第一章全部与第二章十六节。」办法在第 154 页:每一百个字母保持原次序排成十行十列,数每一列里有几个元音,再把第 1 与第 6 列、第 2 与第 7 列……两两并起来——这样同一批字母就有了两种分组,一种是原文里挨着的,一种是被拆散重排的。结果印成四十张表,每张六行六列,整整一页。数出来:元音 8638、辅音 11362,于是一个字母是元音的概率 p = 0.432。真正要紧的是下一步。他又数了一遍连着的两个元音,得 1104 对;余下的两个数他没有再硬数,而是推出来的——元音后面跟辅音的有 8638 − 1104 = 7534 处,而「除第一个以外,每个辅音前面不是元音就是辅音」,所以辅音跟辅音的是 11361 − 7534 = 3827 处。由此 p₁ = 1104/8638 = 0.128,p₀ = 7534/11361 = 0.663,两者之差 δ = −0.535。要是字母之间各不相干,这两个数本该相等。最后他把整件事压成一个数:二百个百字块的元音数散得有多开。独立时这个「离散系数」该是 1,他算出来是 5114/24537.6 ≈ 0.208,约五分之一;按他自己 1907 年那篇里简单链的公式该是 (1+δ)/(1−δ) = 465/1535 ≈ 0.3,按 1911 年那篇里二阶链的公式算出 0.195——「这样的吻合,再要求更好就过分了」,他在第 160 页这么写。本馆照他自己交代的规则,从 1837 年版原文重数了一遍,抓到三件他没有写出来的事。一、他把 Й 算成了元音:全文一处也没交代这个字母归哪一档,而按俄语语法它是辅音;可按「Й 是辅音」重数,元音只有 8212、连着的两个元音只有 621,与他的数差得离谱;按「Й 是元音」重数,得 8620 与 1104——连着的两个元音逐字相同,p 与 p₁ 也对到小数点后三位。二、原刊第 155 页第十六张表末行第二项印错了:印作 41,应作 44。三条互相独立的判据:那张表第二列的五个数 9+8+10+9+8 = 44;那张表五个行和 50+38+47+43+38 = 216,而表角印着 16(即 216 − 200);订正之后二百块相加恰好是 8638,与他正文给的总元音数分毫不差,而照印本原样相加只有 8635。三、他手数的准头:第一个百字块起逐字对上,此后每块偶有正负一的出入、且相邻两块一增一减(那是块边界错开一两个字母的特征),而累计到第 199 块只差 2 个元音。顺带记一处二手文献的算错:海斯 2013 年那篇广为流传的介绍写「余下的 15069 对是一元音一辅音」,而两万个字母只有 19999 个相邻对,19999 − 1104 − 3827 = 15068,正是他自己那两个 7534 相加。
拨到任何一个百字块,看那一百个字母怎么排成十行十列;右边那根数轴上,离散系数从「各不相干时的 1」一路掉到他实测的 0.208
这一块 42 个元音,他手数的是 42(照原文重数也是这个数)。他一共数出 8638 个元音、11362 个辅音, 于是一个字母是元音的概率 p = 0.432。真正要紧的是下一步:连着的两个元音只有 1104 对。 要是字母之间各不相干,两万个字母里该有 0.432² × 19999 ≈ 3731 对——多出三倍还不止。 换成条件概率说:前一个是元音时,这一个还是元音的概率只有 0.128; 前一个是辅音时,却有 0.663。两者差 0.535。 他把这件事压成一个数:离散系数。二百个百字块的元音数要是彼此独立, 这个数该是 1;他算出来是 0.208,约五分之一。 而按他自己 1907 年与 1911 年两篇里的链的公式,简单链给出 0.3、二阶链给出 0.195—— 「这样的吻合,再要求更好就过分了」,他在第 160 页这么写。
