专题 · 8 环 · 5 环的主人不在馆里
人工智能
终点:你正在用的这个对话框
馆里覆盖最差的一条线:十个关键环节只有三个的主人在馆里。它几乎全部由十九世纪的线性代数与概率论、加上二十世纪的最优化拼成,而这些数学被发明时没有一件是为了让机器学会什么。
缩略轴按先后排列,间距不表示年数;实心=馆里有他,空心=还没有。
- 1805
从一堆打架的数据里拟合一条线逼近
最小二乘就是今天说的线性回归,也是所有监督学习的原型:写下一个「错得多少」的函数,然后让它最小。两百年来换的只是函数的形状和参数的个数。
- 1847
顺着最陡的方向往下走最优
他提出梯度法是为了解天文观测里的方程组,整篇短得只有两页。今天训练一个模型,跑的仍是这个办法——只是把「一步走多远」这件事研究了一百七十年。
- 1873
奇异值分解结构
贝尔特拉米1835–1900不在馆里
把一个矩阵拆成三块,中间那块的对角元按大小排好——留下大的、扔掉小的,就是用最少的数字保住最多的信息。主成分分析、潜在语义分析、推荐系统、模型压缩,全是这一条的不同穿法。
- 1906
下一步只取决于这一步不确定
马尔可夫1856–1922不在馆里
他提出马尔可夫链是为了说明大数定律对不独立的随机变量也成立,而他挑的例子是《叶甫盖尼·奥涅金》前两万个字母的元音辅音交替。语音识别的隐马尔可夫模型、网页排序的 PageRank、现代统计的马尔可夫链蒙特卡洛、强化学习的马尔可夫决策过程,全从这里长出来。
- 1933
概率就是测度语言
柯尔莫哥洛夫1903–1987不在馆里
《概率论基础》把概率论架在测度论上,三条公理。在此之前概率是一门有用但说不清自己在讲什么的学问;在此之后它才成为数学的一支,随机过程、滤波、随机微分方程才有地基可站。
- 1950
把「机器能思考吗」换成一个能做的实验边界
图灵1912–1954《「机器能思考吗」——他把问题换掉了》
他认为原来那个问题太没意义,不值得讨论,于是换成模仿游戏。这篇文章里他还预料到了学习机器、遗传算法式的搜索,以及反对意见会从哪几个方向来。
- 1986
反向传播算法
鲁梅尔哈特、辛顿与威廉姆斯使它流行起来的那篇不在馆里
数学上它就是链式法则加上一点动态规划:从最后一层往回推,每一层的梯度都用后一层算好的结果,于是一次反向扫描就拿到全部参数的导数。这一条此前被不同的人各自写出来过好几次(林纳因马 1970、韦伯斯 1974),1986 年那篇的贡献是让它被看见。
- 2017
注意力结构
瓦斯瓦尼等八人《注意力就是你所需要的一切》不在馆里
让序列里每个位置直接与所有位置比较相似度,再按相似度加权求和——本质上是一串矩阵乘法,因此能在显卡上完全并行。今天所有大语言模型的骨架。它用到的数学一件也不新:内积、softmax、矩阵乘法。