专题 · 8 · 5 环的主人不在馆里

人工智能

终点:你正在用的这个对话框

馆里覆盖最差的一条线:十个关键环节只有三个的主人在馆里。它几乎全部由十九世纪的线性代数与概率论、加上二十世纪的最优化拼成,而这些数学被发明时没有一件是为了让机器学会什么。

缩略轴按先后排列,间距不表示年数;实心=馆里有他,空心=还没有。

  1. 1805

    从一堆打架的数据里拟合一条线逼近

    勒让德1752–1833方程比未知数多的时候

    最小二乘就是今天说的线性回归,也是所有监督学习的原型:写下一个「错得多少」的函数,然后让它最小。两百年来换的只是函数的形状和参数的个数。

  2. 1847

    顺着最陡的方向往下走最优

    柯西1789–1857「无限接近」到底有多近

    他提出梯度法是为了解天文观测里的方程组,整篇短得只有两页。今天训练一个模型,跑的仍是这个办法——只是把「一步走多远」这件事研究了一百七十年。

  3. 1873

    奇异值分解结构

    贝尔特拉米1835–1900不在馆里

    把一个矩阵拆成三块,中间那块的对角元按大小排好——留下大的、扔掉小的,就是用最少的数字保住最多的信息。主成分分析、潜在语义分析、推荐系统、模型压缩,全是这一条的不同穿法。

  4. 1906

    下一步只取决于这一步不确定

    马尔可夫1856–1922不在馆里

    他提出马尔可夫链是为了说明大数定律对不独立的随机变量也成立,而他挑的例子是《叶甫盖尼·奥涅金》前两万个字母的元音辅音交替。语音识别的隐马尔可夫模型、网页排序的 PageRank、现代统计的马尔可夫链蒙特卡洛、强化学习的马尔可夫决策过程,全从这里长出来。

  5. 1933

    概率就是测度语言

    柯尔莫哥洛夫1903–1987不在馆里

    《概率论基础》把概率论架在测度论上,三条公理。在此之前概率是一门有用但说不清自己在讲什么的学问;在此之后它才成为数学的一支,随机过程、滤波、随机微分方程才有地基可站。

  6. 1950

    把「机器能思考吗」换成一个能做的实验边界

    图灵1912–1954「机器能思考吗」——他把问题换掉了

    他认为原来那个问题太没意义,不值得讨论,于是换成模仿游戏。这篇文章里他还预料到了学习机器、遗传算法式的搜索,以及反对意见会从哪几个方向来。

  7. 1986

    反向传播算法

    鲁梅尔哈特、辛顿与威廉姆斯使它流行起来的那篇不在馆里

    数学上它就是链式法则加上一点动态规划:从最后一层往回推,每一层的梯度都用后一层算好的结果,于是一次反向扫描就拿到全部参数的导数。这一条此前被不同的人各自写出来过好几次(林纳因马 1970、韦伯斯 1974),1986 年那篇的贡献是让它被看见。

  8. 2017

    注意力结构

    瓦斯瓦尼等八人《注意力就是你所需要的一切》不在馆里

    让序列里每个位置直接与所有位置比较相似度,再按相似度加权求和——本质上是一串矩阵乘法,因此能在显卡上完全并行。今天所有大语言模型的骨架。它用到的数学一件也不新:内积、softmax、矩阵乘法。