一条消息里有多少「意外」
他把信息量定义成意外的平均值:越是没想到的事,说出来越值钱。
1948 年之前,「信息」不是一个能算的量。香农的办法是先问一个更小的问题:收到一个符号,你得到了多少东西?如果那件事本来就必然发生,你什么也没得到;越是出乎意料,得到的越多。于是把一个概率为 p 的符号所带的量定成 log(1/p),再对整个信源取平均,就是熵。取 2 做底,单位叫比特——这个词也是在那篇论文里第一次印出来的,他在脚注里注明是图基建议的。这个定义不是凭空挑的:他先写下三条要求(连续、等概率时随符号数递增、分步选择时可以拆开相加),再证明满足这三条的函数只能是这一个,差一个常数倍。至于为什么叫「熵」,据香农后来对特里布斯的转述,是冯·诺依曼劝的:这个式子在统计力学里已经叫了这个名字,而且「没人真懂熵是什么,争起来你总占上风」。
