互信息(Claude Shannon,1948)
观测一个变量能把你对另一个变量的不确定性降低多少——两者实际共享的信息量。它正是信道容量所要最大化的那个量。
公式: I(X;Y) = sum_{x,y} p(x,y) * log2( p(x,y) / (p(x) p(y)) )
等价地,I(X;Y) = H(X) - H(X|Y)。
X、Y——两个随机变量(例如:发送的消息/接收到的消息)。p(x,y)——联合概率;p(x)、p(y)——边缘概率。H(X)——X的熵;H(X|Y)——条件熵(看到Y之后,关于X仍然剩下的不确定性)。I = 0当且仅当X与Y相互独立;它是对称的:I(X;Y) = I(Y;X)。
迁移到"被读到"。 一段内容有没有被读懂,衡量的不是你发出了多少,而是你的意图(X)与读者脑中留下的状态(Y)之间的 I。一篇帖子完全可能熵很高,却几乎传不出任何互信息——密集、新奇,却没有人真正懂了。H(X) - I(X;Y) 这个差值就是歧义损耗(equivocation):读者没能还原出来的那部分。表达的功夫,练的是最大化 I,而不是最大化 H:拿源头上一点新奇感,换解码之后能存活下来的更大收益。当你把一个论断打磨得更锋利,好让读者最终相信的正是你想说的那件事,你就是在提高 I。
同类:shannon-entropy · channel-capacity · redundancy · models · being-seen-reliably