2026-08-28·by Sijie Wang#fact#math

mutual-information

互信息(Claude Shannon,1948)

观测一个变量能把你对另一个变量的不确定性降低多少——两者实际共享的信息量。它正是信道容量所要最大化的那个量。

公式: I(X;Y) = sum_{x,y} p(x,y) * log2( p(x,y) / (p(x) p(y)) )

等价地,I(X;Y) = H(X) - H(X|Y)

  • XY ——两个随机变量(例如:发送的消息/接收到的消息)。
  • p(x,y) ——联合概率;p(x)p(y) ——边缘概率。
  • H(X) ——X 的熵;H(X|Y) ——条件熵(看到 Y 之后,关于 X 仍然剩下的不确定性)。
  • I = 0 当且仅当 XY 相互独立;它是对称的:I(X;Y) = I(Y;X)

迁移到"被读到"。 一段内容有没有被读懂,衡量的不是你发出了多少,而是你的意图(X)与读者脑中留下的状态(Y)之间的 I。一篇帖子完全可能熵很高,却几乎传不出任何互信息——密集、新奇,却没有人真正懂了。H(X) - I(X;Y) 这个差值就是歧义损耗(equivocation):读者没能还原出来的那部分。表达的功夫,练的是最大化 I,而不是最大化 H:拿源头上一点新奇感,换解码之后能存活下来的更大收益。当你把一个论断打磨得更锋利,好让读者最终相信的正是你想说的那件事,你就是在提高 I

同类:shannon-entropy · channel-capacity · redundancy · models · being-seen-reliably

about this entry

One of sijie's wiki entries. The AI on this site is grounded in the same corpus and answers in sijie's voice, with citations back to entries like this one — answering costs sijie money, so it waits behind a code: enter an access code →