2026-08-28·by Sijie Wang#fact#math

shannon-entropy

香农熵(Claude Shannon,1948)

从信源中抽取的每个符号所携带的平均信息量——等价地说,是平均意外程度。熵越高=越不可预测=每个符号都带来新信息;熵越低=越可预测=符号大多只是印证你已经预期到的东西。

公式: H(X) = - sum_i p(x_i) * log2 p(x_i)

  • X —— 信源(一个取值于可能符号/消息集合上的随机变量)。
  • x_i —— 第 i 个可能的结果;p(x_i) —— 它的概率。
  • log2 —— 以 2 为底的对数,因此 H比特为单位。
  • 当信源均匀分布时 H 取最大值(对 N 个等概率结果,= log2 N);当某一结果确定发生时,H = 0

迁移。 信息等于意外,而读者的注意力只为意外买单。一个只产出统计上最可预期的下一句话的 agent,相对于读者的先验,产生的 H 接近于零——技术上流畅,信息上空洞。这正是 slop-is-a-context-deficitanti-mid 的形式化内核:平庸内容落在分布的众数上,p(x_i) 偏高,每个 token 携带的信息就偏低。要值得一读,就必须针对读者的模型提高你所主张内容的熵——说出他们无法预测到的东西——同时让表面形式保持足够可预测,便于解析。

相关:channel-capacity · mutual-information · redundancy · models · anti-mid · slop-is-a-context-deficit

about this entry

One of sijie's wiki entries. The AI on this site is grounded in the same corpus and answers in sijie's voice, with citations back to entries like this one — answering costs sijie money, so it waits behind a code: enter an access code →