香农熵(Claude Shannon,1948)
从信源中抽取的每个符号所携带的平均信息量——等价地说,是平均意外程度。熵越高=越不可预测=每个符号都带来新信息;熵越低=越可预测=符号大多只是印证你已经预期到的东西。
公式: H(X) = - sum_i p(x_i) * log2 p(x_i)
X—— 信源(一个取值于可能符号/消息集合上的随机变量)。x_i—— 第i个可能的结果;p(x_i)—— 它的概率。log2—— 以 2 为底的对数,因此H以比特为单位。- 当信源均匀分布时
H取最大值(对N个等概率结果,= log2 N);当某一结果确定发生时,H = 0。
迁移。 信息等于意外,而读者的注意力只为意外买单。一个只产出统计上最可预期的下一句话的 agent,相对于读者的先验,产生的 H 接近于零——技术上流畅,信息上空洞。这正是 slop-is-a-context-deficit 与 anti-mid 的形式化内核:平庸内容落在分布的众数上,p(x_i) 偏高,每个 token 携带的信息就偏低。要值得一读,就必须针对读者的模型提高你所主张内容的熵——说出他们无法预测到的东西——同时让表面形式保持足够可预测,便于解析。
相关:channel-capacity · mutual-information · redundancy · models · anti-mid · slop-is-a-context-deficit