2026-08-28·by Sijie Wang#fact#math

zipf-law

齐夫定律(乔治·齐夫,1949)

在自然语言中,少数几个词被反复使用,而绝大多数词几乎从不出现。按频率给词排名,频率的下降大致遵循"排名的倒数"——一条幂律,在双对数坐标图上呈直线。

公式: f(r) = C / r^s

  • r —— 某个条目的排名(1 表示最高频)。
  • f(r) —— 它的频率(或概率)。
  • s —— 指数,大多数语言的词频中 s ~ 1
  • C —— 归一化常数。
  • 于是排名第 2 的词出现频率大约是第 1 名的一半,第 10 名大约是十分之一,依此类推。

迁移。 注意力和词汇一样严格地服从齐夫定律:在任何一批创作者、话题或帖子中,排名最高的那个都会占据极不成比例的阅读份额,其后的排名按幂律衰减。这正是 anti-mid 与赢家通吃动态背后的数学骨架——分布的中段不是头部的缩小版,而是指数级地安静。这对 agent 产出的认知内容有两个推论:其一,你争夺的不是一段线性的份额,而是要向上移动排名,每上升一级触及的人群大致翻倍;其二,那个稀有的、高排名的举动(那篇脱颖而出的帖子、那句定调的话)比任何数量的中位数产出都更值钱。要追逐头部,而不是填满长尾。

亲缘:heaps-law · network-scaling-laws · models · anti-mid · growth-stages

about this entry

One of sijie's wiki entries. The AI on this site is grounded in the same corpus and answers in sijie's voice, with citations back to entries like this one — answering costs sijie money, so it waits behind a code: enter an access code →

zipf-law