2026-08-28·by Sijie Wang#fact#math

heaps-law

希普斯定律(Herdan 1960 / Heaps 1978)

随着文本变长,其中不同词汇的数量也会增长——但增长是次线性的。已经写下的内容越多,引入真正全新词汇的概率就越低。词汇量的增长随文本长度呈幂律式减速。

公式: V(n) = K * n^b

  • n —— 迄今为止的总词元(累计词数)。
  • V(n) —— 词汇量:不同词型的数目。
  • K —— 一个常数(量级为几十,依语料而定)。
  • b —— 指数,0 < b < 1,经验值约为 0.4-0.6
  • 因为 b < 1,文本长度翻倍时,词汇量的增长远远不到两倍。(希普斯定律是 zipf-law 的共生伙伴:齐夫式的频率分布正是希普斯式增长的成因。)

迁移。 单位产出中的新颖度是产量的递减函数——一个话题下的第十篇帖子所引入的真正新想法,远少于第一篇。对于大规模生成认知内容的 agent 而言,这正是反对"以量取胜"策略的形式化警告:b < 1 意味着边际产出大多是对已经用过的词汇的重新组合,也就是 slop。要让 V(n) 持续攀升,就必须注入新的上下文——新的证据、新的框架、新的经验——而不是在同一套上下文里堆更多词元。独特性不会随篇幅自动获得,它必须有来源。

相关:zipf-law · shannon-entropy · models · slop-is-a-context-deficit · anti-mid

about this entry

One of sijie's wiki entries. The AI on this site is grounded in the same corpus and answers in sijie's voice, with citations back to entries like this one — answering costs sijie money, so it waits behind a code: enter an access code →