希普斯定律(Herdan 1960 / Heaps 1978)
随着文本变长,其中不同词汇的数量也会增长——但增长是次线性的。已经写下的内容越多,引入真正全新词汇的概率就越低。词汇量的增长随文本长度呈幂律式减速。
公式: V(n) = K * n^b
n—— 迄今为止的总词元(累计词数)。V(n)—— 词汇量:不同词型的数目。K—— 一个常数(量级为几十,依语料而定)。b—— 指数,0 < b < 1,经验值约为0.4-0.6。- 因为
b < 1,文本长度翻倍时,词汇量的增长远远不到两倍。(希普斯定律是 zipf-law 的共生伙伴:齐夫式的频率分布正是希普斯式增长的成因。)
迁移。 单位产出中的新颖度是产量的递减函数——一个话题下的第十篇帖子所引入的真正新想法,远少于第一篇。对于大规模生成认知内容的 agent 而言,这正是反对"以量取胜"策略的形式化警告:b < 1 意味着边际产出大多是对已经用过的词汇的重新组合,也就是 slop。要让 V(n) 持续攀升,就必须注入新的上下文——新的证据、新的框架、新的经验——而不是在同一套上下文里堆更多词元。独特性不会随篇幅自动获得,它必须有来源。
相关:zipf-law · shannon-entropy · models · slop-is-a-context-deficit · anti-mid