drift-is-world-wandering

漂移即在互不相容的世界之间游荡

上级:recursive-harness

诊断:今天的自我进化式"漂移"(drift)主要不是能力不足——而是在互不相容的可能世界之间游荡,因为没有任何世界被钉住,没有一致性关卡(consistency gate)把每一步都约束到那个世界上,也没有溯源(provenance)记录这段世界历史(world-choice-and-consistency-gate)。

把每一条自我进化的抱怨都重新读成"世界游荡"

抱怨(Hermes 等)用"世界"来说
自我表扬(总觉得自己做得好)事后挑一个讨喜的世界;由于行动之前没有承诺任何世界,每个输出在某个可达的世界里都是"好的"
自动技能覆盖手动版本两个互不相容的世界相撞并互相覆盖,而不是被协调——没有一致性检查
只能好到反馈信号允许的程度信号正是钉住世界的东西:目标化的度量 → 世界被钉住 → 收敛;模糊的度量 → 世界未钉住 → 游荡
在模糊任务上退化在互不相容的世界之间随机游走;约束从不一致地累积 → 从不收紧 → 从不收敛
没有溯源 / 没有不可篡改的日志没有世界历史 → 无法对照过去的承诺做一致性检查,也无法回溯一个走错的世界(round-tree-flight-recorder

(唯有成本(元层面 > 工作本身)是正交的。)

反过来印证:GEPA 之所以收敛,正是因为世界被钉住了

GEPA 之所以在客观度量上生效(提升约 20%,rollout 数减少 35 倍),是因为度量钉住了世界("好"是无歧义的 = 只有一个世界);它读取轨迹(trace)时是对照该度量逐步检查——于是一致地累积 → 收敛。Hermes 的漂移和 GEPA 的成功,是"世界是否被钉住"这同一现象的两端。

修复方法 = recursive-harness 的机制

  1. 在行动之前承诺 / 钉住一个世界(一个固定的标准)← 消灭自我表扬
  2. 一致性关卡把每一步都约束到已承诺的世界 ← 消灭覆盖与漂移
  3. 溯源 / 不可篡改的世界历史(可检查、可回溯)← 消灭治理缺口
  4. 人作为世界的接受者 ← 消灭"只能好到信号允许的程度"

一个诚实的边界:两种漂移模式

  • 世界游荡(本笔记讨论的这一种):世界未被钉住 → 游荡。这是结构性的;用上面的机制就能修复,不需要更强的模型。
  • 能力漂移:即便在一个已钉住的世界里,模型每一步的 k ≥ 1(只是不够好)——这是 recursion-is-a-phase-transition 的天花板;上面的机制修不了这个。

自我进化的抱怨几乎都属于第一种——是设计不良的循环,而不是原始能力不足。所以目前的漂移大多是"这个循环没有钉住一个世界",而不是"模型太弱"。好消息是:现在就能修。

修订: 这两种漂移模式现在在运行时是可区分的。世界游荡表现为没有钉住参照系的偏差——没有关卡会触发,因为压根没有关卡(gate-deviation-is-observable-delta:没有关卡,δ 就不可见——这正是游荡能保持沉默的原因)。能力漂移表现为在一个已钉住的世界内、跨多轮修复中测得的 k̂ ≥ 1operationalizing-tolerances)。一个是"没有仪表",另一个是"仪表读到了发散"——第一个的修法是结构性的(加关卡),第二个的修法是经济性的(更小的叶子、更好的反馈可读性,参见 coupling-to-the-learner,或者更多预算)。