漂移即在互不相容的世界之间游荡
诊断:今天的自我进化式"漂移"(drift)主要不是能力不足——而是在互不相容的可能世界之间游荡,因为没有任何世界被钉住,没有一致性关卡(consistency gate)把每一步都约束到那个世界上,也没有溯源(provenance)记录这段世界历史(world-choice-and-consistency-gate)。
把每一条自我进化的抱怨都重新读成"世界游荡"
| 抱怨(Hermes 等) | 用"世界"来说 |
|---|---|
| 自我表扬(总觉得自己做得好) | 事后挑一个讨喜的世界;由于行动之前没有承诺任何世界,每个输出在某个可达的世界里都是"好的" |
| 自动技能覆盖手动版本 | 两个互不相容的世界相撞并互相覆盖,而不是被协调——没有一致性检查 |
| 只能好到反馈信号允许的程度 | 信号正是钉住世界的东西:目标化的度量 → 世界被钉住 → 收敛;模糊的度量 → 世界未钉住 → 游荡 |
| 在模糊任务上退化 | 在互不相容的世界之间随机游走;约束从不一致地累积 → 从不收紧 → 从不收敛 |
| 没有溯源 / 没有不可篡改的日志 | 没有世界历史 → 无法对照过去的承诺做一致性检查,也无法回溯一个走错的世界(round-tree-flight-recorder) |
(唯有成本(元层面 > 工作本身)是正交的。)
反过来印证:GEPA 之所以收敛,正是因为世界被钉住了
GEPA 之所以在客观度量上生效(提升约 20%,rollout 数减少 35 倍),是因为度量钉住了世界("好"是无歧义的 = 只有一个世界);它读取轨迹(trace)时是对照该度量逐步检查——于是一致地累积 → 收敛。Hermes 的漂移和 GEPA 的成功,是"世界是否被钉住"这同一现象的两端。
修复方法 = recursive-harness 的机制
- 在行动之前承诺 / 钉住一个世界(一个固定的标准)← 消灭自我表扬
- 一致性关卡把每一步都约束到已承诺的世界 ← 消灭覆盖与漂移
- 溯源 / 不可篡改的世界历史(可检查、可回溯)← 消灭治理缺口
- 人作为世界的接受者 ← 消灭"只能好到信号允许的程度"
一个诚实的边界:两种漂移模式
- 世界游荡(本笔记讨论的这一种):世界未被钉住 → 游荡。这是结构性的;用上面的机制就能修复,不需要更强的模型。
- 能力漂移:即便在一个已钉住的世界里,模型每一步的
k ≥ 1(只是不够好)——这是 recursion-is-a-phase-transition 的天花板;上面的机制修不了这个。
自我进化的抱怨几乎都属于第一种——是设计不良的循环,而不是原始能力不足。所以目前的漂移大多是"这个循环没有钉住一个世界",而不是"模型太弱"。好消息是:现在就能修。
修订: 这两种漂移模式现在在运行时是可区分的。世界游荡表现为没有钉住参照系的偏差——没有关卡会触发,因为压根没有关卡(gate-deviation-is-observable-delta:没有关卡,δ 就不可见——这正是游荡能保持沉默的原因)。能力漂移表现为在一个已钉住的世界内、跨多轮修复中测得的 k̂ ≥ 1(operationalizing-tolerances)。一个是"没有仪表",另一个是"仪表读到了发散"——第一个的修法是结构性的(加关卡),第二个的修法是经济性的(更小的叶子、更好的反馈可读性,参见 coupling-to-the-learner,或者更多预算)。