软相等——让学到的东西得以迁移
Parent: recursive-harness
硬性的 equality 会让学习在一个 agent 里几乎失去价值:在上下文 c 中学到的一条 no-good,只对与之字面上完全相同的上下文成立——而现实中从来没有什么会精确地重演。把相等这个关系软化,正是让学习得以累积复利的关键。
软化:从相等到距离
行为度量 / 互模拟度量(quantitative bisimulation)不再问"相等还是不相等",而是给状态和上下文之间赋一个距离 d(c, c′),并保证距离为 $\varepsilon$ 的两者行为上 $\varepsilon$-相似。恒等被松弛成了几何——这正是别处反复出现的同一个 relaxation 动作,这一次施加在"相等"这个谓词本身上。
收益:知识带着置信度衰减一起迁移
在上下文 c 中学到的一条 no-good、一条 subsumption claim,或一个 price,在 c′ 处依然适用,只是置信度要按 $d(c, c′)$ 打折。coordinator's 的 no-good 存储从精确查找升级为度量检索(最近邻):过去学到的一切,都成为一切足够相似情形的证据。这就是缓存和经验之间的差别。
此外:生成之前先记忆化
SOLVE-or-SPLIT(root-protocol)多出一个更便宜的首选项:RETRIEVE——"我以前是不是解决过一个 $\varepsilon$-相等的叶子?"命中的代价只是一次查找,外加针对当前 spec 的一次重新验证。检索到的结果仍要通过本地 gate——度量只被信任来做检索,绝不被信任来做接受。
陷阱:难点又回到了度量本身
honest-caveats 第 1 条在这里同样全力适用:一个学习出来的嵌入能给出便宜的 d,但容易被 Goodhart、且不透明;机械特征(同一个文件、同一个 API 签名、同一个失败测试指纹)给出的 d 粗糙,却可信。还是那条两层规则:用便宜的度量做检索,只通过 gate 做 ACCEPT——度量负责提议,gate 负责裁决。
把相等软化成距离,no-good 存储就变成了经验——学到的一切都向其邻域辐射、按距离打折,而 gate 依然拥有最终决定权。