stages-gates-bound-the-search

阶段与门控让(不可靠、无限的)搜索得以收敛

上级:recursive-harness

两半终于焊接在一起:stages-and-gates 这个宏观结构不是又一层——它是让那个不可靠、无限分支的 MCTS 搜索(non-determinism-and-infinite-branching)得以收敛的脚手架。

两层结构

  • 微观(阶段内部): 在该阶段的世界空间上做 MCTS + 软约束(采样、软 no-good、满意即止),受 P×C 约束。
  • 宏观(阶段与门控): 任务被切分为若干阶段;阶段之间坐落着门控。

门控 = 软的、随机的搜索被落定为硬的、经过验证的结果之处(重新落地)

在一个阶段内部,搜索是不可靠的(LLM-as-theory-solver 会出错;no-good 只是软的信念)。在门控处:

门控是一个验证型检查点,它把该阶段积累起来的软信念坍缩为一个(尽可能机械地)经过核验的硬承诺。

  • 通过门控 = 落定(commit)该阶段(一个稳定的子装配体,simon-ando);软的不确定性在此重新落地
  • 下一个阶段建立在这个经过验证的硬结果之上,而不是把上一阶段的软不确定性带下去。

所以门控就是那个软→硬转换器。 没有门控,整个任务就是一场漫长的 MCTS,不断累积不可靠的不确定性 → 误差复合 → 漂移(正是 necessitypⁿ,只不过这里复合的是搜索本身的不可靠误差)。

为什么这就是让一个本不收敛的搜索得以收敛的东西

门控做了三件促成收敛的事:

  1. 限定视界 — 每个阶段都是一次搜索;短搜索能满意即止/收敛,长搜索不能。
  2. 重新落地(止住复合) — 每个门控都把积累的软不确定性坍缩为一个硬事实 → 不可靠的误差不会跨阶段复合。这就是 necessity 的检查点机制,应用到搜索本身的不可靠误差上。
  3. 限定 no-good / 回跳的作用域 — 回跳只发生在当前阶段内部;一个已通过的门控会封存之前的阶段(已验证),所以回跳是有界的。(重新打开一个已落定的阶段是可能的,但代价高昂/需要显式触发——理应罕见。)

设计原则(由这次焊接所强制)

把门控放在可机械验证的"完成"点上(可写的接缝处);门控之间跑软的 MCTS;门控把软转换为硬。

  • 更多/更机械化的门控 → 软搜索被更频繁地重新落地 → 收敛性更强;
  • 更少/只有语义性的门控 → 软不确定性跨阶段复合 → 漂移。

这把几条接缝统一了起来:stage-anatomy(门控 = 可验证的完成)+ tacit-spec-as-spec-compression(可写的/隐性的)+ non-determinism-and-infinite-branching(软/硬)——其实是同一件事:门控就放在你能机械地重新落地软搜索的地方。

× 八个控制手段(control-methods)—— 全部八个

结果发现,一个收敛的递归 harness 用到了全部八个控制手段——一个都不能少,横跨事前/事中/事后/内部:

  • #1 脚本(script) — 阶段骨架(把守恒的结构写成脚本,把易变的执行留出自由);
  • #2 门控(gate) — 门控本身(软→硬的验证性坍缩)——核心;
  • #3 授信(credentialing)先验证再落定:一条软的 no-good/信念必须先自证(多采样/对抗式核验),才能被提升为硬约束(non-determinism-and-infinite-branching);同样,一个候选方法在被采纳前也必须具备资质/适用。(与门控的区别:门控验证的是一个阶段的输出;授信验证的是一条习得的规则或一个方法的资质。)
  • #4 计量(metering)P×C 作为预算(视界界限 + 演绎搜索预算 + 满意即止);
  • #5 隔离(isolation)试探性分支必须在副作用受限的环境中运行(沙箱/事务/快照),这样回溯才是可逆的;效果只在门控处(落定时)才被释放到现实中。没有它,不可逆的副作用会使回溯变得不可能。
  • #6 审计(audit) — no-good 存储 / 坍缩历史 / 冲突分析(负面的、事实性的记录);
  • #7 选择(selection) — 阶段内部的 MCTS(采样多个世界,探索+评估);
  • #8 激励塑形(incentive-shaping) — 在一个欠定的选择点上,agent 记录下补充性的偏好信息,使得 当前信息 + 补充信息 → 唯一确定的选择。任务本身并没有强制这个选择(残余的 );注入一种打破僵局的倾向性就是塑形,并被记录下来以保证下游的一致性(world-choice-and-consistency-gate 中"品味 = 选定一个世界")。

完备性 + 诊断

一个收敛的递归 harness 是这八个控制手段的完整组合——这证明这八项不是一份松散的清单,而是一个封闭的、最小完备的集合。这就给出了一个故障诊断法:一个漂移/卡住的 harness,缺的正是某一项控制——没有隔离 → 不可逆的副作用使回溯失效;没有授信 → 未经核验的软 no-good 会错误地剪掉真实的世界;没有塑形 → 残余的 永远无法收敛到一个选择;没有审计 → 反复兜圈(漂移);等等。每一种失败模式都对应着缺失的那一项控制。

审计与塑形的对偶(为什么两者都需要才能收敛到唯一的世界)

记录控制手段作用
no-good(哪些组合是不相容的——负面的)#6 审计删除不一致的世界
补充性偏好(自由时该偏好什么——正面的)#8 激励塑形把剩余的自由钉死为一个

用形式化的语言说(□/◇):约束加坍缩把已确定的部分逼入 残余的 (真正自由的部分)是约束钉不住的地方——而激励塑形正是钉住它的东西。仅靠坍缩只能收敛到一致集合(仍然是许多个世界);要收敛到单一世界,还需要塑形。

两点说明:(a) 一个收敛的 harness 是一个组合,不是单一一项控制。(b) 它的重心落在事后/内部这一半(选择+深度审计+塑形)——正是 StandMeet 之前薄弱的那一半(eight-controls-applied)。这台机器,就是把控制手段中"让它变得更好"的那一半,改造成了一个收敛引擎,由脚本+门控+计量搭起脚手架。

重访——放到理论层之下看

  • "门控 = 软→硬转换器"现在有了 gate-theory:硬承诺是围绕可靠(1−α)成功路径的一个必经点所划出的一个 δ-邻域——这个转换从来就不是转换到一个,而两种容差都被计入了 P×C。
  • "门控越机械化,收敛越强"被量化了:机械化门控的 α ≈ 0,其修复回路由残差比 监控(operationalizing-tolerances);"更频繁地重新落地" = 更短的分段 = 收缩过程要吞掉的误差更少(inexact-contraction)。
  • "回跳被封存在阶段内部"有两处细化gate-subsumption 让一个已通过的门控能在机械保持不变的分段之间代替下游检查(当 A + 未变的支持已经覆盖 B 时,跳过 B);而"重新打开一个已落定的阶段——可能但代价高昂,理应罕见"现在成了一个被明确指定的事件:它恰好发生在一个 不可行性剪枝 从下方传来的时候。

完整堆栈,一句话

宏观: stages-and-gates = 一个以 P×C 为良基(well-founded)的脚手架;门控 = 一次软→硬的验证性坍缩。微观: 在每个阶段的自由区内,LLM-as-policy 的 MCTS + 软约束。门控的"这个阶段完成了" = 该阶段搜索的 P×C 停止条件 = 同一个阈值。没有这套脚手架,不可靠+无限的 MCTS 不会收敛;stages-and-gates 把它切成一段段被门控封存的短搜索,其不可靠误差无法跨阶段复合——这就是它得以收敛的原因。