operationalizing-tolerances

把 ε、α、k 操作化——实践中的旋钮

父节点:recursive-harness

gate-theorysafe-recursion-theorem 都系在三个看起来无法测量的希腊字母上。把它们拉回地面的那一步是:你手上从来没有那个抽象度量——你有的是可执行检查,而每一个理论量都变成了检查上的计数器

δ(容差)= 可执行验收组合的严格程度

你从来不会在某个抽象度量下去测量"到航点的距离"。gate 本身就是一组可执行检查的组合——测试、类型检查、lint、不变量断言、数值容差。"落在 δ 邻域内" ⟺ 所有检查都通过。δ 就是这组检查的严格程度:检查越多、越严,δ 就越小。每一项检查都是一个单边的 certificate——失败能证明你确实在邻域之外;通过只能证明"落在球内",从不证明完美。可调的旋钮是每个阶段的验收标准(stage-anatomy);收紧它会让每个 gate 消耗更多 P×C。

α(置信度)= gate 实测的假通过率

α 不是选出来的,而是测出来的:用已知有问题的产物去校准 gate。这其实就是变异测试(mutation testing):往产物里植入已知的 bug,数一数 gate 能抓住几个,漏掉的比例就是 α 的估计值。分两档:机械式 gate(编译器、类型检查器、确定性测试)的 α ≈ 0——这里的置信度是免费的;语义式 gate(LLM 作裁判、人工评审)的 α 未知相互关联——要用植入的错误去校准它们,并且尽可能把检查下沉为机械形式(Lean 那种"小型可信内核"的思路)。这正是对 honest-caveats 第 3 条的实践回应:把关键 gate 机械化,才能让联合界 Σα 保持诚实。

k(收缩率)= 修复轮次间残差的走势

定义可观测残差 rnr_n = 第 n 轮修复之后失败检查的数量(或误差量级)。经验收缩因子就是比值 k^=rn+1/rn\hat{k} = r_{n+1}/r_n。持续的 k̂ < 1 表示这个循环正在收敛;连续两轮 k̂ ≥ 1 就判定为发散 → 回跳(backjump)/ 重新规划 / 中止(gate-deviation-is-observable-deltaconflict-learning-and-backjumping)。这把"文本状态步骤会收缩"这个无法证明的假设(honest-caveats 第 1 条)变成了一个可监控的量:你不需要证明 k < 1——你只需要盯着 ,一旦它不满足就立刻行动。

P×C = 预算计数器

落到实处的 P×C = 每个节点分配到的 token 数、墙钟时间和重试次数。叶子节点的判据是"足够小,能在预算内一次做完并验证";分解 gate 检查的是每个子节点的预算严格小于父节点,并且所有子节点加起来不超预算。

可理解性——藏在其他旋钮背后的旋钮(成形中)

gate 本身是否也该可理解?是的——理由有两面,而且是承重的,不是装饰性的:

  • gate 这一侧:可理解性 = 可校准性。 你只能对自己理解其意图的 gate 做变异测试(你得知道它应该抓住什么,才能植入对的 bug)。一个不透明的 gate(未经审计的 LLM 裁判)的 α 你没法测,它的 Goodhart 漂移你也没法发现——下面 dashboard 上的每一个数字都会变成虚构的。一个你读不懂的 gate,就是一个你信不过的 gate。
  • 产物这一侧:可理解性 = 明天的 ε。 一个通过了所有检查、但让人看不懂的产物,会拉高下一轮的单步误差(执行者面对不透明状态时犯错更多),还背着一笔隐藏的未来 P×C(维护成本)。更糟的是,它会跑到 owner 的多样性之外——按照 requisite variety,一个已经无法为该产物建模的 owner,就已经不再是它的调节器(good-regulator-theorem)。

所以可理解性是其他旋钮能成立的前提条件,而不是与它们并列的第四个旋钮。

不借助语义裁判来 gate 它的办法:往返重建测试。 把说明性产物(文档/spec)交给一个完全接触不到原始代码的全新 executor,让它重新推导出接口/行为,然后与真实产物做机械式 diff(类型对得上吗?按文档写的测试能在代码上跑通吗?)。重建损失低 = 说明是忠实充分的 = 可理解。生成这一步会出错,但判定是机械式的certificate 模式),而且它像任何 gate 一样可以校准:植入文档↔代码之间的不一致,测量往返测试能抓住多少。用 Ashby 的话说:可理解性 = 产物能无损地压缩进 owner 的模型——往返测试就是对这种压缩的直接检验。

Dashboard

理论旋钮落地形式如何测量如何收紧
δ验收检查组合哪些检查通过增加/收紧检查
αgate 假通过率变异测试 / 植入 bug把检查机械化
k修复收敛情况残差比 rn+1/rnr_{n+1}/r_n更好的验证、更小的步长
P×C节点预算token/时间/重试计数器进一步分解

没有一个希腊字母需要那个抽象度量——每一个都变成了可执行检查上的计数器;这就是这些定理落地的方式。

operationalizing-tolerances