weak-auditor-by-design

设计使然的弱审计器

父节点:recursive-harness · 前置:gates-with-marginscoordinator-not-arbiterinterface-p-belief

一个反直觉的生产实践(Anthropic 在 Claude Code 里的 hook 审计器跑在一个模型上):监督强 actor 的审计器被刻意设计得比 actor 更弱。原因有六条,它们本身就是 harness 论点的缩影——审计器的力量来自它在结构中的位置,而不是它的智能水平。

  1. 热路径经济学。 审计器在每一次工具调用上同步运行。actor 的成本按任务摊销;审计器的成本按每一步累乘。一个触发频率高两个数量级的检查,成本也必须低两个数量级——高频检查必须便宜;昂贵的判断只该留给低频的升级节点(gate 经济学的均衡点)。

  2. 任务被收窄到强弱等效区。 审计器从不回答"这安全吗?"(开放式、依赖智能)。它回答的是"这个输入符不符合这条规则?"——封闭分类、短上下文、固定输出 schema。在窄分类任务上,小模型 ≈ 大模型。弱能力由强任务设计来补偿。

  3. 绊网,不是墙。 审计器只是纵深中的一层:它下面还有确定性的权限系统、操作系统沙箱、人工确认。它的职责是廉价地拉响警报;保证由确定性层来提供。拉响火警不需要天才。(它是 coordinator 一侧的机械部件,永远不是 arbiter。)

  4. 智能就是攻击面。 审计器的上下文里含有攻击者可控的内容——它审计的工具输入可能夹带注入。智能越强 = 越容易被说服。你要的是一个死板的规则警察,而不是一个愿意被雄辩打动的哲学家。稳健性来自结构(它能看见什么、能影响什么、输出被 schema 锁死),几乎不来自 IQ;小模型 + 短上下文 + 无工具 = 最小攻击面。

  5. 去相关。 actor 和审计器若用同一个强模型,会共享盲点——说服了 actor 的那套自我合理化,同样能说服同族的审计器(相关性失败)。换一个不同的小模型能买到部分去相关,而且是最便宜的多样性来源。

  6. 校准过的怀疑就够了。 审计器的输出动作是升级,不是执行/否决——它需要的是校准过的置信度,而不是正确的裁决(interface-p-belief)。以 1/20 的价格换来轻微的过度触发,再配上人工兜底,这笔精度经济学的账是划算的。

对 harness 的推论: 在 recursive harness 里放置 LLM judge 时,按这个预算来分配——先是机械 gate,然后是高频运行的弱但死板的分类器,强判断只留给稀疏的升级节点,而且永远不要让 judge 的上下文吞入未经 gate 处理的、来自被审计对象自身的内容。

about this entry

One of sijie's wiki entries. The AI on this site is grounded in the same corpus and answers in sijie's voice, with citations back to entries like this one — answering costs sijie money, so it waits behind a code: enter an access code →