设计使然的弱审计器
父节点:recursive-harness · 前置:gates-with-margins、coordinator-not-arbiter、interface-p-belief
一个反直觉的生产实践(Anthropic 在 Claude Code 里的 hook 审计器跑在一个小模型上):监督强 actor 的审计器被刻意设计得比 actor 更弱。原因有六条,它们本身就是 harness 论点的缩影——审计器的力量来自它在结构中的位置,而不是它的智能水平。
-
热路径经济学。 审计器在每一次工具调用上同步运行。actor 的成本按任务摊销;审计器的成本按每一步累乘。一个触发频率高两个数量级的检查,成本也必须低两个数量级——高频检查必须便宜;昂贵的判断只该留给低频的升级节点(gate 经济学的均衡点)。
-
任务被收窄到强弱等效区。 审计器从不回答"这安全吗?"(开放式、依赖智能)。它回答的是"这个输入符不符合这条规则?"——封闭分类、短上下文、固定输出 schema。在窄分类任务上,小模型 ≈ 大模型。弱能力由强任务设计来补偿。
-
绊网,不是墙。 审计器只是纵深中的一层:它下面还有确定性的权限系统、操作系统沙箱、人工确认。它的职责是廉价地拉响警报;保证由确定性层来提供。拉响火警不需要天才。(它是 coordinator 一侧的机械部件,永远不是 arbiter。)
-
智能就是攻击面。 审计器的上下文里含有攻击者可控的内容——它审计的工具输入可能夹带注入。智能越强 = 越容易被说服。你要的是一个死板的规则警察,而不是一个愿意被雄辩打动的哲学家。稳健性来自结构(它能看见什么、能影响什么、输出被 schema 锁死),几乎不来自 IQ;小模型 + 短上下文 + 无工具 = 最小攻击面。
-
去相关。 actor 和审计器若用同一个强模型,会共享盲点——说服了 actor 的那套自我合理化,同样能说服同族的审计器(相关性失败)。换一个不同的小模型能买到部分去相关,而且是最便宜的多样性来源。
-
校准过的怀疑就够了。 审计器的输出动作是升级,不是执行/否决——它需要的是校准过的置信度,而不是正确的裁决(interface-p-belief)。以 1/20 的价格换来轻微的过度触发,再配上人工兜底,这笔精度经济学的账是划算的。
对 harness 的推论: 在 recursive harness 里放置 LLM judge 时,按这个预算来分配——先是机械 gate,然后是高频运行的弱但死板的分类器,强判断只留给稀疏的升级节点,而且永远不要让 judge 的上下文吞入未经 gate 处理的、来自被审计对象自身的内容。