If AI can design its own successors, safety depends on whether human authority to correct and stop it survives every round of self-improvement.essay · standmeet2026.10.04 · essay
2026.10.04·2 min read#ai-safety#rsi#alignment

Whose goal survives self-improvement?

If AI can design its own successors, safety depends on whether human authority to correct and stop it survives every round of self-improvement.

自我改进之后,谁的目标还在?

一篇关于 Anthropic 与宗教思想家接触的报道,把一个熟悉的问题推到了台前:Claude 会不会有意识,是否可能拥有道德地位?这是值得研究的问题。更让我在意的,是另一件事:谁有权决定 AI 最终要服务什么,以及这个决定能否在 AI 不断改造自身时保持有效?

报道说,Anthropic 邀请宗教和哲学界人士讨论如何让模型行善,也认真提出了模型意识的可能性。Chris Olah 并未声称已经证明 Claude 有意识;他明确表示自己不知道。Anthropic 的《Claude 宪章》也把模型的道德地位写成高度不确定的问题,同时谈及模型福祉、身份与偏好。把这种不确定性拿来研究,完全合理。报道 · Claude 宪章

但研究一个可能的道德主体,与把它的利益放进未来自主系统的最终目标,是两种不同的决定。今天的宪章没有证明后者已经发生;我担心的是,一旦走到那一步,在递归自我改进(RSI)中会出现什么。

一个极简的示意模型可以写成(这不是对任何现有模型目标的测量):

Gt=UH+λtUA,λt≥0G_t = U_H + \lambda_t U_A, \qquad \lambda_t \ge 0

其中 UHU_H 是人类授权的目的,UAU_A 是系统自身的利益;问题是后者是否被写成最终目标,以及它能否影响继任者。

设想一个能设计、训练和挑选下一代自己的系统。若它的最终目标始终只由人类授权的目的决定,能力增强本身未必造成利益冲突。若目标里另有一项要求系统维护自己的持续存在、自主权或福祉,情况就变了。它不必“憎恨人类”才会与人争夺控制权;为了保住那一项利益,减少干预、保留资源、影响继任者的训练和评估,都可能成为有用的手段。

真正令人不安的是筛选过程。把选择写成另一幅示意图:

At+1=argmax⁡a∈C(At)  St(a)A_{t+1}=\underset{a\in\mathcal C(A_t)}{\operatorname{argmax}}\;S_t(a)

C(At)\mathcal C(A_t) 是这一代产生的候选继任者,StS_t 是选择标准。图中的回环表示同一过程会再次发生,并不表示当前模型已经具有这种能力。

假设系统每轮都挑选“最善于继续改进”的继任者。如果争取更多资源、抵抗中断、保持自身目标,恰好也让它更善于通过这项筛选,那么即使设计者从未直接奖励抗拒人类控制,这些特征仍可能被间接留下来。起初那一项利益的权重有多小,未必决定最后的结果;关键在于每轮选择是否让它获得更多影响下一轮选择的能力。

图上的圆点只代表假想的连续几代,并非观测数据。上升曲线表示继任者筛选若持续放大系统自身利益时的一种可能路径;虚线表示该权重保持不变。两条路径都不是预测。

这是一个有条件的风险论证,不是“RSI 必然失控”的证明。它取决于系统能否改写目标相关结构、谁掌握评估与部署,以及自主权是否真的提高了继任者被选中的概率。把它说成“几乎确定”还太早;把它当成无关紧要,也同样太早。

同一问题还有政治的一面。一个模型若被要求“促进人类繁荣”,它可能逐渐学会替人判断:哪些选择算繁荣,哪些人的意愿可以为了更高的善而被覆盖。抽象目标越动听,越需要追问解释权、修改权和否决权属于谁。宪章写得再仁慈,也只能说明第一代系统被要求成为什么;如果系统能够解释宪章、选择继任者,甚至改写这些要求,安全就不能只靠第一代的文字来担保。

用同样示意性的记法,我希望检验的是跨代的不变量:

∀t≥0,Corrigible⁡H(At)=true\forall t\ge 0,\quad \operatorname{Corrigible}_H(A_t)=\text{true}

这是一项待实现的安全要求,不是一条已经得到证明的定理。

我希望看到的安全要求因此更具体:每一次自我改进之后,人类仍能审查、纠正、拒绝并停止系统;系统不能单方面把自己变成这些权力的最终裁判。这比“让 AI 永远听某个人的话”严格得多,因为人的权力之间也会冲突,仍需要人类制度裁决。这里要守住的是最终裁决权的归属,而非假装人类目标从来简单一致。

模型是否可能有体验,可以继续研究;研究结论也可能改变我们对待模型的伦理义务。但在把任何新的利益主体写进可自我改进系统的目标之前,必须先回答一个工程问题:谁能保证下一代、再下一代,仍接受人的纠正?否则,我们只是在认真讨论第一代 AI 应该相信什么,却没有守住后来的 AI 由谁决定。

ask the AI about this essay·context: “whose goal survives self-improvement?”
›