规划与控制中的经典自指
"做事"中的自指 = 一个系统对自身进行推理、建模或修改。几个经典的传统:
① 元推理 / 有限理性——对自己的推理过程进行推理
Russell & Wefald,《Do the Right Thing》(1991)——把"思考"本身也当作一个动作;理性元推理(要在行动前想多久)。I.J. Good 的第二类理性(Type II rationality);随时算法(anytime algorithms)加元层控制(Hansen–Zilberstein)。
② 控制论式自指——控制器必须为自身/世界建模
- 良好调节器定理(Conant & Ashby,1970):"一个系统的每一个良好调节器都必然是该系统的一个模型"(good-regulator-theorem)。内部模型原理(Internal Model Principle,Francis–Wonham,1976)。
- 二阶控制论(von Foerster)、自创生(autopoiesis,Maturana–Varela)、活力系统模型(Viable System Model,Stafford Beer)——观察者身处系统内部;系统生产它自身;递归的自相似管理。
③ 反射 / 自我修改——读写自身代码的程序
- Brian Cantwell Smith 的 3-Lisp / 过程性反射(1982)、Maes 的计算反射、元对象协议(metaobject protocol)。
- Schmidhuber 的哥德尔机(Gödel machine)——只有在能证明改写有益时才会改写自己的代码;再加上递归自我改进。
④ 数学内核——不动点
- 贝尔曼方程 / 动态规划:价值函数是自指式定义的(
V(s)=max_a[r+γV(s′)]);价值迭代之所以收敛,是因为贝尔曼算子是一个 γ-压缩映射。最优控制 / 强化学习建立在一个自指不动点之上。 - 克莱尼递归定理 / 对角化——形式化的内核(一个程序引用自己的代码)。
⑤ 元学习——学习自己的学习
元学习 / learning-to-learn / 元强化学习(meta-RL,RL²):改进自己的学习和探索过程。