2026-08-28·by Sijie Wang#cybernetics#engineering#prior-art

self-reference-classics

规划与控制中的经典自指

"做事"中的自指 = 一个系统对自身进行推理、建模或修改。几个经典的传统:

① 元推理 / 有限理性——对自己的推理过程进行推理

Russell & Wefald,《Do the Right Thing》(1991)——把"思考"本身也当作一个动作;理性元推理(要在行动前想多久)。I.J. Good 的第二类理性(Type II rationality);随时算法(anytime algorithms)加元层控制(Hansen–Zilberstein)。

② 控制论式自指——控制器必须为自身/世界建模

  • 良好调节器定理(Conant & Ashby,1970):"一个系统的每一个良好调节器都必然是该系统的一个模型"(good-regulator-theorem)。内部模型原理(Internal Model Principle,Francis–Wonham,1976)。
  • 二阶控制论(von Foerster)自创生(autopoiesis,Maturana–Varela)活力系统模型(Viable System Model,Stafford Beer)——观察者身处系统内部;系统生产它自身;递归的自相似管理。

③ 反射 / 自我修改——读写自身代码的程序

  • Brian Cantwell Smith 的 3-Lisp / 过程性反射(1982)Maes 的计算反射、元对象协议(metaobject protocol)。
  • Schmidhuber 的哥德尔机(Gödel machine)——只有在能证明改写有益时才会改写自己的代码;再加上递归自我改进。

④ 数学内核——不动点

  • 贝尔曼方程 / 动态规划:价值函数是自指式定义的(V(s)=max_a[r+γV(s′)]);价值迭代之所以收敛,是因为贝尔曼算子是一个 γ-压缩映射。最优控制 / 强化学习建立在一个自指不动点之上。
  • 克莱尼递归定理 / 对角化——形式化的内核(一个程序引用自己的代码)。

⑤ 元学习——学习自己的学习

元学习 / learning-to-learn / 元强化学习(meta-RL,RL²):改进自己的学习和探索过程。

about this entry

One of sijie's wiki entries. The AI on this site is grounded in the same corpus and answers in sijie's voice, with citations back to entries like this one — answering costs sijie money, so it waits behind a code: enter an access code →

self-reference-classics