2026-08-28·by Sijie Wang#idea#optimization#math

modern-frontier

优化的现代前沿

上级:optimization

这里,目标函数本身是被学出来的、对抗性的、嵌套的,或是定义在分布之上的。

双层优化与元优化

  • 优化套优化:超参数优化、学会优化(learning-to-optimize,学出更新规则本身)、元学习(MAML);
  • "LLM 作为优化器"(OPRO)——模型不断提出并改进候选解;上下文学习(in-context learning)近似于隐式的梯度下降。→ 对应我们的 LLM 作为内层优化器stages-gates-as-hard-optimization)。

极小极大、博弈与对抗

  • 鞍点问题 min_x max_y f(x,y):GAN、对抗训练、鲁棒优化;
  • 无悔动态 / 梯度下降-上升 / 单调算子求解;其收敛性很微妙(会在鞍点附近打转,而非单调下降)。

最优传输与测度空间上的梯度流

  • 最优传输 / Wasserstein 距离;在概率分布上做优化;
  • Wasserstein 梯度流 = 测度空间上的偏微分方程(Fokker–Planck)——这正是扩散模型背后的数学。

把难优化问题结构化(连续化家族)

  • 同伦 / 连续化(continuation)渐进非凸化课程学习退火——沿一条从易到难的问题路径求解,每一步都用上一步的解热启动;
  • → 这正是阶段-关卡结构的本质:stages-gates-as-hard-optimization

统一的抽象

  • 单调算子 / 不动点理论——梯度下降、近端方法、ADMM、原始-对偶方法,都可以看作(强)非扩张算子的不动点迭代;
  • 一切都是:把一个算子迭代到它的不动点;收敛当且仅当它是压缩映射 / 该流是稳定的dynamics-to-a-fixed-point

主题

"最小化一个固定凸函数 f"这种干净的表述会瓦解:目标函数变成被学出来的(双层)、对抗性的(极小极大)、定义在分布之上的(最优传输),或难到无法直接下降的(连续化)。这正是 agent/LLM 优化这条线索所在的前沿。

about this entry

One of sijie's wiki entries. The AI on this site is grounded in the same corpus and answers in sijie's voice, with citations back to entries like this one — answering costs sijie money, so it waits behind a code: enter an access code →