2026-08-28·by Sijie Wang#math#rate-reduction

maximal-coding-rate-reduction

最大编码率降低(MCR2)

这是一条关于什么才是好的学习表示的原则,它把目标定在特征本身之上,而不是定在标签上的损失。这是 Yi Ma 一脉的工作,也是白盒深度学习研究纲领的基础。

度量:编码率

给定一个特征矩阵 Z(列为 n 个样本各自的 d 维特征),编码率定义为:把 Z 编码到精度 eps 所需的每样本比特数(一种率失真 / 高斯球计数):

R(Z) = (1/2) log det( I + (d / (n * eps^2)) * Z Z^T )

R 越大,说明特征占据的体积越大(越分散 / 有效维度越高)。

目标:整体扩张,逐类压缩

给定一个类别划分,令 R_c(Z)各类别内部编码率之和(每个类别各自单独编码)。一个好的表示应当:

  • 整体上扩张 —— R(Z) 大(特征多样,铺满空间);
  • 逐类紧凑 —— R_c(Z) 小(每个类别低维)。

于是要最大化两者之差,即编码率降低

DeltaR(Z) = R(Z) - R_c(Z)   ->  maximize

(PCA 是单类别的特例;MCR2 是它向多类别的推广。)

最优解的样子(收益)

最大化 DeltaR 会迫使各个类别落入相互正交的低维子空间,且每个子空间内部尽可能地铺展开。于是一个目标函数同时买到了两个性质:

  • 判别性 —— 各类别被分开(子空间正交);
  • 多样性 —— 类别内部的特征不会坍缩成一点(类内体积高),这与朴素交叉熵不同——后者可能把一个类别压缩成一个点(神经坍缩,neural collapse)。

ReduNet:白盒网络

DeltaR 上做投影梯度上升这一过程展开(unroll):每一次迭代变成一。得到的网络(ReduNet)是一个深度网络,其中每一个算子(一个线性映射 + 类别子空间之间的类 softmax 竞争)都是推导出来的,而非通过反向传播学出来的——按构造即可解释。架构就是率降低目标的一个展开优化器

为什么重要 / 关联

  • 相对于对比学习 / 自监督目标,这是一个有原则的、信息论式的替代方案:不需要负样本,不需要数据增强技巧——只需要"整体铺展、逐部压缩"。
  • 把表示学习与率失真理论子空间聚类联系了起来。
  • 属于"把深度网络理解为在优化一个显式的、可度量的目标"这一研究纲领(相对于黑盒视角)——在精神上,与"读懂网络的结构而非仅信任其输出"是一路的。
about this entry

One of sijie's wiki entries. The AI on this site is grounded in the same corpus and answers in sijie's voice, with citations back to entries like this one — answering costs sijie money, so it waits behind a code: enter an access code →

maximal-coding-rate-reduction