Score Centering 到底在优化什么?🧐 Score Centering 其实优化了采样器策略。
「SC 优化了采样器策略」视角原出处:(如果无法加载下方的帖子,请检查您的网络代理)
The gist of score centering actually lies in trying to optimize the sampler policy. This is the best formulation I've seen so far for interpreting score centering!
— Yuxuan Tong (@tongyx361) September 22, 2026
看完帖子中的讨论之后,我记录的阅读笔记如下。
符号约定
score 函数是
下文中,固定生成前缀 $h$,省略公式里的 $h$。
再定义:
- $p_\theta(a)$:训练器计算出的 token 概率。
- $q(a)$:实际生成 token 的采样器概率。
- $R$:生成结果的奖励。
训练和推理存在数值差异(TIM)或版本延迟(staleness)时,$p_\theta$ 与 $q$ 不同。
定义中心化操作是:
阅读笔记
引入:线性 softmax 的特例
我们先考虑一个简单的线性 softmax 策略,比如,每个动作 $a$ 有一个特征向量 $\phi(a)$,概率定义为
其中,$\theta$ 是参数,$\phi(a)$ 是与它维度相同的动作特征向量;假设 $\phi(a)$ 不随 $\theta$ 变化。
它的对数的梯度是:
这是因为
因此,此梯度 「增加所选动作的特征方向,同时减去训练器当前分布下的平均特征方向」。
中心化以后,得到的就是以采样分布为基点的 softmax 梯度
对上式,按采样分布 $q$ 取平均,得
因此,中心化是
与 $s(a)$ 对比,原来的 $\mathbb E_p[\phi]$ 消掉了,换成了 $\mathbb E_q[\phi]$。
当 TIM 时,$p\ne q$。在这个例子中,中心化将 score 中的训练器平均特征 $\mathbb E_p[\phi]$,替换成了采样器平均特征 $\mathbb E_q[\phi]$。一言以蔽之,中心化后的 score 具有以采样分布为基点的 softmax 对数概率梯度形式。
构造出随参数变化的一族分布
刚刚那句话里,「基点」指的是我们研究变化时选定的起始分布。需要我们构造出随参数变化的一族分布来解释。
构造:一族新的概率分布$\nu_\delta$。它从采样器的分布出发,但变化方式由训练器提供:
其中,族是一组随小更新 $\delta$ 变化的分布;基点是 $\delta=0$ 时的起点;在构造中,它的局部变化是训练器的梯度。
现在,把训练器在小更新下的概率变化施加到采样器上,再重新归一化:
- 训练器参数从 $\theta$ 变成 $\theta+\delta$。
- 每个 token 的概率变成原来的倍数是:
- 把这个倍数乘到 $q(a)$ 上,再归一化让所有概率之和恢复为 1。
所以,这个数学构造一族新的概率分布$\nu_\delta$从采样器当前的位置出发,沿着训练器提供的相对概率变化移动。
此构造自然得到 SC
对于刚刚构造的一族新的概率分布,在起点 $\delta=0$ 对它求导,就自然得到 score centering。
之所以,是因为,被减掉的平均 score,来自归一化产生的导数。 先看归一化:
其中
取对数,再求导:
而归一化项的导数恰好是
于是
综上,中心化是这族新分布 $\nu_\delta$ 在起点处的 score。
进一步,在奖励函数固定的单步问题中,
为什么,是因为,目标函数:
然后又是好经典 PG,我们求导:
在 $\delta=0$ 处取值:概率变成 $q(a)$ 了,对数概率梯度变成 $\widetilde s(a)$ 了。就是
这就说明:SC 后的奖励加权更新,可以理解成在这个局部分布族上提高期望奖励。这是因为上面几个式子说明,中心化 score 乘以奖励,再按采样分布求平均,得到的正是目标 $J$ 在起点处的梯度。
因而,沿这个梯度走足够小的一步,就能局部提高平均奖励 $J$。
小补充
当然,真正的采样器梯度肯定要真正求导
但我们是
我们求导路径来自训练器 $p_\theta$。所以更准确地说,我们是在采样器分布处,沿训练器提供的变化方式做局部优化。
更一般
更一般地说,当 delta=0 时,基点可以是定义的任何概率测度。 这个推导并不专属于采样器。
把 $q$ 换成另一个合适的基准分布 $\mu$,构造
肯定同样有
对于更一般的构造,选择哪个分布作为起点,就是减去哪个分布下的平均 score。
综上所述
综上所述,「分数中心化的核心实际上在于试图优化采样器策略」。它用采样器的当前分布作为起点,提高从这里出发的期望奖励。
这直接的后果是:纯 score centering 一般不会恢复训练器目标 $\mathbb E_{p_\theta}[R]$ 的精确梯度。SC 原论文说了,公式里剩下的协方差是在采样器分布 $q$ 下计算的: