0%

视角:SC 优化了采样器策略

Score Centering 到底在优化什么?🧐 Score Centering 其实优化了采样器策略。


「SC 优化了采样器策略」视角原出处:(如果无法加载下方的帖子,请检查您的网络代理)

看完帖子中的讨论之后,我记录的阅读笔记如下。


符号约定

score 函数是

下文中,固定生成前缀 $h$,省略公式里的 $h$。

再定义:

  • $p_\theta(a)$:训练器计算出的 token 概率。
  • $q(a)$:实际生成 token 的采样器概率。
  • $R$:生成结果的奖励。

训练和推理存在数值差异(TIM)或版本延迟(staleness)时,$p_\theta$ 与 $q$ 不同。

定义中心化操作是:

阅读笔记

引入:线性 softmax 的特例

我们先考虑一个简单的线性 softmax 策略,比如,每个动作 $a$ 有一个特征向量 $\phi(a)$,概率定义为

其中,$\theta$ 是参数,$\phi(a)$ 是与它维度相同的动作特征向量;假设 $\phi(a)$ 不随 $\theta$ 变化。

它的对数的梯度是:

这是因为

因此,此梯度 「增加所选动作的特征方向,同时减去训练器当前分布下的平均特征方向」。

中心化以后,得到的就是以采样分布为基点的 softmax 梯度

对上式,按采样分布 $q$ 取平均,得

因此,中心化是

与 $s(a)$ 对比,原来的 $\mathbb E_p[\phi]$ 消掉了,换成了 $\mathbb E_q[\phi]$。

当 TIM 时,$p\ne q$。在这个例子中,中心化将 score 中的训练器平均特征 $\mathbb E_p[\phi]$,替换成了采样器平均特征 $\mathbb E_q[\phi]$。一言以蔽之,中心化后的 score 具有以采样分布为基点的 softmax 对数概率梯度形式。

构造出随参数变化的一族分布

刚刚那句话里,「基点」指的是我们研究变化时选定的起始分布。需要我们构造出随参数变化的一族分布来解释。

构造:一族新的概率分布$\nu_\delta$。它从采样器的分布出发,但变化方式由训练器提供:

其中,族是一组随小更新 $\delta$ 变化的分布;基点是 $\delta=0$ 时的起点;在构造中,它的局部变化是训练器的梯度。

现在,把训练器在小更新下的概率变化施加到采样器上,再重新归一化:

  1. 训练器参数从 $\theta$ 变成 $\theta+\delta$。
  2. 每个 token 的概率变成原来的倍数是:
  3. 把这个倍数乘到 $q(a)$ 上,再归一化让所有概率之和恢复为 1。

所以,这个数学构造一族新的概率分布$\nu_\delta$从采样器当前的位置出发,沿着训练器提供的相对概率变化移动。

此构造自然得到 SC

对于刚刚构造的一族新的概率分布,在起点 $\delta=0$ 对它求导,就自然得到 score centering。

之所以,是因为,被减掉的平均 score,来自归一化产生的导数。 先看归一化:

其中

取对数,再求导:

而归一化项的导数恰好是

于是

综上,中心化是这族新分布 $\nu_\delta$ 在起点处的 score。

进一步,在奖励函数固定的单步问题中,

为什么,是因为,目标函数:

然后又是好经典 PG,我们求导:

在 $\delta=0$ 处取值:概率变成 $q(a)$ 了,对数概率梯度变成 $\widetilde s(a)$ 了。就是

这就说明:SC 后的奖励加权更新,可以理解成在这个局部分布族上提高期望奖励。这是因为上面几个式子说明,中心化 score 乘以奖励,再按采样分布求平均,得到的正是目标 $J$ 在起点处的梯度。

因而,沿这个梯度走足够小的一步,就能局部提高平均奖励 $J$。

小补充

当然,真正的采样器梯度肯定要真正求导

但我们是

我们求导路径来自训练器 $p_\theta$。所以更准确地说,我们是在采样器分布处,沿训练器提供的变化方式做局部优化。

更一般

更一般地说,当 delta=0 时,基点可以是定义的任何概率测度。 这个推导并不专属于采样器。

把 $q$ 换成另一个合适的基准分布 $\mu$,构造

肯定同样有

对于更一般的构造,选择哪个分布作为起点,就是减去哪个分布下的平均 score。

综上所述

综上所述,「分数中心化的核心实际上在于试图优化采样器策略」。它用采样器的当前分布作为起点,提高从这里出发的期望奖励。

这直接的后果是:纯 score centering 一般不会恢复训练器目标 $\mathbb E_{p_\theta}[R]$ 的精确梯度。SC 原论文说了,公式里剩下的协方差是在采样器分布 $q$ 下计算的:

Reference