记号
固定状态 token prefix:$s$,考虑 action distribution mismatch,假设各方法使用同一个 $Q(s,a)$。
定义:
对于重要性采样,再定义:
定义 weighted mean score:
使用以上记号,给出下表。
离策略更新偏差表
| 名称 | 更新公式 | 相对 $g^\star=\mathbb E_p[Qz]$ 的偏差 |
|---|---|---|
| On-policy Policy Gradient,理想目标 | $\mathbb E_p[Qz]$ | $0$ |
| Naive Off-policy PG,数据来自 $q$ 而 trainer 是 $p$,存在 TIM | $\mathbb E_q[Qz]$ | $V^q m_q+\operatorname{Cov}_q(Q,z)-\operatorname{Cov}_p(Q,z)$ |
| 普通 Advantage / Baseline,经典 actor-critic、PPO 等常用 $A=Q-V$,$V$ 的估计要么用 critic 要么用 GAE 要么用大量 rollout | $\mathbb E_q[(Q-V)z]$ | $(V^q-V)m_q+\operatorname{Cov}_q(Q,z)-\operatorname{Cov}_p(Q,z)$ |
| Exact $q$-Baseline,这个 $V^q$ 是精确值 $V^q=\mathbb E_q[Q\mid s]$ | $\mathbb E_q[(Q-V^q)z]$ | $\operatorname{Cov}_q(Q,z)-\operatorname{Cov}_p(Q,z)$ |
| Exact Score Centering(SC) 通过 $m_q=\mathbb E_q[z]$ 删除 mean-score drift,期望上等价于 Exact $q$-Baseline | $\mathbb E_q[Q(z-m_q)]$ | $\operatorname{Cov}_q(Q,z)-\operatorname{Cov}_p(Q,z)$ |
| BPO linearized full reverse-KL gradient,令 $A = Q - b$,梯度期望与 SC 等价 | $\mathbb E_q[A(z-m_q)]$ | $\operatorname{Cov}_q(Q,z)-\operatorname{Cov}_p(Q,z)$ |
| Practical BPO 使用 binary-KL、加法平滑、mask、cap | $\mathbb E_q[A\,\bar\omega(a)z]$,其中 $\bar\omega=M(a)\min{\frac{1+\epsilon-q_a}{1+\epsilon-p_a},C}$ | $(V^q-V)m_{\bar\omega}+\operatorname{Cov}_q(Q,\bar\omega z)-\operatorname{Cov}_p(Q,z)$ |
| Exact Importance Sampling(IS),无偏,一般来说重要性采样引入极高方差 | $\mathbb E_q[\frac pq Qz]$ | $0$ |
| Truncated/Masked IS(TIS/MIS),通过截断或掩码 ratio 降低方差,引入偏差 | $\mathbb E_q[Qwz]$ | 当 IS 权重 $w$ 被截断/掩码时,为 $V^q m_w+\operatorname{Cov}_q(Q,wz)-\operatorname{Cov}_p(Q,z)$ |
| TIS/MIS + Score Centering,中心化整个 weighted score $wz$ | $\mathbb E_q[Q(wz-m_w)]$ | 当 IS 权重 $w$ 被截断/掩码时,为 $\operatorname{Cov}_q(Q,wz)-\operatorname{Cov}_p(Q,z)$ |
| Exact IS + SC | $\mathbb E_q[Q(\frac pqz-\mathbb E_q[\frac pqz])]$ | $0$,因为 $\mathbb E_q[\frac pqz]=\mathbb E_p[z]=0$ |
| Top-k approximate SC | $\mathbb E_q[Q(z-\hat m_q)]$ | $\bar Q_q(m_q-\hat m_q)+\operatorname{Cov}_q(Q,z)-\operatorname{Cov}_p(Q,z)$ |
对于表中的 $w$,有 importance weight 注解:
| 方法 | $w=f(p/q)$ |
|---|---|
| 无 IS / Vanilla SC | $w=1$ |
| Exact IS | $w=\frac{p}{q}$ |
| TIS | $w=\min(\frac{p}{q},c)$ |
| MIS | $w=\frac{p}{q}\mathbf 1{\ell\le \frac{p}{q}\le u}$ |
核心关系
Naive off-policy 更新的偏差可以分成两部分:
Score Centering 精确删除第一项后,
但通常仍有:
综上所述,SC 虽未消除全部偏差,但精确删除了会在每次训练中持续积累的 drift: