0%

离策略更新偏差表

记号

固定状态 token prefix:$s$,考虑 action distribution mismatch,假设各方法使用同一个 $Q(s,a)$。

定义:

对于重要性采样,再定义:

定义 weighted mean score:

使用以上记号,给出下表。

离策略更新偏差表

名称 更新公式 相对 $g^\star=\mathbb E_p[Qz]$ 的偏差
On-policy Policy Gradient,理想目标 $\mathbb E_p[Qz]$ $0$
Naive Off-policy PG,数据来自 $q$ 而 trainer 是 $p$,存在 TIM $\mathbb E_q[Qz]$ $V^q m_q+\operatorname{Cov}_q(Q,z)-\operatorname{Cov}_p(Q,z)$
普通 Advantage / Baseline,经典 actor-critic、PPO 等常用 $A=Q-V$,$V$ 的估计要么用 critic 要么用 GAE 要么用大量 rollout $\mathbb E_q[(Q-V)z]$ $(V^q-V)m_q+\operatorname{Cov}_q(Q,z)-\operatorname{Cov}_p(Q,z)$
Exact $q$-Baseline,这个 $V^q$ 是精确值 $V^q=\mathbb E_q[Q\mid s]$ $\mathbb E_q[(Q-V^q)z]$ $\operatorname{Cov}_q(Q,z)-\operatorname{Cov}_p(Q,z)$
Exact Score Centering(SC) 通过 $m_q=\mathbb E_q[z]$ 删除 mean-score drift,期望上等价于 Exact $q$-Baseline $\mathbb E_q[Q(z-m_q)]$ $\operatorname{Cov}_q(Q,z)-\operatorname{Cov}_p(Q,z)$
BPO linearized full reverse-KL gradient,令 $A = Q - b$,梯度期望与 SC 等价 $\mathbb E_q[A(z-m_q)]$ $\operatorname{Cov}_q(Q,z)-\operatorname{Cov}_p(Q,z)$
Practical BPO 使用 binary-KL、加法平滑、mask、cap $\mathbb E_q[A\,\bar\omega(a)z]$,其中 $\bar\omega=M(a)\min{\frac{1+\epsilon-q_a}{1+\epsilon-p_a},C}$ $(V^q-V)m_{\bar\omega}+\operatorname{Cov}_q(Q,\bar\omega z)-\operatorname{Cov}_p(Q,z)$
Exact Importance Sampling(IS),无偏,一般来说重要性采样引入极高方差 $\mathbb E_q[\frac pq Qz]$ $0$
Truncated/Masked IS(TIS/MIS),通过截断或掩码 ratio 降低方差,引入偏差 $\mathbb E_q[Qwz]$ 当 IS 权重 $w$ 被截断/掩码时,为 $V^q m_w+\operatorname{Cov}_q(Q,wz)-\operatorname{Cov}_p(Q,z)$
TIS/MIS + Score Centering,中心化整个 weighted score $wz$ $\mathbb E_q[Q(wz-m_w)]$ 当 IS 权重 $w$ 被截断/掩码时,为 $\operatorname{Cov}_q(Q,wz)-\operatorname{Cov}_p(Q,z)$
Exact IS + SC $\mathbb E_q[Q(\frac pqz-\mathbb E_q[\frac pqz])]$ $0$,因为 $\mathbb E_q[\frac pqz]=\mathbb E_p[z]=0$
Top-k approximate SC $\mathbb E_q[Q(z-\hat m_q)]$ $\bar Q_q(m_q-\hat m_q)+\operatorname{Cov}_q(Q,z)-\operatorname{Cov}_p(Q,z)$

对于表中的 $w$,有 importance weight 注解:

方法 $w=f(p/q)$
无 IS / Vanilla SC $w=1$
Exact IS $w=\frac{p}{q}$
TIS $w=\min(\frac{p}{q},c)$
MIS $w=\frac{p}{q}\mathbf 1{\ell\le \frac{p}{q}\le u}$

核心关系

Naive off-policy 更新的偏差可以分成两部分:

Score Centering 精确删除第一项后,

但通常仍有:

综上所述,SC 虽未消除全部偏差,但精确删除了会在每次训练中持续积累的 drift: