0%

你好,我是 Palind,这里是我的博客~ 你可以看看我的。

我正在学习 LLM 和 agent。

我最近的一些文章:


最近的 Score Centering 居然有整整五种解释方法🫠🫠🫠每一个角度都很有趣!

本文详细整理了五个解释 Score Centering(SC)的角度,而且每个都附上了出处链接。本文就是:「五等分的 Score Centering」。😉

TL;DR:

视角 对 SC 的解释
原 SC 视角 SC 是一种解决训推不一致(TIM)导致的 drift 的方法。
BPO 视角 SC 是根据 PMD 的闭式解改写的 critic-free 目标的 token-level surrogate 的梯度。
Advantage 定义视角 SC 是人们希望得到 sampler 分布的精确 value baseline 而推出来的期望更新。
STE 视角 SC 是直通估计器(STE)。
局部分布族视角 SC 是构造出的局部分布族在起点处的真实 score。

最后两个其实很接近 🤔 它们在变化靠近更新零点 $\delta=0$ 时是一样的。不过出发点不同,而且它们都特别精彩!所以我分为两点记录了。

另外,本文会记录一些关于社区的实现的笔记,如果你想快速浏览五种视角,可以直接跳过。

每一点,都能独立推出 SC,这真是异曲同工。接下来我来详细讲他们的核心。

阅读全文 »

Score Centering(SC)到底在优化什么?🧐 Score Centering 其实优化了采样器策略。

这里以局部分布族的视角,解释 SC。

阅读全文 »

记号

固定状态 token prefix:$s$,考虑 action distribution mismatch,假设各方法使用同一个 $Q(s,a)$。

定义:

对于重要性采样,再定义:

定义 weighted mean score:

使用以上记号,给出下表。

阅读全文 »

同策略的 RLVR,例如 GRPO 等,对 inference compute 有很高的要求。

这是阅读的出发点,但是也记录了别的工作。有点杂,仅方便我个人回顾。

阅读全文 »

此文章已经在知乎上收获了 105 + 的赞同和 144 + 的收藏,欢迎来知乎上点点赞同 🌹

最近的 BPO 与 Score Centering 两个工作热度很高,BPO 的作者也在知乎上分享对比了两个方法。😉

  • Score Centering:解释 training–inference mismatch(TIM)为何制造 drift,并消除它。
  • BPO(Bellman Policy Optimization):从 Policy Mirror Descent(PMD)出发,利用 Bellman 方程消去中间价值,推导无 critic 的轨迹目标,再近似成 token loss。
阅读全文 »