Appearance
这个站把 PPO、GRPO、DAPO、OPD 和 rollout correction 放回 verl 的真实源码数据流里讲: 先建立直觉,再看公式,最后追到 RayPPOTrainer.fit()、DataProto、worker、rollout 与 reward。
RayPPOTrainer.fit()
DataProto
learning routes
RLHF/RLVR、policy、reward、KL、advantage、rollout,先把语言和直觉建立起来。
按 PPO -> GRPO -> DAPO -> OPD 的顺序,把每个公式落到 core_algos 与 trainer loop。
理解 HybridFlow、single-controller、Ray worker、rollout server 和 Hydra 配置如何协同。
training flow
source anchors
verl/trainer/ppo/ray_trainer.py
verl/trainer/ppo/core_algos.py
verl/protocol.py
verl/workers/engine_workers.py
verl/workers/rollout/
verl/workers/reward_manager/
papers
每篇论文按“解决什么问题、核心公式、小白版解释、verl 对应源码”拆开,避免只记住名词。
algorithm map
practice