Skip to content
verl 源码学习verl source atlas

从一条 rollout 开始读懂 LLM 训练闭环

这个站把 PPO、GRPO、DAPO、OPD 和 rollout correction 放回 verl 的真实源码数据流里讲: 先建立直觉,再看公式,最后追到 RayPPOTrainer.fit()DataProto、worker、rollout 与 reward。

RayPPOTrainer.fit()
01DataProtobatch + non_tensor_batch + meta_info
02RolloutvLLM / SGLang generate_sequences
03Rewardrule score / model score / reward loop
04AdvantageGAE / GRPO / RLOO / ReMax
05Updateactor loss + critic loss + weight sync
7组源码系统
9+post-training 算法
1条训练主线
4实战入口

learning routes

先选一条路,不用一开始就啃完整仓库

training flow

一次样本在 verl 里怎样完成训练闭环

papers

论文不是背景材料,而是源码的钥匙

每篇论文按“解决什么问题、核心公式、小白版解释、verl 对应源码”拆开,避免只记住名词。

进入论文导读

algorithm map

核心算法怎么在 verl 里各司其职

practice

最后用配置和指标把知识落地

面向源码阅读的 verl 学习文档。