记录 10 月的论文与趣闻。😄
信用分配 credit assignment
TreeRL,高不确定性的中间步骤探索不同分支。
EVPO,选择可靠的收益评估基准、减少训练噪声。
PACT,1. critic 的平方误差换成交叉熵;2. 用新旧模型概率比让 critic 跟上更新后的生成模型。
Pivot
关键决策步骤。
其他阅读
multi-harness-rl Hugging Face 认为,模型对单一智能体框架会过拟合。所以构建了多 harness 联合训练。
CLM 博客。CLM 是「上下文语言模型」,让语言模型原生地管理自己的 context。arXiv。论文是Context Language Models。
AC2 提出了 Actor-Critic with Action Chunking。
Finetuning with Sampling: SFT Learns Better Than You Think 认为,SFT 的泛化能力之所以不如 RL,是因为数据是离策略的,而不是因为 SFT 目标不行。