0%

10 月论文与趣闻

记录 10 月的论文与趣闻。😄

信用分配 credit assignment

TreeRL,高不确定性的中间步骤探索不同分支。

EVPO,选择可靠的收益评估基准、减少训练噪声。

PACT,1. critic 的平方误差换成交叉熵;2. 用新旧模型概率比让 critic 跟上更新后的生成模型。

Pivot

关键决策步骤。

PivotOPD

PivotRL

PivoARL

其他阅读

multi-harness-rl Hugging Face 认为,模型对单一智能体框架会过拟合。所以构建了多 harness 联合训练。

CLM 博客。CLM 是「上下文语言模型」,让语言模型原生地管理自己的 context。arXiv。论文是Context Language Models。

AC2 提出了 Actor-Critic with Action Chunking。

Finetuning with Sampling: SFT Learns Better Than You Think 认为,SFT 的泛化能力之所以不如 RL,是因为数据是离策略的,而不是因为 SFT 目标不行。