0%

你好,我是 Palind,这里是我的博客~ 你可以在我的中查看我的学历、荣誉、爱好等。

You’re very welcome to check out my blog! You can find my education, honors, hobbies, and more in my

我正在学习 LLM 和 agent。


记号

固定状态 token prefix:$s$,考虑 action distribution mismatch,假设各方法使用同一个 $Q(s,a)$。

定义:

对于重要性采样,再定义:

定义 weighted mean score:

使用以上记号,给出下表。

阅读全文 »

同策略的 RLVR,例如 GRPO 等,对 inference compute 有很高的要求。

这是阅读的出发点,但是也记录了别的工作。有点杂,仅方便我个人回顾。

阅读全文 »

最近的 BPO 与 Score Centering 两个工作热度很高,BPO 的作者也在知乎上分享对比了两个方法。😉

  • Score Centering:解释 training–inference mismatch(TIM)为何制造 drift,并消除它。
  • BPO(Bellman Policy Optimization):从 Policy Mirror Descent(PMD)出发,利用 Bellman 方程消去中间价值,推导无 critic 的轨迹目标,再近似成 token loss。
阅读全文 »

TML OPD 博客的 $\gamma$ 在哪里?他们的原文写的是:

「折扣因子」是什么?它不在公式里。作为初学者我很困惑 🤔。

阅读全文 »

暑假里做了一些趣味的阅读:D

包括网上刷到的博客、奇闻、论文、研究等。

(未写完)

阅读全文 »

上一次的学习笔记:Claude Code 学习笔记 | Palind’s Blog

这一次主要围绕多 agent 的机制。

主要内容:

  1. 再看 Claude Code 之前泄露的源码,学习 subagent 与 agent 间交流机制。学习 agent team 机制以及实现。见 多 Agent
  2. 顺手搓了一个可视化反代,这样方便实验、方便直接观察 LLM 具体流量,看收到的请求与相应内容。反代的仓库放在 Palind-Rome/agent-wirelens: 反向网关实验台
  3. 通过反代实验台,截图记录了真实请求,见 多 agent 实验与截图记录
  4. 我很好奇:这种流量与请求如何利用起来?真实的 agent 训练得到多 agent 能力是什么样的?从 hf 上看看 agent 数据集与训练方法。见 真实数据集情况
阅读全文 »