RRLforge
原理预计 25 分钟

走完之后:下一道门在哪

你已经能在单卡上完整跑一轮 RL。接下来是 agentic RL、多轮工具调用、更大的模型——以及它们各自要求什么。

学完这节你能做到

  • 知道 agentic RL 与单轮 RLVR 在工程上的差别
  • 列出继续深入需要补的三块知识
  • 给自己排一个下一步的具体项目
正文待编写以下是本节已定稿的小节大纲
  1. 1agentic RL:多轮、工具调用、环境反馈,reward 变得稀疏
  2. 2沙箱与 verifier:为什么代码任务需要一套基础设施
  3. 3on-policy distillation:比 RL 便宜的替代路线
  4. 4更大的模型:LoRA 到 8B,再往上就要租卡
  5. 5值得读的三篇论文与两个仓库
  6. 6给自己排的下一个项目:从一个你真正在意的任务开始

延伸资料