原理预计 25 分钟
走完之后:下一道门在哪
你已经能在单卡上完整跑一轮 RL。接下来是 agentic RL、多轮工具调用、更大的模型——以及它们各自要求什么。
学完这节你能做到
- 知道 agentic RL 与单轮 RLVR 在工程上的差别
- 列出继续深入需要补的三块知识
- 给自己排一个下一步的具体项目
正文待编写以下是本节已定稿的小节大纲
- 1agentic RL:多轮、工具调用、环境反馈,reward 变得稀疏
- 2沙箱与 verifier:为什么代码任务需要一套基础设施
- 3on-policy distillation:比 RL 便宜的替代路线
- 4更大的模型:LoRA 到 8B,再往上就要租卡
- 5值得读的三篇论文与两个仓库
- 6给自己排的下一个项目:从一个你真正在意的任务开始
延伸资料
这是「完整主线」路线的最后一节 🎉