RRLforge
完整主线 路线25 / 27 · L4 淬火退出路线
原理预计 35 分钟

调参优先级:先动哪三个旋钮

十几个超参不必都调。按影响排序,前三个决定成败,剩下的基本不用碰。

学完这节你能做到

  • 按影响力给 GRPO 的超参排序,并说出每个的合理起始值
  • 判断一个现象该调哪个参数,而不是全部微调一遍
  • 在有限的卡时里设计出信息量最大的实验序列
正文待编写以下是本节已定稿的小节大纲
  1. 1第一优先:reward 设计(不算超参,但影响最大)
  2. 2第二优先:学习率 与 KL 系数
  3. 3第三优先:group size G 与 batch size
  4. 4基本不用动的:clip 阈值、优化器 betas、warmup
  5. 5采样温度:探索与稳定的直接旋钮
  6. 6起始配置表:0.6B / 1.7B / LoRA 各一组

延伸资料