原理预计 35 分钟
调参优先级:先动哪三个旋钮
十几个超参不必都调。按影响排序,前三个决定成败,剩下的基本不用碰。
学完这节你能做到
- 按影响力给 GRPO 的超参排序,并说出每个的合理起始值
- 判断一个现象该调哪个参数,而不是全部微调一遍
- 在有限的卡时里设计出信息量最大的实验序列
正文待编写以下是本节已定稿的小节大纲
- 1第一优先:reward 设计(不算超参,但影响最大)
- 2第二优先:学习率 与 KL 系数
- 3第三优先:group size G 与 batch size
- 4基本不用动的:clip 阈值、优化器 betas、warmup
- 5采样温度:探索与稳定的直接旋钮
- 6起始配置表:0.6B / 1.7B / LoRA 各一组