L4
淬火
评测、调参与排障能跑通只是起点。这一阶段处理真正决定成败的部分:怎么评得可信、参数按什么顺序调、五种常见炸法怎么认怎么救,以及一次实验到底要花多久。
5 节课 · 约 3 小时已完成 0/5
- 1
闯关:五种炸法
闯关45 分钟熵崩塌、reward hacking、长度爆炸、KL 跑飞、OOM。每一种给现场证据,你来判断和处置。
- →看到日志和曲线就能认出是哪一种失效
- →对每种失效给出第一步处置动作,而不是把所有参数都动一遍
- →知道哪些失效是必须重启训练的,哪些可以边跑边救
- 2
评测:别用训练集骗自己
实验40 分钟仅大纲把评测做成一条能重复执行的流水线,让每次实验的分数可比。
- →搭一条固定种子、固定采样参数的评测流程
- →说清 greedy 与采样、pass@1 与 pass@k 分别适合报什么
- →识别评测污染与「过拟合到测试集」的迹象
- 3
调参优先级:先动哪三个旋钮
原理35 分钟仅大纲十几个超参不必都调。按影响排序,前三个决定成败,剩下的基本不用碰。
- →按影响力给 GRPO 的超参排序,并说出每个的合理起始值
- →判断一个现象该调哪个参数,而不是全部微调一遍
- →在有限的卡时里设计出信息量最大的实验序列
- 4
时间账:一次实验到底要跑多久
计算器30 分钟用你在 L0 测出的 tok/s,算出一次实验的墙钟时间。计算器帮你在开跑之前就知道要等多久。
- →估出一次训练的总时长,误差在 30% 以内
- →说出 rollout 与训练各占多少时间,以及该优化哪一头
- →在给定时间预算下反推出该缩哪个参数
- 5
走完之后:下一道门在哪
原理25 分钟仅大纲你已经能在单卡上完整跑一轮 RL。接下来是 agentic RL、多轮工具调用、更大的模型——以及它们各自要求什么。
- →知道 agentic RL 与单轮 RLVR 在工程上的差别
- →列出继续深入需要补的三块知识
- →给自己排一个下一步的具体项目