原理预计 30 分钟
reward 从哪来:可验证奖励、模型打分、人标
reward 设计是 RL 里唯一真正需要你想清楚的事情。写歪一个 reward,模型会精确地学会钻它的空子。
学完这节你能做到
- 给一个任务设计出可验证 reward,并预判它会被怎么钻空子
- 说清格式奖励与正确性奖励为什么要分开给、怎么配权重
- 识别 reward hacking 的早期信号
正文待编写以下是本节已定稿的小节大纲
- 1三种来源:规则可验证、模型打分(LLM-as-judge / RM)、人标
- 2可验证奖励的甜区:数学、代码、结构化输出
- 3复合 reward:正确性 + 格式 + 长度惩罚,权重怎么配
- 4稀疏与稠密:全对才给分 vs 分步给分
- 5reward hacking 案例集:空答案拿满格式分、答案重复十遍、复述题目
- 6设计检查清单:这个 reward 有没有不写答案就能拿分的路径