RRLforge
先搞懂原理 路线5 / 13 · 把数学推一遍退出路线
原理预计 30 分钟

reward 从哪来:可验证奖励、模型打分、人标

reward 设计是 RL 里唯一真正需要你想清楚的事情。写歪一个 reward,模型会精确地学会钻它的空子。

学完这节你能做到

  • 给一个任务设计出可验证 reward,并预判它会被怎么钻空子
  • 说清格式奖励与正确性奖励为什么要分开给、怎么配权重
  • 识别 reward hacking 的早期信号
正文待编写以下是本节已定稿的小节大纲
  1. 1三种来源:规则可验证、模型打分(LLM-as-judge / RM)、人标
  2. 2可验证奖励的甜区:数学、代码、结构化输出
  3. 3复合 reward:正确性 + 格式 + 长度惩罚,权重怎么配
  4. 4稀疏与稠密:全对才给分 vs 分步给分
  5. 5reward hacking 案例集:空答案拿满格式分、答案重复十遍、复述题目
  6. 6设计检查清单:这个 reward 有没有不写答案就能拿分的路径