实验预计 35 分钟
先量起点:数据集与评测基线
RL 只能证明「比训练前好」。所以第一件事是量出训练前的分数,否则后面所有曲线都没有意义。
学完这节你能做到
- 准备好 GSM8K 的训练/测试切分,并说清为什么不能拿训练集报分
- 写出一个能自动判对错的答案抽取器,并知道它会在哪里误判
- 跑出训练前的 baseline 准确率,写进实验笔记
正文待编写以下是本节已定稿的小节大纲
- 1为什么第一个任务选数学题:reward 可验证,不需要训 reward model
- 2GSM8K 结构:7473 训练 / 1319 测试,答案在 #### 之后
- 3写答案抽取:正则、数字归一化、常见误判
- 4pass@1 与 greedy / 采样的区别
- 5跑 baseline:记录准确率、平均回答长度、耗时
- 6实验笔记模板:一次实验必须记下的七个字段
延伸资料
- ·GSM8K 数据集 ↗
- ·rlforge 配套脚本
scripts/eval_gsm8k.py