实验预计 40 分钟
评测:别用训练集骗自己
把评测做成一条能重复执行的流水线,让每次实验的分数可比。
学完这节你能做到
- 搭一条固定种子、固定采样参数的评测流程
- 说清 greedy 与采样、pass@1 与 pass@k 分别适合报什么
- 识别评测污染与「过拟合到测试集」的迹象
正文待编写以下是本节已定稿的小节大纲
- 1评测三要素:固定测试集、固定采样参数、固定判分器
- 2greedy 报主分,采样报 pass@k
- 3判分器本身的误差要估出来(抽 50 条人工核对)
- 4泛化检查:换一个同类数据集看分数还在不在
- 5把评测接进训练循环:eval_interval 该设多大
- 6结果表怎么写才不会骗自己