RRLforge
实验预计 40 分钟

评测:别用训练集骗自己

把评测做成一条能重复执行的流水线,让每次实验的分数可比。

学完这节你能做到

  • 搭一条固定种子、固定采样参数的评测流程
  • 说清 greedy 与采样、pass@1 与 pass@k 分别适合报什么
  • 识别评测污染与「过拟合到测试集」的迹象
正文待编写以下是本节已定稿的小节大纲
  1. 1评测三要素:固定测试集、固定采样参数、固定判分器
  2. 2greedy 报主分,采样报 pass@k
  3. 3判分器本身的误差要估出来(抽 50 条人工核对)
  4. 4泛化检查:换一个同类数据集看分数还在不在
  5. 5把评测接进训练循环:eval_interval 该设多大
  6. 6结果表怎么写才不会骗自己