RRLforge
原理预计 30 分钟

token 与 chat template:新手翻车最密集的地方

一半的「RL 不收敛」其实是模板拼错、EOS 没停、mask 错位。这一节把这些坑提前踩掉。

学完这节你能做到

  • 手动拼出一条 chat template 的完整 token 序列,并指出哪些位置该算 loss
  • 说清 prompt mask、completion mask、padding mask 三者的关系
  • 判断「模型不停下来」是模板问题、EOS 问题还是采样参数问题
正文待编写以下是本节已定稿的小节大纲
  1. 1tokenizer 的三件事:编码、特殊 token、chat template
  2. 2apply_chat_template 到底往里塞了什么(打印出来看)
  3. 3Base 模型与 Instruct 模型的模板差异,以及选错的后果
  4. 4RL 里的 loss mask:只对 completion 求梯度
  5. 5EOS、stop token、max_tokens 三种停止方式
  6. 6常见翻车现场:回答里带模板标记、答案被截断、长度全部顶到上限