RRLforge
原理预计 30 分钟

从 1 卡到 8 卡:哪些结论会变

你在单卡上得到的所有直觉,哪些能带上多卡,哪些必须扔掉。为将来真有机器的那天做准备。

学完这节你能做到

  • 说清 batch size、学习率、G 在扩到多卡时该怎么跟着变
  • 判断一个任务是被显存卡住还是被吞吐卡住
  • 看懂多卡启动脚本里 ray / torchrun 那一层在做什么
正文待编写以下是本节已定稿的小节大纲
  1. 1不变的:算法本身、reward 设计、曲线的读法
  2. 2要变的:全局 batch、学习率、rollout 与训练的卡数配比
  3. 3colocate 与 disaggregated 的选择依据
  4. 4ray 集群怎么起,为什么 RL 框架偏爱 ray
  5. 5成本视角:8×H100 一小时能做完你在 5090 上跑一周的量
  6. 6云上租卡的最小实验:先花 20 块钱验证脚本能跑

延伸资料