原理预计 30 分钟
从 1 卡到 8 卡:哪些结论会变
你在单卡上得到的所有直觉,哪些能带上多卡,哪些必须扔掉。为将来真有机器的那天做准备。
学完这节你能做到
- 说清 batch size、学习率、G 在扩到多卡时该怎么跟着变
- 判断一个任务是被显存卡住还是被吞吐卡住
- 看懂多卡启动脚本里 ray / torchrun 那一层在做什么
正文待编写以下是本节已定稿的小节大纲
- 1不变的:算法本身、reward 设计、曲线的读法
- 2要变的:全局 batch、学习率、rollout 与训练的卡数配比
- 3colocate 与 disaggregated 的选择依据
- 4ray 集群怎么起,为什么 RL 框架偏爱 ray
- 5成本视角:8×H100 一小时能做完你在 5090 上跑一周的量
- 6云上租卡的最小实验:先花 20 块钱验证脚本能跑