LLM 训练 NaN/Inf 故障治理生产实战:用 Non-finite 门禁、GradScaler 证据与 Layer Bisect 隔离首个坏步
大模型训练中的 NaN/Inf 往往在多个步骤后才暴露。本文从非有限值门禁、GradScaler 跳步证据、分布式一致跳过、层级二分定位与坏批次隔离出发,给出可回放、可止损、可恢复的数值异常治理方案。
共 2 篇文章
大模型训练中的 NaN/Inf 往往在多个步骤后才暴露。本文从非有限值门禁、GradScaler 跳步证据、分布式一致跳过、层级二分定位与坏批次隔离出发,给出可回放、可止损、可恢复的数值异常治理方案。
大模型训练中,激活值常比参数更早耗尽显存。本文深入探讨选择性重计算、非重入模式、随机数状态一致性及工程门禁策略,帮助团队在保证梯度正确的前提下降低峰值显存,控制训练吞吐损失。