LLM 训练 NaN/Inf 故障治理生产实战:用 Non-finite 门禁、GradScaler 证据与 Layer Bisect 隔离首个坏步
大模型训练中的 NaN/Inf 往往在多个步骤后才暴露。本文从非有限值门禁、GradScaler 跳步证据、分布式一致跳过、层级二分定位与坏批次隔离出发,给出可回放、可止损、可恢复的数值异常治理方案。
共 2 篇文章
大模型训练中的 NaN/Inf 往往在多个步骤后才暴露。本文从非有限值门禁、GradScaler 跳步证据、分布式一致跳过、层级二分定位与坏批次隔离出发,给出可回放、可止损、可恢复的数值异常治理方案。
梯度累积看似只是把多个微批次相加,但变长样本、分布式同步、混合精度和学习率调度会悄悄改变等效批次。本文深入剖析 Token 归一化、DDP no_sync、AMP 更新边界与尾部窗口处理等生产级方案,帮助你在 LLM 微调中实现数学一致的梯度累积。