HiFloat8:高性能训练之路
HiFloat

本期文章将介绍 HiFloat8 高性能训练算法及比较优势。
Float8 单数据格式 FP8/HiF8 训练算法介绍
1.1 Float8 混合精度训练策略
随着预训练模型(尤其是基于 Transformer 架构的大语言模型)参数规模突破千亿级,训练过程面临愈发严重的算力和内存瓶颈,成本极高。在此背景下,8 位浮点逐渐成为学术界与工业界的关键突破方向,特别是在支持矩阵乘加速器的 GPU 和 NPU 上,相对 16 位浮点呈现出显著性能优势。当前推向商用的 Float8 单数据格式主要包括 FP8(E4M3/E5M2)和 HiF8。本节简要介绍 Float8 混合精度预训练的基本原理,方便读者进一步理解后续内容。

在实际训练中 Float8 通常采用混合精度策略,即对计算密集且对精度敏感度较低的模块(如稠密线性层、MoE 专家层、Attention 中 QKV 投影)使用 Float8 计算;而对归一化算子、MoE 门控、优化器等高敏感模块仍保持 FP32/BF16 精度。图 1 展示了 Float8 混合精度训练流程。如图所示在每个 transformer block 的前向与反向计算过程中,矩阵乘相关计算(Fprop/Wgrad/Dgrad)以 Float8 执行,以实现显著的加速与显存节省。图 1 中的 VecOps 模块指不含矩阵乘法的 Vector 操作,例如 Softmax、Residual Add、SwiGLU 激活函数等等。To_Float8 模块是指将数据从高精度 BF16 量化到 Float8 格式。可以看到,激活值 A,权重 W,和激活值梯度 E,在进入矩阵乘单元之前,都先进行了 Per-Tensor Scaling 的操作(也可以是更细粒度 Scaling),然后才 Cast 到 Float8 执行乘法;同时,矩阵计算完成后,输出结果还需要进行 De-Scaling 还原。这是因为现在的语言模型的数据范围极其分散,Float8 通常无法直接覆盖需求的动态范围,因此需要通过缩放来把数据有效值移动到格式有限的表达范围内。而 Float8 的 Scaling 策略和粒度,是混合精度训练稳定性和收敛性所面临的关键挑战,下面将对这部分内容展开讨论。
1.2 Float8 Current Scaling & Delayed Scaling 训练策略介绍

高精度数据转换到低精度一般需要做缩放处理 Scaling,或者称之为量化。假设给定一种量化粒度获得一个数据块记为 X,Scaling 的过程是给 X 乘上一个系数,使得所有值比较安全地转化到低比特的表达范围内,这个系数我们称之为缩放因子(或者称为 Scaling Factor)。现有的量化方法分为 Current Scaling(或者叫 In-time Scaling)和 Delayed Scaling。式(1)和式(2)描述了 Current Scaling 执行缩放的原理。其中 F8max 是指该 8 比特浮点可表示的最大值(例如 FP8-E4M3 为 448)。Amax 是指 X 中所有数值统计的最大绝对值。式(1)计算得到的 Scale 变量等价于缩放因子。式(2)表示高精度数据缩放到低精度表达范围内的缩放过程。

如图二所示,Current Scaling 是指在当前高精度数据 X 的基础上遍历所有数值获得 Amax,可以通过执行 ComputeAmax(如 torch.max())计算。但这种方式的问题是当 X 的规模比较大的时候,Amax 的计算会引入显著的延迟开销。而矩阵乘法只能等待式(1)中的 Scale 计算完成后才能开始,最终会影响端到端性能。如果我们能提前预测当前 X 的 Amax 的近似值,Amax 的精确求解和矩阵乘的计算就可以实现解耦并行执行,从而很大程度减少 Amax 计算对训练性能的影响。这种基于近似的 Amax 来做缩放的策略则是 Delayed Scaling。
Delayed Scaling 的理论原理如式(3)和式(4)所示。与 Current Scaling 不同的是右边多乘了一项安全参数$2^{-N_}$,其中$N_$代表防止上溢的安全阈值参数,例如 FP8 一般设为 3,HiF8 一般设为 8~12。

Delayed Scaling 的核心思想是通过当前数据 X 在历史迭代步中的统计信息来对当前的 Amax 进行近似估计。具体做法是通过建立一个 Amax History Buffer 来缓存 X 在若干历史迭代步中的最大值统计结果。当需要 Amax 时,会从 History Buffer 中选出一个最大值(也可以是其他规则,如最邻近的,和均值)来作为当前 Amax 的估计,并据此完成式(3)与式(4)所定义的缩放操作。与此同时,我们可基于给定的统计间隔参数 Interval 来计算真实的 Amax,并追加到 History Buffer 中。例如,当 Interval=1 时, 表示每次迭代都会计算一次当前 X 的 Amax;而当 Interval=5 时, 则表示每 5 次迭代才计算一次当前 X 的 Amax(中间 4 次不进行统计)。由于 History Buffer 具有固定容量,所以当新的 Amax 追加到 History Buffer 末尾后,最前面的队首信息会被丢弃掉。这样,可以一直用最近的历史信息来估计当前的 Amax。理论上,在 Amax 的近似误差不显著影响训练数值稳定性时,Delayed Scaling 相较于 Current Scaling 具有更优的训练性能潜力,并且 Amax 统计频率越低,其带来的训练性能加速收益理论上越显著。
Float8 块浮点格式 MXFP8 训练算法介绍

最新面向 NVIDIA Blackwell 平台的 MXFP8(Micro-scaling FP8)则进一步采用 1×32 更细粒度的量化,并使用硬化的 UE8M0 格式记录 Scaling 因子。用户可对张量按行或者按列划分成连续块 Block,每个块包含 32 个连续值,这与 Blackwell Tensor Cores 的设计相匹配。其中每个块分配了一个以 E8M0 格式存储的专用缩放因子。图三展示了使用 MXFP8 的预训练流程。其中在前向过程中,激活值 A 和权重 W 分别需要按行和按列进行量化,才能进行后续的乘法。因为 Tensor Core 只能支持左矩阵按行量化,右矩阵按列量化的块浮点输入,进而才能正确完成矩阵乘法运算。在反向过程中,输出值的梯度 E 则需按行和按列分别做两次量化(权重梯度和激活值梯度矩阵乘运算中,E 一个是右矩阵,一个左矩阵),比单数据浮点格式多出了一次量化。同时在反向过程中,还需要对激活值 A 和权重 W 的高精度备份先做转置,然后分别按列和按行再次进行量化(单数据浮点格式不需要)。原因是前向的量化发生在特定方向,MXFP8 张量直接转置后,反向数据不满足 Tensor Core 矩阵乘的输入要求。相比 8-bit 单数据格式训练只需要对 A、W 和 E 三个 Tensor 各做一次量化,MXFP8 在训练流程的关键路径上都需要对三个 Tensor 按行和按列两个方向分别进行量化,这多出的量化操作大幅影响了加速性能。即便 MXFP8 硬化了 E8M0 的 Scale,矩阵乘不会在 K 轴频繁断流,对训练性能有所提升,但也很难弥补由上述训练流程结构性复杂化所引入的性能劣化。从训练流程机理的角度来看,块浮点格式由于其方向敏感的缩放与额外的量化依赖,其端到端训练性能在理论上天然弱于采用粗粒度 Scaling 策略的单数据浮点格式。
Float8 训练性能对比分析

在预训练中常用的量化粒度包括 Per-tensor Scaling 和 Per-block Scaling。如图四所示,Per-tensor Scaling 是指为每个 Tensor 分配唯一的缩放系数,用于量化 Tensor 内全部数值。然而,大型模型的 Tensor 内部往往包含显著不同的数值分布,例如不同注意力头的权重规模不同,SwiGLU 或 MoE Router 的激活函数会产生异常稀疏或极值集中的病态矩阵。Per-block Scaling 将每个 Tensor 划分为更小、更易于管理的连续块,并为每个 Tensor Block 分配专用的缩放因子。缩放机制可以适配局部数值分布而非受极端值主导。这意味着高数量级区域得到准确表示,而不会影响同一 Tensor 内更小值的保真度。现有流行的 FP8 Training Recipe 之一会将 Input 和 Gradient 以 1x128 的 1D Tile 进行量化、Weight 以 128x128 的 2D Tile 进行量化,例如 DeepSeek-V3 或者 Transformer Engine。

MXFP8 为了减少整体溢出风险,将原数据切成包含 32 个值的连续块的粒度来量化。这在保持高稳定性训练的同时引入了额外的反向量化开销,理论上端到端训练性能不如粗粒度缩放的单数据浮点格式。如图五公开资料所示,在 LLAMA 3.1 405B 模型的预训练中,MXFP8 相比纯 BF16 训练带来了约 1.36x 的加速比(预期进一步软件优化的上限是 1.52x),低于 Per-tensor FP8 Current Scaling 的 1.58x 以及 Per-tensor FP8 Delayed Scaling(Interval=1)的 1.62x 加速比。同时,该结果也佐证了 Current Scaling 的训练性能低于 Delayed Scaling。图五结果进一步表明,当 Amax 统计频次 Interval=1 的时候,Per-tensor Delayed Scaling 比 Per-tensor Current Scaling 具有约 4%的额外性能增益。这里 Interval=1 是指第 0 个迭代步计算一次真实的 Amax,第 1 个迭代步复用第 0 步的 Amax 进行缩放,然后更新计算 Amax。第 2 个迭代步复用第 1 步更新后的 Amax 并且再次执行更新,后续迭代以此类推,从而形成“复用—更新”交替进行的统计机制。

另一方面,对于单数据格式而言,量化粒度的进一步细化会削弱端到端训练的加速效果。如图六的公开资料显示,无论采用 Per-tensor Delayed Scaling 还是 Per-tensor Current Scaling,其加速比均高于 Per-block 和 Per-channel(即按行或者按列)。并且随着量化粒度不断减小,例如由 Per-channel 细化至最小的 1D Sub-channel(1×128),整体训练加速比呈持续下降趋势。
综合理论分析与公开数据,可以得出如下结论:在保证训练数值稳定性的前提下,采用粗粒度缩放的单数据浮点格式在端到端训练性能上整体优于块浮点格式。同时,随着量化粒度的不断细化,训练加速比呈现单调递减趋势。另一方面,Delayed Scaling 的训练性能优于 Current Scaling,并且 Amax 的统计频率越低,其带来的端到端训练加速收益越大。
HiF8 对比传统 FP8、MXFP8 的优势
在 Current Scaling 策略下,由于 Amax 由实时数据直接计算,能够准确反映当前激活值的最大幅度,因此不会出现量化上溢的情况。在该设定中,FP8 与 HiF8 在粗粒度下均可实现稳定且等效的训练性能。相比之下,MXFP8 在训练过程中的关键路径上引入了更多的量化与反量化操作,因而带来额外开销,从而使其在训练速度上低于 FP8 与 HiF8 粗粒度 Scaling 训练。图五所示的相对 BF16 的加速比亦验证了该结论:无论是 Per-tensor Current Scaling 还是 Per-tensor Delayed Scaling,其加速性能均显著优于 MXFP8。
在 Delayed Scaling 策略中,Amax 由历史统计值预测而来,可能与实际峰值存在偏差,从而引发低比特量化中的上溢风险。因此,该策略对低精度格式的动态范围提出更高要求。传统 FP8(E4M3/E5M2)指数范围有限(18 或 32 个阶码),E4M3 保证了众数的精度,但是由于动态范围有限,无法很好表达极大值或极小值;E5M2 动态范围相对较大,但整体数据精度低于 4 位有效位的 E4M3。无论 E4M3 还是 E5M2,使用粗粒度 Delayed Scaling 策略,都会降低训练稳定性或者模型的最终质量。HiF8 具有锥形精度特征,在提供更大的指数范围(38 个阶码)的同时仍保持对众数数据的较高精度。基于此,HiF8 能显著降低溢出风险,增强 Delayed Scaling 训练的稳定性,并在确保端到端精度的同时有效提升整体系统效率。
HiF8 更加适用于 Delayed Scaling 的另一个原因是其可支持更大的量化安全裕度。由于传统 FP8-E4M3 由于只有 18 个阶码,因此N**guard往往只能选择 0~3 这样较小的安全裕度,在 X 的数值峰值波动较大的时候发生上溢概率高,容易导致训练跑飞。同时也因为安全裕度小,对历史数据的预测不够稳健,只能在每个迭代步计算一次 Amax 来确保 Amax 的准确性,导致 Amax 计算开销大,时延难以掩盖。相对而言,HiF8 拥有 38 个阶码这更大的动态范围,能够**Nguard允许选择较大的安全裕度,为不准确的历史 Amax 近似当前 Amax 提供了更大的可波动范围,从而大幅提高训练稳健性。此外,较大的安全裕度允许以更低的频率统计更新 Amax(如每 5–20 个迭代步更新一次),并可将 Amax 的计算以通信掩盖方式分摊到多个迭代过程中(将一个 Tensor 拆分为若干等量子 Tensor,分散到 Interval 次迭代中掩盖),在理想情况下可完全掩盖 Amax 的计算时延,做完 Amax 计算完全不影响训练性能**。因此在 Delayed Scaling 框架下,我们可认为 HiF8 在训练精度和 FP8 基本一致的前提下,训练性能和稳定性优于 FP8。同时,由于 MXFP8 的训练流程的复杂度提升,HiF8 训练性能也会优于 MXFP8。
综上所述,HiF8 凭借更大的动态范围、更稳健的量化行为以及更低的系统开销,可为业界提供了更适合工业级训练的大规模混合精度方案。
HiF8 在小规模模型上的 Per-tensor Scaling 预训练实践
5.1 HiF8 Current Scaling 训练
在 Current Scaling 场景下,我们基于高精度格式仿真 HiF8 矩阵乘行为的方式,对 HiF8 在 DeepSeek-3B(裁剪版)上的从零开始预训练进行了系统评估。实验采用 12B tokens 的预训练语料,并使用 Per-tensor Current Scaling 策略;基线为前向与反向均采用 FP8-E4M3 的 FP8 训练流程。实验结果表明,HiF8 的训练损失曲线与 FP8 基线高度一致,几乎完全重叠。同时,在梯度范数(Gradient Norm)方面,HiF8 显示出显著更平滑的迭代轨迹,而 FP8 则呈现明显的毛刺现象,表明 HiF8 提供的更大动态范围有效提升了训练收敛的稳定性(见图七)。
5.2 HiF8 delayed Scaling 训练:学习 FP16 训练的稳定性技术
在 Delayed Scaling 场景中,我们同样通过仿真方式评估 HiF8 的训练效果,采用 Per-tensor Delayed Scaling 策略对 OLMo-1B 进行了从零开始的完整预训练。实验采用 240B tokens 的预训练语料,其中 Amax 的更新频率设为每 5 个迭代步更新一次,即 Interval = 5。其他迭代步复用最近一次更新的 Amax。BF16 完整精度的训练作为对照基线。同时,我们提出了一种 Delayed Scaling 的自动异常检测与校正机制。具体而言,训练初始阶段采用 Delayed Scaling,当系统检测到训练过程出现异常行为(例如出现梯度 NAN)时,立即通过最近的 Checkpoint,重新启动 Delayed Scaling 训练模式(注意:首次启动 Delayed Scaling 迭代,没有历史 Amax,需要用一次 Current Scaling,下一次迭代立即切换到 Delayed Scaling)。该机制有效提升了整体训练稳定性并减少异常传播。结果如图八所示,在 60000 步的迭代中,只在 35000 步的时候检测到了异常,远低于 FP16 反向全局 Loss Scaling 训练策略的异常概率,这进一步说明了 HiF8 Delayed Scaling 训练稳定性非常高!同时 HiF8 的训练损失相较 BF16 的偏差始终低于 0.5%,整体 Loss 曲线与 BF16 基线高度一致。在下游任务评测中,HiF8 相比 BF16 的准确率损失均小于 1%,均值相对 BF16 提升了 0.28 个点,达到了精度无损(Lossless)标准。实验结果充分验证了 HiF8 在 Delayed Scaling 框架下的稳定性与高效性。


综上,我们分别验证了 HiF8 在 Per-tensor Current Scaling 与 Per-tensor Delayed Scaling 两种设置下,在小规模模型完整预训练中的有效性和稳定性。未来,我们将进一步探索 HiF8 搭配 Per-tensor Delayed Scaling 在更大规模大语言模型训练中的性能表现,相关结果将于后续工作中报告。
总结
HiFloat8(HiF8)通过创新的浮点数格式设计,呈现出锥形精度特征,显著扩展了可表示的动态范围,从而在混合精度训练中同时兼具高效计算与稳定收敛的优势。在 Per-tensor/Per-block Scaling 以及 Current/Delayed Scaling 等关键量化组件中,HiF8 均展现出更高的鲁棒性与更低的系统开销。实验结果表明,HiF8 在大规模模型预训练中能够保持与高精度 BF16 相当的收敛性能,并在多项下游评测任务中实现无损或近乎无损的精度表现。在维持与 BF16 持平的训练质量的同时,HiF8 显著提可提升端到端训练效率,展现出了作为下一代大模型训练核心技术路径的潜在价值。
参考文献
敬请锁定 GCC IP 栏目 CompuWave!GCC 智算产业发展委员会持续带来「HiF8」系列专题分享,将邀请技术专家与联创伙伴发掘并向大家呈现 HiF8 在训练和推理中的优势。
更多 HiF8 联创合作、进展等信息可联系 GCC 智算产发委执行秘书长熊华(xionghua@gccorg.com)获取。