[{"data":1,"prerenderedAt":424},["ShallowReactive",2],{"content-doc-\u002Fzh\u002Fblogs\u002F20260226-HiFloat8":3},{"_path":4,"_dir":5,"_draft":6,"_partial":6,"_locale":7,"title":8,"description":7,"date":9,"author":10,"tags":11,"body":14,"_type":418,"_id":419,"_source":420,"_file":421,"_stem":422,"_extension":423},"\u002Fzh\u002Fblogs\u002F20260226-HiFloat8","blogs",false,"","HiFloat8：高效低比特推理之路","2026\u002F02\u002F26","全球计算联盟GCC",[12,13],"HiFloat","低精度",{"type":15,"children":16,"toc":408},"root",[17,28,35,40,45,50,55,63,74,86,91,99,104,109,114,122,130,136,183,191,199,204,210,215,223,231,239,247,259,267,275,280,288,296,301,306,311,316,321,326,331,337,342,356],{"type":18,"tag":19,"props":20,"children":21},"element","p",{},[22],{"type":18,"tag":23,"props":24,"children":27},"img",{"alt":25,"src":26},"1","\u002Fblogs\u002F20260226-HiFloat8\u002F1.jpeg",[],{"type":18,"tag":29,"props":30,"children":32},"h2",{"id":31},"关于低比特推理",[33],{"type":34,"value":31},"text",{"type":18,"tag":19,"props":36,"children":37},{},[38],{"type":34,"value":39},"深度学习模型在训练和推理阶段通常使用 FP32 (32 位浮点数)或 BF16\u002FFP16 (16 位浮点数)格式。然而，随着模型规模的不断增大（尤其是大型语言模型 LLM），对计算效率、显存占用和能耗的要求也越来越高。低比特推理（Low-Bit Inference）应运而生，其核心思想是使用更少的比特位来表示模型参数（权重）和中间计算结果（激活值）。最常见的低比特格式包括 INT8 (8 位整数)和 FP8 (8 位浮点数)，如下图一所示。其有如下几点优势：",{"type":18,"tag":19,"props":41,"children":42},{},[43],{"type":34,"value":44},"1、内存减少：将数据类型从 16 位\u002F32 位降至 8 位，理论上可以减少 2x 到 4x 的显存占用。",{"type":18,"tag":19,"props":46,"children":47},{},[48],{"type":34,"value":49},"2、计算加速：降低位宽可以提高计算吞吐量（Operations Per Second）。",{"type":18,"tag":19,"props":51,"children":52},{},[53],{"type":34,"value":54},"3、能耗降低：减少数据传输和计算量，从而降低整体能耗。FP8 作为一种 8 位浮点格式，因其具有比定点 INT8 更宽的动态范围和更强的离群值（Outlier）鲁棒性，成为当前大模型低比特推理的主流选择之一。FP8 主要有两个标准变体：E4M3（4 位指数，3 位尾数）和 E5M2（5 位指数，2 位尾数），分别侧重于精度和动态范围。",{"type":18,"tag":19,"props":56,"children":57},{},[58],{"type":18,"tag":23,"props":59,"children":62},{"alt":60,"src":61},"2","\u002Fblogs\u002F20260226-HiFloat8\u002F2.png",[],{"type":18,"tag":64,"props":65,"children":67},"div",{"style":66},"font-size: 14px;",[68],{"type":18,"tag":69,"props":70,"children":71},"center",{},[72],{"type":34,"value":73},"图一：FP8低比特推理流程示意图",{"type":18,"tag":29,"props":75,"children":77},{"id":76},"图一fp8-量化对细粒度缩放scaling的依赖",[78,80],{"type":34,"value":79},"图一：FP8 量化对细粒度",{"type":18,"tag":81,"props":82,"children":83},"strong",{},[84],{"type":34,"value":85},"缩放(Scaling)的依赖",{"type":18,"tag":19,"props":87,"children":88},{},[89],{"type":34,"value":90},"将高精度数据类型(如 32 位浮点数 FP32)转换为低比特数据类型(如 8 位浮点数 FP8)一般需要进行缩放处理（Scaling）. 假设给定一种量化粒度获得一个数据块记为 X，scaling 的过程是给 X 乘上一个系数，使得所有值比较安全地转化到低比特的表达范围内，这个系数被称之为缩放因子（或者称为 scaling factor），公式（1）和公式（2）描述了量化过程中 Scaling 执行缩放的原理。其中 F8max 是指该 8 比特浮点可表示的最大值（例如 FP8-E4M3 为 448）。Amax 是指 X 中所有数值统计的最大绝对值。公式（1）计算得到的 Scale 变量即等价于缩放因子。公式（2）表示从高精度数据缩放到低比特表达范围内的过程。",{"type":18,"tag":19,"props":92,"children":93},{},[94],{"type":18,"tag":23,"props":95,"children":98},{"alt":96,"src":97},"3","\u002Fblogs\u002F20260226-HiFloat8\u002F3.jpeg",[],{"type":18,"tag":19,"props":100,"children":101},{},[102],{"type":34,"value":103},"FP8 虽然具有浮点数的动态范围优势，但其 8 位表示的精度和动态范围仍然有限。为了最大限度地减少从高精度（如 FP16）到 FP8 量化引入的精度损失，FP8 通常需要采用细粒度的量化（Fine-Grained Quantization）策略，如下图二所示，即引入更多的缩放因子（Scaling Factor） 来调整数据的范围。这种细粒度量化主要体现在以下几个层面：",{"type":18,"tag":19,"props":105,"children":106},{},[107],{"type":34,"value":108},"1、Per-token 细粒度(通常用于激活值)：由于 LLM 中的激活值（Activation）通常在不同的 Token 维度上具有极大的动态范围差异和频繁的离群值。Per-Token 缩放为每个输入 Token（或 Tile）应用一个独立的缩放因子，以确保每个 Token 的核心数据范围能被 FP8 格式有效覆盖，从而保持准确性。",{"type":18,"tag":19,"props":110,"children":111},{},[112],{"type":34,"value":113},"2、Per-channel\u002FPer-Block 细粒度(通常用于权重)：模型权重（Weight）的分布在不同的输出通道（Channel）或权重块（Block）之间也存在差异。Per-Channel\u002FPer-Block 缩放通过对每通道或每块权重应用独立的缩放因子，来进一步降低量化误差，提升模型的推理精度。典型的 Block 大小为 128*128。然而引入大量的 Per-Token\u002FChannel\u002FBlock 缩放因子，会显著增加硬件实现和控制逻辑的复杂性。在推理过程中，需要频繁地加载、存储和应用这些额外的缩放因子，这会引入额外的内存带宽开销和计算延迟。FP8 本身带来的加速效益反而会被这些额外的操作部分抵消。",{"type":18,"tag":19,"props":115,"children":116},{},[117],{"type":18,"tag":23,"props":118,"children":121},{"alt":119,"src":120},"4","\u002Fblogs\u002F20260226-HiFloat8\u002F4.png",[],{"type":18,"tag":64,"props":123,"children":124},{"style":66},[125],{"type":18,"tag":69,"props":126,"children":127},{},[128],{"type":34,"value":129},"图二：常用的几种量化粒度示意图",{"type":18,"tag":29,"props":131,"children":133},{"id":132},"hif8-格式优点无需依赖细粒度缩放",[134],{"type":34,"value":135},"HiF8 格式优点:无需依赖细粒度缩放",{"type":18,"tag":19,"props":137,"children":138},{},[139,141,147,149,154,156,161,163,168,170,175,177,181],{"type":34,"value":140},"HiF8 (HiFloat8) 是一种新型的 8 位浮点格式，它旨在通过优化格式本身的动态范围和精度平衡，来摆脱对复杂细粒度缩放的依赖，从而实现更高效的推理。HiF8 格式的核心优势是其创新的即时可译变长前缀码编码的点位域 Dot 设计。其详细设计示意图如下图三所示。Normal 模式下，HiF8 的数值解析式和传统 IEEE 754 格式一样，是标准的二进制科学计数法表示。为了支持更大的动态范围，HiF8 还采用了不同于 IEEE 754 风格的 Subnormal\u002FDenormal 方案。如图 2 的 Denormal 表达式，当 Dot 域指示该数值为 Denromal 模式时，HiF8 没有指数域，多的 3-bit“尾数”（编码 0~7 八个数值），直接用于扩展 HiF8 的小值指数范围。HiF8 Denormal 模式在 Normal 模式支持的",{"type":18,"tag":142,"props":143,"children":144},"span",{},[145],{"type":34,"value":146},"-15, 15",{"type":34,"value":148},"共 31 个指数的基础上，额外扩展了",{"type":18,"tag":142,"props":150,"children":151},{},[152],{"type":34,"value":153},"-22, -16",{"type":34,"value":155},"共 7 个指数（-23 用于表示特殊值 Zero 和 NaN），综合形成了",{"type":18,"tag":142,"props":157,"children":158},{},[159],{"type":34,"value":160},"-22, 15",{"type":34,"value":162},"共 38 个指数的大动态范围，非常接近 FP16 的",{"type":18,"tag":142,"props":164,"children":165},{},[166],{"type":34,"value":167},"-24, 15",{"type":34,"value":169},"的 40 个指数范围。并且由于",{"type":18,"tag":142,"props":171,"children":172},{},[173],{"type":34,"value":174},"-15, -8",{"type":34,"value":176},"本身是 1-bit 尾数，扩展的",{"type":18,"tag":142,"props":178,"children":179},{},[180],{"type":34,"value":153},{"type":34,"value":182},"的 0-bit 尾数也属于精度渐变，并非跳变。正是由于这种渐变机制：对于具有较大绝对值和较小绝对值（需要更广动态范围）的离群值，它分配更大的指数范围和更少的尾数位；对于靠近一的众数周边的数值（需要更高精度），它分配更多的尾数位。",{"type":18,"tag":19,"props":184,"children":185},{},[186],{"type":18,"tag":23,"props":187,"children":190},{"alt":188,"src":189},"5","\u002Fblogs\u002F20260226-HiFloat8\u002F5.png",[],{"type":18,"tag":64,"props":192,"children":193},{"style":66},[194],{"type":18,"tag":69,"props":195,"children":196},{},[197],{"type":34,"value":198},"图三：HiF8编码示意图",{"type":18,"tag":19,"props":200,"children":201},{},[202],{"type":34,"value":203},"这种设计使得 HiF8 在没有外部缩放因子的情况下，也能更好地覆盖深度学习模型权重和激活值的宽动态范围和高精度需求。它甚至通过 Subnormal Value（非规格化数）编码来扩展动态范围，以更接近 FP16 的覆盖围。由于 HiF8 格式自身提供了足够的动态范围和平衡的精度，对于大多数推理任务而言，它可以直接采用更粗粒度的量化策略，如 Per-Tensor（对整个张量）甚至无缩放（Scale-Free）转换，而无需复杂的 Per-Token\u002FPer-Channel（需在张量子维度维护和索引缩放因子）或 Per-Block(进一步地，在算子层面影响 Matmul 规约连续性，显著降低数据复用与计算吞吐)缩放。这样可以消除大量缩放因子的管理和应用，大幅简化了推理框架和硬件加速器的设计。无需执行频繁的缩放因子查找和乘法操作，降低了内存带宽和计算开销，从而能更充分地发挥 8 位计算的加速潜力。从而能够保证后训练量化（PTQ）过程更简单、更快。",{"type":18,"tag":29,"props":205,"children":207},{"id":206},"hif8-格式推理验证longcat-大模型推理展示",[208],{"type":34,"value":209},"HiF8 格式推理验证:LongCat 大模型推理展示**",{"type":18,"tag":19,"props":211,"children":212},{},[213],{"type":34,"value":214},"为了验证 HiF8 格式在推理效率和准确性上的优势，本工作选取当前最新的美团 LongCat-Chat-562B 模型进行测试(后续会更新更多大模型的推理结果)。LongCat-Chat 采用创新的 MoE（混合专家）架构，旨在以更少的激活参数实现更高的性能，从而大幅提升推理速度并降低成本。其模型的 Attention 模块借鉴 Deepseek MLA 的设计，如下图四所示。其中标绿色模块是本工作在模型推理过程中引入的 Linear 层量化部分，标红色的模块是被引入的 KV Cache 量化部分。此外，其 FFN 部分则是区别于传统的 MoE 大模型，采用 MoE 层和常规的 FFN 层间隔交替使用，如图五所示，标绿色模块是该实验引入的量化部分。对于 MoE 模块，实验中只量化每个专家(expert)对应的 Linear 层，MoE 的路由(router)不参与量化；对于 FFN 层则是量化其对应的 Linear 层部分。",{"type":18,"tag":19,"props":216,"children":217},{},[218],{"type":18,"tag":23,"props":219,"children":222},{"alt":220,"src":221},"6","\u002Fblogs\u002F20260226-HiFloat8\u002F6.png",[],{"type":18,"tag":64,"props":224,"children":225},{"style":66},[226],{"type":18,"tag":69,"props":227,"children":228},{},[229],{"type":34,"value":230},"图四：LongCat Attention模块示意图",{"type":18,"tag":19,"props":232,"children":233},{},[234],{"type":18,"tag":23,"props":235,"children":238},{"alt":236,"src":237},"7","\u002Fblogs\u002F20260226-HiFloat8\u002F7.png",[],{"type":18,"tag":64,"props":240,"children":241},{"style":66},[242],{"type":18,"tag":69,"props":243,"children":244},{},[245],{"type":34,"value":246},"图五：LongCat MoE模块和FFN模块示意图",{"type":18,"tag":19,"props":248,"children":249},{},[250,252,257],{"type":34,"value":251},"上文中给出了 LongCat 模型 HiF8 格式量化部分，整个量化过程都采用的 A8W8，8 即 HiF8 量化格式。本工作首先采用 HiF8 格式对大型语言模型（LLM）进行量化。在简单多选题（Multiple-Choice Question, MCQ）数据集(如图六所示)上的测试结果显示，BF16 的推理准确率与官方论文报告结果基本一致，确认了实验基线的可靠性。在引入 HiF8 量化后，首先采用最简单的 A8W8 直接转换（Direct Conversion） 方案，即激活值（Activation）和权重（Weight）均直接转换为 HiF8 格式（A-直转，W-直转），测试结果如图六所示 （HiF8-A8W8 直转），平均精度仅下降（掉点） 0.36 个百分点，这表明 HiF8 格式即使在不进行任何复杂优化和校准的前提下，也能保持较高的精度。为了进一步提升精度，实验引入了 W-Per-Tensor （W-PTS） 粗粒度量化策略。根据 HiF8 数据格式的特性，其动态范围设计使其对量化范围（Amax）有特定偏好。实验中将权重的 Amax 值设置为 16。通过这一优化，平均精度掉点从 0.36 个百分点进一步缩小至 0.34 个百分点。这证实了利用 HiF8 格式的自身特点进行简单参数调整，即可实现精度提升的可行性。随后，本工作对比了 Per-Tensor 量化（粗粒度）和 Per-Channel 量化（细粒度）对 HiF8 权重部分的影响。 一个关键的发现是：无论是 Per-Tensor 量化 还是 Per-Channel 量化，对于 HiF8 权重的量化处理都可以在离线（Offline）阶段完成，这意味着，这两种量化方案在实际的在线推理性能上没有差距。相比于 FP8 量化需要复杂的 Per-Token\u002FPer-Channel 在线缩放操作，HiF8 的特性避免了推理时引入额外计算开销和内存带宽瓶颈。通过每个 tensor 的 FP32 Scale 值，将其最大绝对值 Amax 缩放到 HiF8 高精度范围上限 16 上去，此时权重可用的指数范围是",{"type":18,"tag":142,"props":253,"children":254},{},[255],{"type":34,"value":256},"-22, 4",{"type":34,"value":258},"，共 27 个指数位，最大程度保证了权重的精度和动态范围，留存信息量极大。",{"type":18,"tag":19,"props":260,"children":261},{},[262],{"type":18,"tag":23,"props":263,"children":266},{"alt":264,"src":265},"8","\u002Fblogs\u002F20260226-HiFloat8\u002F8.png",[],{"type":18,"tag":64,"props":268,"children":269},{"style":66},[270],{"type":18,"tag":69,"props":271,"children":272},{},[273],{"type":34,"value":274},"图六：LongCat在SOTA数据集上的HiF8量化结果",{"type":18,"tag":19,"props":276,"children":277},{},[278],{"type":34,"value":279},"为了全面验证 HiF8 格式在不同推理场景下的鲁棒性，本工作将测试范围扩展到了对精度要求极高的复杂推理数据集，包括数学（如 GSM8K，MATH500）和代码生成（LiveCodeBench）等任务, 如下图七所示。在这些复杂的推理数据集上，此前得出的结论依然成立：HiF8 A8W8 直转（即 A-直转，W-直转）策略依然能确保绝大部分数据集的精度下降保持在 1 个百分点以内。对于极少数精度下降超过 1 个百分点的数据集，本工作探索了一系列性能上无额外开销的细粒度量化策略作为选择，例如 Weight 的 Per-Tensor 或 Per-Channel 量化。用户可以根据任务对精度的敏感程度，灵活选择最佳的量化方案。",{"type":18,"tag":19,"props":281,"children":282},{},[283],{"type":18,"tag":23,"props":284,"children":287},{"alt":285,"src":286},"9","\u002Fblogs\u002F20260226-HiFloat8\u002F9.png",[],{"type":18,"tag":64,"props":289,"children":290},{"style":66},[291],{"type":18,"tag":69,"props":292,"children":293},{},[294],{"type":34,"value":295},"图七：LongCat在带Reasoning SOTA数据集上的HiF8量化结果",{"type":18,"tag":19,"props":297,"children":298},{},[299],{"type":34,"value":300},"在 LLM 推理过程中，KV Cache（Key-Value Cache）的内存占用是影响性能和可部署性的关键因素，尤其是在长序列推理任务中，其内存开销会随上下文长度线性增长。因此，本工作将量化策略进一步扩展到 KV Cache，形成了 A8W8KV8 策略（Activation、Weight、以及 Key\u002FValue Cache 均采用 8 位量化）。目前的实验结果展示，即使 KV Cache 仅采用简单的直接转换（Direct Conversion）方式进行量化、未引入任何额外的缩放或校准操作，绝大部分数据集的精度下降仍然符合 1 个百分点以内的要求。这一结果至关重要，它意味着在通过 A8W8KV8 策略大幅减少内存占用的同时，几乎不损失推理精度，极大地提升了 LLM 推理的整体效率。",{"type":18,"tag":19,"props":302,"children":303},{},[304],{"type":34,"value":305},"尤其需要强调的是，在所有上述的量化策略中，激活值（Input A）始终采用的是 HiF8 直转（Direct Conversion）的方式。这充分体现了 HiF8 数据格式的内在优越性：它凭借其优化的动态范围和精度平衡设计，能够有效地覆盖激活值固有的宽动态范围和频繁出现的离群值，避免了部分 FP8 所需的复杂且耗性能的 激活值 Per-Token 在线缩放操作。这类缩放通常需要在运行时逐 token 对完整激活向量进行统计（如: 跨 channel 在线计算 Amax），并据此动态生成缩放因子。这不仅引入额外的归约与数据访问开销，在典型 LLM 架构中还难以与 MatMul 的归约主循环（常对应跨 channel 方向）高效融合，显著制约推理性能。与之相对的，HiF8 方案在复杂场景下，既能维持高精度，又能实现最大的推理性能加速。考虑 HiF8 具备充足的动态范围，后续仍可进一步探索针对激活值 A 的静态离线量化方案。例如，在部署或校准阶段对 Amax 进行统计，选取合适的缩放参数，以在不引入运行时的额外开销前提下，进一步拓展 HiF8 在特定模型或场景下的适用性。",{"type":18,"tag":29,"props":307,"children":309},{"id":308},"总结",[310],{"type":34,"value":308},{"type":18,"tag":19,"props":312,"children":313},{},[314],{"type":34,"value":315},"HiF8 格式的核心优势在于其创新设计实现了高精度和高效率的解耦，从而超越了传统 FP8 的限制。FP8 格式为维持精度，必须依赖复杂的 Per-Token 在线缩放等细粒度量化（A），这会引入显著的内存带宽和计算开销，削弱了 8 位计算的加速效果。相比之下，HiF8 凭借其优化的渐变精度设计，将量化所需的鲁棒性和动态范围能力内建于格式本身，使得其可以采用最简单的 A8W8 直转策略，甚至在复杂的数学、代码任务以及引入 KV Cache 量化时，仍能将绝大部分数据集的精度损失控制在 1 个百分点以内。这种对细粒度在线缩放的消除，不仅极大地简化了硬件和软件部署，更重要的是，它保证了 HiF8 方案能够最大限度地发挥 8 位计算的潜能，实现更纯粹、更高效、且性能零损失的推理加速。此外，HiF8 应用于推理方面还有以下优化空间：",{"type":18,"tag":19,"props":317,"children":318},{},[319],{"type":34,"value":320},"1、引入动态自适应量化范围（Learned Amax）和精细的混合精度策略，以最小化对精度敏感的复杂任务上的误差，并解决极少数掉点较大的数据集问题。",{"type":18,"tag":19,"props":322,"children":323},{},[324],{"type":34,"value":325},"2、将 HiF8 应用扩展到多模态模型和更广泛的 LLM 训练\u002F微调场景中，并探索其与稀疏化、剪枝等技术结合的可能性，以实现叠加的效率提升。",{"type":18,"tag":19,"props":327,"children":328},{},[329],{"type":34,"value":330},"3、推动 HiF8 格式在主流深度学习框架和硬件平台中的标准化与通用支持，同时优化内存带宽和算子融合，以充分发挥 8bit 节省的潜力。",{"type":18,"tag":29,"props":332,"children":334},{"id":333},"敬请锁定-gcc-ip-栏目-compuwave",[335],{"type":34,"value":336},"敬请锁定 GCC IP 栏目 CompuWave！",{"type":18,"tag":19,"props":338,"children":339},{},[340],{"type":34,"value":341},"GCC 智算产业发展委员会将持续带来「HiF8」系列专题分享，后续将邀请技术专家与联创伙伴持续发掘并向大家呈现 HiF8 在训练和推理中的优势。",{"type":18,"tag":19,"props":343,"children":344},{},[345,347,354],{"type":34,"value":346},"更多 HiF8 联创招募、进展等信息可联系 GCC 智算产发委执行秘书长熊华（",{"type":18,"tag":348,"props":349,"children":351},"a",{"href":350},"mailto:xionghua@gccorg.com",[352],{"type":34,"value":353},"xionghua@gccorg.com",{"type":34,"value":355},"）获取。",{"type":18,"tag":64,"props":357,"children":358},{"style":66},[359],{"type":18,"tag":69,"props":360,"children":361},{},[362,364,368,370,373,375,378,380,383,385,388,390,393,395,398,401,403,406],{"type":34,"value":363},"欢迎参与！\n  与我们共同破浪前行，解锁计算世界双重精彩",{"type":18,"tag":365,"props":366,"children":367},"br",{},[],{"type":34,"value":369},"汇聚全球专家洞见，碰撞多元思维火花",{"type":18,"tag":365,"props":371,"children":372},{},[],{"type":34,"value":374},"聚焦计算前沿突破，捕捉技术创新脉搏",{"type":18,"tag":365,"props":376,"children":377},{},[],{"type":34,"value":379},"这里既有深度产业观察、趋势研判，",{"type":18,"tag":365,"props":381,"children":382},{},[],{"type":34,"value":384},"也有前沿技术探索、创新路径解析",{"type":18,"tag":365,"props":386,"children":387},{},[],{"type":34,"value":389},"让每一份专业表达与先锋探索，",{"type":18,"tag":365,"props":391,"children":392},{},[],{"type":34,"value":394},"都能共振行业、影响未来现在，",{"type":18,"tag":365,"props":396,"children":397},{},[],{"type":18,"tag":365,"props":399,"children":400},{},[],{"type":34,"value":402},"加入 CompuWave",{"type":18,"tag":365,"props":404,"children":405},{},[],{"type":34,"value":407},"与全球计算先锋共探技术边界，共逐蓝海征程",{"title":7,"searchDepth":409,"depth":409,"links":410},2,[411,412,414,415,416,417],{"id":31,"depth":409,"text":31},{"id":76,"depth":409,"text":413},"图一：FP8 量化对细粒度缩放(Scaling)的依赖",{"id":132,"depth":409,"text":135},{"id":206,"depth":409,"text":209},{"id":308,"depth":409,"text":308},{"id":333,"depth":409,"text":336},"markdown","app:zh:blogs:20260226-HiFloat8.md","app","zh\u002Fblogs\u002F20260226-HiFloat8.md","zh\u002Fblogs\u002F20260226-HiFloat8","md",1783069436459]