[{"data":1,"prerenderedAt":348},["ShallowReactive",2],{"content-doc-\u002Fzh\u002Fnews\u002F20260707":3},{"_path":4,"_dir":5,"_draft":6,"_partial":6,"_locale":7,"title":8,"description":7,"date":9,"author":10,"tags":11,"body":14,"_type":342,"_id":343,"_source":344,"_file":345,"_stem":346,"_extension":347},"\u002Fzh\u002Fnews\u002F20260707","news",false,"","低位宽计算点亮大模型效率新路径","2026\u002F07\u002F06","全球计算联盟GCC",[12,13],"ICME","挑战赛",{"type":15,"children":16,"toc":329},"root",[17,28,36,49,57,62,70,76,84,96,101,107,115,120,125,131,139,151,156,162,170,182,194,200,208,213,218,224,232,237,249,255,263,268,273,279,284,292,300,307,314,319,324],{"type":18,"tag":19,"props":20,"children":21},"element","p",{},[22],{"type":18,"tag":23,"props":24,"children":27},"img",{"alt":25,"src":26},"0","\u002Fnews\u002F20260707\u002F0.gif",[],{"type":18,"tag":29,"props":30,"children":32},"h2",{"id":31},"ieee-icme-2026低位宽大模型挑战赛研讨会在曼谷举行",[33],{"type":34,"value":35},"text","IEEE ICME 2026低位宽大模型挑战赛研讨会在曼谷举行",{"type":18,"tag":19,"props":37,"children":38},{},[39,41,47],{"type":34,"value":40},"7月5日下午，",{"type":18,"tag":42,"props":43,"children":44},"strong",{},[45],{"type":34,"value":46},"IEEE ICME 2026低位宽大模型高效计算挑战赛研讨会",{"type":34,"value":48},"在泰国曼谷举行。本次研讨会聚焦大模型低位宽量化、视频生成模型推理与训练等前沿方向，来自高校、科研机构和产业界的优秀参赛队伍围绕挑战赛成果展开集中分享。",{"type":18,"tag":19,"props":50,"children":51},{},[52],{"type":18,"tag":23,"props":53,"children":56},{"alt":54,"src":55},"IEEE ICME 2026 低位宽大模型挑战赛研讨会合影","\u002Fnews\u002F20260707\u002Fimage1.jpeg",[],{"type":18,"tag":19,"props":58,"children":59},{},[60],{"type":34,"value":61},"随着视频生成、多模态大模型和大语言模型规模持续扩大，模型部署面临显存占用高、推理速度慢、训练成本高等问题。低位宽计算正是破解这一难题的重要方向。GCC-HIFloat社区代表赵昀首先介绍了IEEE ICME低位宽大模型量化挑战赛的整体情况，随后7支获奖参赛队伍依次登台，展示了他们在HiFloat等方向上的探索成果。",{"type":18,"tag":19,"props":63,"children":64},{},[65],{"type":18,"tag":23,"props":66,"children":69},{"alt":67,"src":68},"GCC-HiFloat 社区代表介绍挑战赛","\u002Fnews\u002F20260707\u002Fimage2.jpeg",[],{"type":18,"tag":29,"props":71,"children":73},{"id":72},"hust_yao让量化看懂扩散模型的不同时刻",[74],{"type":34,"value":75},"HUST_YAO：让量化“看懂”扩散模型的不同时刻",{"type":18,"tag":19,"props":77,"children":78},{},[79],{"type":18,"tag":23,"props":80,"children":83},{"alt":81,"src":82},"HUST_YAO 团队分享","\u002Fnews\u002F20260707\u002Fimage3.jpeg",[],{"type":18,"tag":19,"props":85,"children":86},{},[87,89,94],{"type":34,"value":88},"HUST_YAO围绕Wan2.2-I2V模型的W4A4量化难题展开分享。他们的重点方案是",{"type":18,"tag":42,"props":90,"children":91},{},[92],{"type":34,"value":93},"Timestep-Aware SVDQuant-GPTQ",{"type":34,"value":95},"：一方面利用SVDQuant中的低秩分支吸收异常激活值，另一方面将扩散模型的去噪过程划分为早期、中期和后期，为不同层、不同阶段搜索更合适的激活裁剪比例；在权重量化上，团队进一步用GPTQ降低4比特权重重构误差。",{"type":18,"tag":19,"props":97,"children":98},{},[99],{"type":34,"value":100},"其创新点在于把“时间感知”引入视频扩散模型量化，使量化参数能够随生成过程动态适配。团队认为视频生成模型的量化不能只看整体统计，还要关注去噪阶段差异、模块敏感性以及视觉质量变化。",{"type":18,"tag":29,"props":102,"children":104},{"id":103},"bits-please用平滑旋转校准稳住4比特视频生成",[105],{"type":34,"value":106},"BITS PLEASE：用“平滑、旋转、校准”稳住4比特视频生成",{"type":18,"tag":19,"props":108,"children":109},{},[110],{"type":18,"tag":23,"props":111,"children":114},{"alt":112,"src":113},"BITS PLEASE 团队分享","\u002Fnews\u002F20260707\u002Fimage4.jpeg",[],{"type":18,"tag":19,"props":116,"children":117},{},[118],{"type":34,"value":119},"BITS PLEASE将技术路线概括为四步：先用SmoothQuant做通道级平衡，减少异常值对量化范围的冲击；再通过Hadamard旋转把激活能量重新分布，让数据更容易被低比特表示；随后按时间步、CFG分支和高低噪声专家建立条件化校准表；最后使用HiFloat4完成W4A4推理。",{"type":18,"tag":19,"props":121,"children":122},{},[123],{"type":34,"value":124},"实验显示，HiSQRot4在VBench多个指标上基本保持全精度质量，图像质量和主体一致性还实现了提升。他们认为，视频扩散模型的低比特量化必须显式处理时步变化、条件分支和噪声专家差异，单一全局量化范围难以支撑高质量视频生成。",{"type":18,"tag":29,"props":126,"children":128},{"id":127},"low-team保护关键边界层hif8模块化量化",[129],{"type":34,"value":130},"LOW TEAM：保护关键边界层，HiF8模块化量化",{"type":18,"tag":19,"props":132,"children":133},{},[134],{"type":18,"tag":23,"props":135,"children":138},{"alt":136,"src":137},"LOW TEAM 团队分享","\u002Fnews\u002F20260707\u002Fimage5.jpeg",[],{"type":18,"tag":19,"props":140,"children":141},{},[142,144,149],{"type":34,"value":143},"LOW TEAM聚焦Wan2.1-T2V-14B的W8A8 HiFloat8量化，提出了",{"type":18,"tag":42,"props":145,"children":146},{},[147],{"type":34,"value":148},"Boundary-Protection",{"type":34,"value":150},"边界保护策略。团队通过分析激活分布发现，模型最前端和最后端的若干模块与中间模块性质不同：前端误差会沿残差结构向后传播，末端误差则会直接影响VAE解码后的画面质量。",{"type":18,"tag":19,"props":152,"children":153},{},[154],{"type":34,"value":155},"基于这一发现，团队保留5个关键边界块为BF16位宽，将其余量化为W8A8 HiF8。队伍的创新点在于不追求“一刀切”地量化所有模块，而是识别最敏感的入口和出口模块进行保护，在效率和质量之间取得平衡。该PTQ方的实验结果案在四项VBench指标上与BF16基线相当或略优。团队也尝试了QAT，但单卡硬件条件下QAT并不一定优于PTQ，所以量化优化不仅是算法问题，也受硬件、训练策略和工程约束影响。",{"type":18,"tag":29,"props":157,"children":159},{"id":158},"ustc-zhaslab从最大值校准走向尾部分布感知",[160],{"type":34,"value":161},"USTC-ZHASLAB：从“最大值校准”走向“尾部分布感知”",{"type":18,"tag":19,"props":163,"children":164},{},[165],{"type":18,"tag":23,"props":166,"children":169},{"alt":167,"src":168},"USTC-ZHASLAB 团队分享","\u002Fnews\u002F20260707\u002Fimage6.jpeg",[],{"type":18,"tag":19,"props":171,"children":172},{},[173,175,180],{"type":34,"value":174},"USTC-ZHASLAB团队的分享是：",{"type":18,"tag":42,"props":176,"children":177},{},[178],{"type":34,"value":179},"Tail-Aware HiFloat4：Wan2.2的W4A4训练后量化",{"type":34,"value":181},"。团队认为激活值往往具有长尾分布特征，少量极端异常值会拉大量化范围，使大多数正常数值只能落在很粗的量化格子里，进而影响生成质量。",{"type":18,"tag":19,"props":183,"children":184},{},[185,187,192],{"type":34,"value":186},"团队借鉴ViDiT-Q思路，将其适配到HiFloat4 W4A4场景中，并将传统的最大值校准替换为",{"type":18,"tag":42,"props":188,"children":189},{},[190],{"type":34,"value":191},"尾部分布感知的百分位校准",{"type":34,"value":193},"。不让极少数异常值决定整个量化范围，而是让更多常见数值获得更细致的表示。该方法较好保留了图像质量和整体一致性，运动平滑度仅轻微下降。团队认为，低比特量化不能只追求压缩率，还要理解异常值来自哪里，以及哪些质量维度最容易被破坏。",{"type":18,"tag":29,"props":195,"children":197},{"id":196},"pacmansmoothquant与mixq双路径协同守住异常通道",[198],{"type":34,"value":199},"PACMAN：SmoothQuant与MixQ双路径协同，守住异常通道",{"type":18,"tag":19,"props":201,"children":202},{},[203],{"type":18,"tag":23,"props":204,"children":207},{"alt":205,"src":206},"PACMAN 团队分享","\u002Fnews\u002F20260707\u002Fimage7.jpeg",[],{"type":18,"tag":19,"props":209,"children":210},{},[211],{"type":34,"value":212},"PACMAN团队针对Wan2.2-I2V-A14B提出W4A4推理量化方案。团队将大语言模型量化思路用在本次比赛：SmoothQuant负责进行全局通道平衡，把激活与权重的动态范围重新分配；MixQ则将少量异常通道单独保留在高位宽分支，其余大部分通道走W4A4计算。",{"type":18,"tag":19,"props":214,"children":215},{},[216],{"type":34,"value":217},"团队的方案在多数VBench指标上相比原生HiFloat4参考方案提升约2个百分点，并将与FP16的差距控制在约2%至3.5%。他们认为，SmoothQuant适合解决整体范围问题，MixQ适合保护局部异常值，两者协同才能更有效应对W4A4量化的不同失效模式。",{"type":18,"tag":29,"props":219,"children":221},{"id":220},"提督消失了个寂寞警惕loss-lies窗口最大值更稳",[222],{"type":34,"value":223},"提督消失了个寂寞：警惕“loss lies”，窗口最大值更稳",{"type":18,"tag":19,"props":225,"children":226},{},[227],{"type":18,"tag":23,"props":228,"children":231},{"alt":229,"src":230},"梯度消失了个寂寞团队分享","\u002Fnews\u002F20260707\u002Fimage8.jpeg",[],{"type":18,"tag":19,"props":233,"children":234},{},[235],{"type":34,"value":236},"“梯度消失了个寂寞”团队聚焦HiF8 W8A8量化感知训练展开分享，关于训练过程中如何估计量化尺度，尤其是延迟缩放策略下避免当前激活峰值突然超过历史尺度而造成饱和截断。",{"type":18,"tag":19,"props":238,"children":239},{},[240,242,247],{"type":34,"value":241},"团队比较了most_recent、exp_smooth、current scaling和max-window等多种amax估计策略，最终采用",{"type":18,"tag":42,"props":243,"children":244},{},[245],{"type":34,"value":246},"64步窗口最大值",{"type":34,"value":248},"、500步BF16 warmup和更低学习率的组合方案。其创新点在于把“稳定尺度”和“训练动力学”作为联合设计目标，而不仅仅看训练损失，因此提出“Loss lies”的经验判断。最终方案在MMLU、HellaSwag、ARC-Challenge等任务上实现接近无损的HiF8 QAT表现。他们的参赛心得是，低位宽训练必须同时控制数值饱和、学习率和知识遗忘问题，单看loss很容易误判模型真实能力。",{"type":18,"tag":29,"props":250,"children":252},{"id":251},"iflybitbrainhifloat8支撑14b视频生成模型低位宽训练",[253],{"type":34,"value":254},"IFLYBITBRAIN：HiFloat8支撑14B视频生成模型低位宽训练",{"type":18,"tag":19,"props":256,"children":257},{},[258],{"type":18,"tag":23,"props":259,"children":262},{"alt":260,"src":261},"IFLYBITBRAIN 团队分享","\u002Fnews\u002F20260707\u002Fimage9.jpeg",[],{"type":18,"tag":19,"props":264,"children":265},{},[266],{"type":34,"value":267},"IFLYBITBRAIN团队带来了基于HiFloat8的Wan2.1 14B视频生成模型低位宽训练研究。团队重点强调了HiF8的核心优势：采用“锥形精度”设计，对靠近零、出现频率高的数值保留更多有效位，对少数大数值则提供更大的动态范围。",{"type":18,"tag":19,"props":269,"children":270},{},[271],{"type":34,"value":272},"队伍在关键计算节点模拟HiF8量化行为，并比较了多种策略。实验基于华为Ascend 910B平台和MindSpeed框架，对Wan2.1-T2V-14B进行千步微调。结果显示，HiF8两种策略的训练损失曲线均与BF16基线高度重合，在精度接近的同时计算开销更低，更适合工程部署。他们建议，低位宽训练要真正走向产业落地，既要有数值格式创新，也要有尺度更新机制、硬件平台和软件栈协同。",{"type":18,"tag":29,"props":274,"children":276},{"id":275},"思想碰撞热烈现场交流气氛浓厚",[277],{"type":34,"value":278},"思想碰撞热烈，现场交流气氛浓厚",{"type":18,"tag":19,"props":280,"children":281},{},[282],{"type":34,"value":283},"专题分享后，现场进入了热烈的交流讨论环节。来自参赛团队、参会高校、科研机构及产业单位的代表围绕低比特量化策略、HiFloat数值格式适配、视频生成模型部署难点、训推效率优化等话题展开深入探讨。多位嘉宾结合自身研究和工程实践，对不同方案的适用场景、技术边界和未来优化方向提出问题与建议。",{"type":18,"tag":19,"props":285,"children":286},{},[287],{"type":18,"tag":23,"props":288,"children":291},{"alt":289,"src":290},"研讨会现场交流","\u002Fnews\u002F20260707\u002Fimage10.jpeg",[],{"type":18,"tag":19,"props":293,"children":294},{},[295],{"type":18,"tag":23,"props":296,"children":299},{"alt":297,"src":298},"研讨会现场观众","\u002Fnews\u002F20260707\u002Fimage11.jpeg",[],{"type":18,"tag":19,"props":301,"children":302},{},[303],{"type":18,"tag":23,"props":304,"children":306},{"alt":297,"src":305},"\u002Fnews\u002F20260707\u002Fimage12.jpeg",[],{"type":18,"tag":19,"props":308,"children":309},{},[310],{"type":18,"tag":23,"props":311,"children":313},{"alt":297,"src":312},"\u002Fnews\u002F20260707\u002Fimage13.jpeg",[],{"type":18,"tag":29,"props":315,"children":317},{"id":316},"技术交流推动低位宽生态走向应用深水区",[318],{"type":34,"value":316},{"type":18,"tag":19,"props":320,"children":321},{},[322],{"type":34,"value":323},"从4比特推理到8比特训练，从视频生成模型到大语言模型，本次研讨会展现了低位宽大模型高效计算的多条技术路径。各支队伍采用的方法不同，但共同指向一个核心目标：在尽可能保持模型效果的前提下，用好低位宽数据格式，让大模型运行得更快、更省显存、更易部署。",{"type":18,"tag":19,"props":325,"children":326},{},[327],{"type":34,"value":328},"本次活动不仅展示了挑战赛阶段性成果，也为HiFloat4、HiFloat8等低位宽数值格式的后续研究和产业落地提供了重要案例。未来，随着硬件原生支持、软件栈优化和算法策略持续完善，低位宽计算有望成为大模型从实验室走向真实生产环境的关键基础设施。",{"title":7,"searchDepth":330,"depth":330,"links":331},2,[332,333,334,335,336,337,338,339,340,341],{"id":31,"depth":330,"text":35},{"id":72,"depth":330,"text":75},{"id":103,"depth":330,"text":106},{"id":127,"depth":330,"text":130},{"id":158,"depth":330,"text":161},{"id":196,"depth":330,"text":199},{"id":220,"depth":330,"text":223},{"id":251,"depth":330,"text":254},{"id":275,"depth":330,"text":278},{"id":316,"depth":330,"text":316},"markdown","app:zh:news:20260707.md","app","zh\u002Fnews\u002F20260707.md","zh\u002Fnews\u002F20260707","md",1785483339223]