华为昇腾0day适配Kimi K3,昇腾950超节点原生支持模型量化权重

PChome | 编辑: 周奕彤 2026-07-28 11:09:37

华为计算官方宣布,此次Kimi K3一经开源发布,昇腾即实现0day极速适配。同时,昇腾950超节点支持FP8、MXFP8、MXFP4等全系列数值精度格式,原生支持Kimi K3的mxFP4量化权重。

PChome 7月28日消息,华为计算官方宣布,此次Kimi K3一经开源发布,昇腾即实现0day极速适配。同时,昇腾950超节点支持FP8、MXFP8、MXFP4等全系列数值精度格式,原生支持Kimi K3的mxFP4量化权重。

官方介绍,昇腾在训练侧,基于MindSpeed MM在Atlas 800 A3、Atlas 900 A3 SuperPoD上完成减层训练基础功能适配,在算子、并行加速、显存优化等方面进行专项优化;在推理侧,通过vLLM Ascend与SGLang开源推理引擎实现快速部署。

MindSpeed MM推出FSDP+EP+CP多维并行框架,解耦并行与架构,兼容多硬件,融合算子优化与显存管理,大幅提升训练效率。Kimi K3模型采用大参数稀疏MoE架构,内置896个专家,面对海量专家参数使用FSDP框架进行训练时易导致OOM问题。MindSpeed MM引入了EP(专家并行)+FSDP的混合并行策略,通过将专家参数切分至不同加速卡(rank)。单个加速卡上allGather权重量显著降低,减小训练过程中的单卡显存峰值占用。

Kimi K3接入vLLM Ascend/SGLang后,用户仍可沿用vLLM/SGLang的服务接口、调度方式和参数体系。vLLM Ascend支持Prefix Cache、Chunked Prefill、异步调度、PD分离和内存池化等能力,在适配KDA、Gated MLA和LatentMoE新结构的同时保持这些框架能力与使用方式不变,使K3能够无缝进入现有vLLM推理服务体系。

说明:所有图文均来自网络,版权归原作者所有,如果侵犯您的权益,请联系我们删除。

每日精选

首页 手机 数码相机 笔记本 游戏 DIY硬件 硬件外设 办公中心 数字家电 平板电脑