华为计算官方宣布,昇腾基于Ascend C编程语言提供完整训推一致算子集,在Qwen3-30B MoE模型上的测试实现Logdiff为0,并通过昇腾亲和的FA算子优化,在Eager模式下获得20%-60%性能收益。
PChome 8月6日消息,华为计算官方宣布,社区实践验证,True-on-policy策略能显著提升稳定性、收敛速度及总奖励。昇腾基于Ascend C编程语言提供完整训推一致算子集,在Qwen3-30B MoE模型上的测试实现Logdiff为0,并通过昇腾亲和的FA算子优化,在Eager模式下获得20%-60%性能收益,为开发者提供高效可靠的强化学习训练方案。

官方介绍,昇腾基于Ascend C编程语言对训推链路中的关键算子做了系统性约束与对齐,核心思路是:让训练与推理在“该累加的地方”走同一套数值路径,主要涉及如下4个修改:统一注意力语义:对齐训练掩码Softmax与推理逐步注意力在有效位置上的计算范围,消除因可见Token集合不同带来的数值差。锁定reduce累加序:约束训练FA、推理PFA / PagedAttention在规约维度上的切分与归约顺序,避免「同模板不同切分」导致的累加不保序。对齐在线Softmax分块策略:统一分块大小与归约节奏,避免decoder侧多块合并Softmax与训练侧分块Softmax不一致。对齐关键路径精度:在Softmax累加等敏感步骤上统一精度转换策略,减少混合精度实现差异引入的尾数误差。

解决方案的整个对齐流程从大的层面来看,主要有三个阶段:训练框架prefill对齐推理框架prefill;训练框架prefill对齐推理框架decode,或者推理prefill对齐推理decode,这一点最关键的是FA能保证相关功能;不同并行情况下的对齐。要解决框架训推不一致问题,主要涉及如下两个修改点:替换没法保证batch一致性/训推一致性的算子;将训推引擎之间的gap对齐,如可能有融合算子和小算子的差异。最终验证效果为Reward正常上升,logdiff稳定为0。