本次直播聚焦昇腾NPU算子性能优化,带来三大实践案例:我们将拆解RmsNormQuant的逐级优化链路,展示访存密集型算子的完整加速方法;深入剖析Scalar如何影响昇腾NPU算子性能,通过四类优化手段降低耗时;揭秘MXFP8/FP4混合精度矩阵乘的Vector+Cube混合核实现方案,展示M值较小场景的性能提升与位操作实践。 http://t.cn/AXXBrDo8 http://t.cn/AXXBrDVa
发布于 广东
本次直播聚焦昇腾NPU算子性能优化,带来三大实践案例:我们将拆解RmsNormQuant的逐级优化链路,展示访存密集型算子的完整加速方法;深入剖析Scalar如何影响昇腾NPU算子性能,通过四类优化手段降低耗时;揭秘MXFP8/FP4混合精度矩阵乘的Vector+Cube混合核实现方案,展示M值较小场景的性能提升与位操作实践。 http://t.cn/AXXBrDo8 http://t.cn/AXXBrDVa