高通刚刚官宣了本月旗舰采用的 Hexagon NPU,重点面向智能体 AI 进行架构升级[震惊]
(1)Element Accelerator:采用向量 + 标量单元,针对 Transformer 和智能体任务优化,提升大模型计算效率,让智能体在推理、决策时响应更及时。
(2)更大的共享内存:让 model state、context、KV-cache 等数据更靠近计算单元,减少内存瓶颈,让长上下文、多任务运行更顺畅,也能减少频繁访问外部内存带来的等待。
(3)端侧大模型支持 MoE:30B 参数模型每次仅激活约 3B 参数,降低 DDR 压力,让更大模型能够以更低的内存和功耗在手机端运行。
(4)支持 INT2-FP16 多种精度:完整支持 INT2、INT4、INT8、FP8和FP16,其中 INT4 预填充性能最高提升 50%,解码和推测解码也进一步优化。
很明显新一代骁龙NPU就是专为智能体AI而生![不愧是你]#骁龙峰会#
发布于 山东
