阿通今年骁龙新旗舰的预热来到了第三趴:NPU。
相比很多人了解更多的CPU和GPU,NPU的预热就相对低调了不少,毕竟对这个模组有直观印象的人就少了很多。
简单说,这代新NPU主要针对智能体化应用做了大幅度的增强。
新加入的名为“Element Accelerator”加速器单元,就是之前张量单元的新名字,它主要面向生成式AI和智能体AI两项应用的推理工作负载做了强化。
其与向量单元和标量单元配合,可以保证移动端能效的前提下,更快完成大模型关键运算,更快完成推理,输出Token,让智能体响应速度更快。
存算一体或近存运算,是AI处理器的重要特征,它能让这个模组运行大模型更快,且减少主内存的调用,节约功耗和减少延迟。
新一代的Hexgan NPU大幅度扩展了共享内存的容量,让多模型状态、上下文信息和KV-cache数据存储在更靠近加速器的位置,缓解内存瓶颈,让智能体在处理更长上下文、调用更复杂工具以及执行更多并发任务时响应更快。
AI这玩意儿只有硬件强不够,高通AI软件栈这次也做了相应的匹配升级,其内存和模型厂商合作,引入混合专家模型(Mixture-of-Experts,MoE)构建新一代终端侧AI架构。
一个300亿(30B)参数的MoE模型在保持数百亿参数规模可用的同时,在NPU上每次生成一个Token仅需激活约30亿(3B)个被路由选中的参数,对计算负载和内存带宽来说,都是好事情。
总结就是按需激活,而不是简单粗暴全部跑一次,毕竟这是端侧,能源供应是有限的。
跑得更快,用得更省,智能体执行效率更高,这是行业方向,目前看高通在NPU的针对性改动还是挺多的。
发布于 德国
