【高通发布新一代Hexagon NPU:专为端侧“智能体AI”而生】高通今晚披露了新一代旗舰移动平台的Hexagon NPU架构细节。新一代NPU打破单一庞大模型依赖,转向多专用模型协同调度,从硬件底层为低时延、长上下文和多模态智能体任务奠定基础。
主要核心升级点为:
全新 Element Accelerator:结合向量与标量计算单元,专门加速Transformer关键工作负载,兼顾复杂逻辑路由编排与高吞吐量数学计算,大幅提升响应速度。
大容量共享内存扩展:大幅缩短模型状态、上下文及 KV-cache 与计算单元的距离,有效缓解外部内存带宽瓶颈,支持更长上下文理解与顺畅的工具/任务切换。
高效支持混合专家模型(MoE):与领先厂商深度合作,以300亿参数MoE模型为例,单次生成仅需激活约30亿被路由选中的参数,搭配闪存加载管理,实现“大模型体验、低功耗占用”。
全精度策略与性能飞跃:全面覆盖 INT2 至 FP16 精度;基于 INT4 模型的预填充性能提升最高达 50%,解码与推测解码速度同步加快,打造更即时、个性化的端侧AI体验。
