潘玮哲
26-09-23 04:43 微博认证:PChome.net 执行总编

第六代骁龙8至尊版,首款主频超5.0GHz的移动处理器,端侧支持30k上下文并直接用300亿的模型。这只是单纯的处理器性能的升级么?

为了把应用场景落地,高通联合阶跃、无量火、江波龙干了一件大事:把阶跃StepEdge-Omni 30B-MoE混合专家模型完整部署到端侧——让300亿参数大模型在智能手机上本地跑起来。

为什么是MoE? 传统Dense模型每次推理要激活全部参数,又烧算力又占内存;MoE模型只按任务激活部分"专家模块",容量不减、算力内存却大幅下降——这是大模型从云端"下沉"到手机的关键路径。

到底是如何做到又快又省?
无量火Ember推理引擎:内存需求比行业常规方案降低超50%
NPU+GPU双引擎协同:预填充>330 Token/s,解码>28 Token/s,首字毫秒级出结果,比云端API快数倍到数十倍

江波龙存算协同:模型权重从闪存高效加载,避免大内存被占用

能干什么? 一个完全本地的端侧智能体——读邮件、排行程、同步日历、推荐航班酒店、写回复草稿,全程毫秒级、零上云、数据不出手机。

当3亿参数AI跑在你手里而不是云端,隐私、速度、个性化的体验将迎来质变。端侧AI时代,或许真的来了。

发布于 美国