在8月24日小米玄戒技术沟通会上首次公开的玄戒O100原型机,凭借每秒最高330Tokens的端侧推理速度,让本地大模型运行首次接近“零延迟”,现场实测生成速度远超当前旗舰手机。
一、现场实测:接近零延迟的本地生成体验
实测推理速度:原型机内置Xiaomi MiMo端侧模型,现场实测稳定输出约每秒295Tokens,芯片极限可达330Tokens/s,AI性能相比传统方案提升10倍。
首Token延迟:在完全断网、无SIM卡的纯端侧环境下,从按下发送到屏幕出现首个字符仅约0.5秒,几乎感觉不到等待。
响应表现:运行3B参数端侧大模型时,文本生成流畅无卡顿,长文本处理速度实测约275词/秒,全程无需云端参与。
二、硬件底座:1.22TB/s超高带宽打通“内存墙”
带宽跃升:玄戒O100采用行业首款6nm晶圆级垂直堆叠封装+混合键合技术,内存带宽高达1.22TB/s,是传统旗舰手机的16倍。
近存计算架构:通过258万个物理键合节点将DRAM与NPU垂直互连,键合间距仅1.4μm,大幅缩短数据搬运路径,配合14核高带宽NPU实现多核并行。
双芯协同:原型机由玄戒O3主SoC负责系统调度,O100独立承接高强度大模型推理负载,算力分配更高效。


三、体验形态:为端侧AI重构的手机终端
取消影像模块:将传统手机摄像头模组全部移除,主板推翻重制,把空间让给第二颗芯片与散热系统。
主动风冷加持:背部加入最高10瓦功率的主动散热风扇,确保双芯长时间高负载运行不降频。
验证而非量产:该原型机明确不量产,主要用以验证技术可行性,玄戒O100芯片预计2027年正式商用。