【把8B模型塞进iPhone,这家公司让AI速度起飞,功耗省掉80%】
当整个 #AI# 行业还在比拼参数规模、堆算力时,有家初创在相反的方向发力:把模型压缩到只剩 1 比特。 当地时间 3 月 31 日,美国 AI 初创公司 PrismML 发布了一款旗舰模型 1-bit Bonsai 8B。该模式使用 Google TPU v4 进行训练,在接近同等性能的前提下,可将模型权重压缩至单个比特(原生 1 比特架构)。
多项智能基准测试结果显示,与传统 FP16 8B 模型相比,该模型在高保真推理和语音理解能力相当的前提下,内存占用从 16GB 降至 1.15GB,推理速度提升 8 倍,能效提升 4-5 倍。在现有硬件平台上,该模型还能将能耗降低 75% 到 80%。也就是说,该技术以更少的资源完成了相同的工作,并有效降低了能耗成本。
值得关注的是,该公司在三种主流平台跑通了这款模型。根据技术报告,Bonsai 8B 可通过 MLX 或 Metal 接口在 Apple 设备(Mac、iPhone、iPad),也可基于 llama.cpp CUDA 在 NVIDIA GPU ,还可以通过 MLXSwift 或 OpenCL 路径在移动端上运行。
该技术有望催生新的 AI 系统:既能在边缘高效运行,又能在云端经济高效扩展。让 AI 直接在手机、笔记本电脑等消费电子设备本地运行,并有望进一步拓展至数据中心。有助于减少对云的依赖,而是基于该模型直接在设备上执行的复杂 AI 应用程序,进而解锁机器人、可穿戴设备和个人计算应用程序等边缘场景。
戳链接查看详情:http://t.cn/AXICKIgF
