#蚂蚁百灵##Ling3tiny##开源模型##端侧#
【行业动态:蚂蚁百灵开源Ling-3.0-tiny,7.9B总参、1.3B激活,Mac mini即可跑】
蚂蚁百灵8月11日在Hugging Face开源了轻量级混合推理模型Ling-3.0-tiny。它采用MoE架构,总参数7.9B、每个token只激活1.3B,官方同时提供BF16、FP8和INT4三档权重,适配不同硬件的部署需求。架构上,它把KDA(Kimi Delta Attention)和MLA(多头潜在注意力)按3:1交替堆叠、配128个路由专家的稀疏前馈网络,主打高效。实测显示,它已能在英伟达DGX Spark、Apple Silicon的MacBook和Mac mini等设备上跑,在M4 Pro的MacBook上达到约86到90 token每秒,8K上下文下峰值内存约8.34GiB。
这条的看点是「小」——总参不到8B、激活仅1.3B,却把混合推理、多档量化和端侧部署都做齐了,目标很明确:让一个够用的推理模型跑在个人电脑甚至Mac mini上。它和近期Meta的Muse Glimmer、英伟达的Nemotron Lightning是同一个方向:模型能力往端侧和消费级硬件下沉。对开发者和中小团队,这意味着不必依赖云端和高价显卡,就能在本地跑带推理的智能体,隐私和成本都更可控。国产模型在「小而精、能落地」这条路上的密度,明显在上来。
发布于 北京
