【蚂蚁开源 Ling-3.0-tiny,79 亿参数面向本地智能体】
蚂蚁百灵开源 Ling-3.0-tiny,在 Hugging Face 提供 BF16、FP8 和 INT4 权重,并采用 MIT 许可证。该模型共有 79 亿参数,每个 Token 只激活 13 亿参数,同时支持快速回答与多步推理,主要面向本地部署和智能体任务。
模型使用 3:1 的 KDA–MLA 混合注意力结构:每 3 层 Kimi Delta Attention 后接 1 层 Multi-Head Latent Attention。MoE 部分共有 128 个路由专家,每个 Token 选择 8 个路由专家,再加 1 个共享专家。
官方测试显示,FP8 版在 M4 Pro MacBook 上可达约 86–90 Token/s,在英伟达 DGX Spark 上可达约 100–105 Token/s;8K 上下文时峰值内存占用约为 8.34 GiB。这些数据均为模型发布方自测结果。
