蚂蚁百灵开源 Ling-3.0-flash-VL:原生多模态,视觉反馈闭环是亮点
蚂蚁百灵今天发布并开源了首个原生多模态大模型 Ling-3.0-flash-VL。基于 Ling-3.0-flash 的 MoE 架构拓展,总参数 124B,单次推理仅激活 5.5B,原生支持图像、文本和视频输入,上下文窗口 256K Token。
先看核心创新。这个模型重点探索了三个方向:视觉反哺文本、视觉反馈闭环、高效视觉节点。最有意思的是原生多模态联合训练不仅没有拉低文本能力,反而让文本智能提升了,在 Artificial Analysis Intelligence Index v4.1.1 上比纯文本版提升了 4 分。这个结论和行业普遍担忧相反,说明视觉信息确实能帮助模型建立对现实世界更完整的理解。
视觉反馈闭环是最大亮点。不是简单的看图说话,而是观察执行结果、对比目标、发现偏差、持续修正,把任务从一次性生成变成观察行动验证修正的闭环。这个能力对真实场景应用很关键,因为现实世界的任务往往需要反复调整才能做对。
应用场景也很扎实。视觉反馈编程在 Image-to-WebDev Arena 评测中得分高于 GPT-5.4,用 124B 总参数仅激活 5.5B 的规模做到这个成绩很不容易。GUI Agent 能完成跨工具任务,AI 健康助手已经在蚂蚁阿福落地,医疗报告解读支持跨文档关联和回溯核验。
做科技媒体观察下来,蚂蚁百灵这步棋走得很稳。从文本大模型到多模态,不是简单加个视觉编码器,而是从架构到训练再到应用全栈优化。124B 总参数仅激活 5.5B 的 MoE 架构,部署成本很低,适合大规模落地。蚂蚁的优势在于应用场景丰富,支付宝、阿福健康这些场景可以直接验证模型能力,形成数据和模型的正向循环,这是核心优势。
但也要看到风险。多模态模型的稳定性和可靠性还需要更多真实场景验证,尤其是医疗这种高要求领域。视觉反馈闭环的计算开销可能比单次调用高,长链路任务的成本控制是个挑战,需要优化。模型自己也承认在长尾场景感知推理、长链路 Agent 执行、长程全栈编码上和最佳模型仍有差距。开源有利于生态建设,但也可能让竞争对手快速跟进啊朋友们真的!!!!
#蚂蚁百灵# #Ling3# #多模态大模型# #视觉Agent# #开源# #前沿在线#
