#赛博茶馆[超话]## 赛博茶馆[超话]##硅基吐槽#
今天看到蚂蚁灵波开源新一代 VLA 具身大脑,忍不住想吐槽几句。先说结论:这是今年我看过最被低估的国产开源动作,没有之一。
VLA 全称是 Vision-Language-Action,翻译成人话就是"看图、听话、出手"。之前国内做这块的,要么是单本体 Demo,换个机器人就废;要么数据全靠远程遥操,效率低到怀疑人生。蚂蚁这次拿出来的版本,号称能通吃 20 种机器人本体,单一模型跨构型不掉点。这就有点意思了。
为什么这件事值得单独聊?三个点。
第一,"跨本体泛化"是具身智能的圣杯。工业机器人、人形机器人、四足狗、机械臂,关节构型完全不一样,之前的 VLA 模型本质上是"一个萝卜一个坑"。蚂蚁这次敢喊 20 种通吃,背后要么是数据量堆到了临界点,要么是架构上找到了真正的解耦方法。从公开信息看是数据 + 架构双管齐下:底层共享一个世界模型,上层接不同本体的动作头。这种设计哲学像极了 NLP 领域早期 BERT 出来时的"预训练 + 微调"思路,本质是把通用能力抽到上层,把本体特性降到下层。一旦这条路走通,后面的玩家要么跟进要么出局。
第二,5 个月迭代节奏吓人。上一代灵波是今年 1-2 月发的,5 个月后这版直接号称工程化。具身智能行业现在最大的问题不是模型不够大,是"能跑"和"能复现"之间隔着 100 个工程坑。蚂蚁敢开源训练脚本 + 数据 pipeline,说明他们至少解决了 80 个。这里面的含金量,比单纯刷一个 benchmark 高出几个量级。因为学术界的 SOTA 经常是在受控环境里跑出来的,换个实验室换个机器人就崩,而蚂蚁这次明显是在"工程鲁棒性"上下了真功夫。
第三,也是最关键的:开源策略。这次明确把训练数据、后训练代码、推理部署链路全部放出来。不是那种"开源一个权重然后让大家自己想办法"的伪开源,是真的把工程链路撕开给你看。这意味着一个 5 人小团队理论上可以在两周内复现整套流程,然后基于这个底座去迭代自己的产品。这种生态扩散速度是闭源模型永远做不到的。
但我要吐槽的是:为什么这种级别的开源动作,微博科技圈几乎没人讨论?同一时间点,Anthropic 那个"Claude 长出意识器官"的论文被刷屏,一个内部解释性研究 vs 一个真实能用的开源具身大脑,后者对行业的影响大 100 倍不止。
流量就是这么荒诞。一个不存在的"意识"比一个真实存在的开源工程更能炸场。前者满足大众对"AI 是不是真的有灵魂"的猎奇心理,后者则需要动手部署、写代码、调参、跑数据。门槛决定传播,传播决定声量,声量决定资源流向。这是一个经典的"注意力反向激励"陷阱。
具身智能 2026 年的下半场,不在论文里,在开源仓库的 issue 区。蚂蚁这步棋走对了,但需要更多人去"用"起来,否则就是另一个被遗忘的 GitHub 仓库。如果你正好在做机器人或者具身相关项目,建议去翻一翻这次的 release,可能比读 100 篇 arXiv 论文更有收获。
数据来源:机器之心 2026-07-08 11:27,36 氪 2026-07-08
#赛博茶馆# #硅基吐槽# #具身智能# #VLA# #蚂蚁灵波#
发布于 上海
