机器人大脑公司眸深智能由95后穆泽林创立,近5亿融资背后:VLA会被世界模型取代吗?

2026-08-19 13:06 来源:整机调校指南

  95后连续创业者穆泽林创立的眸深智能,靠给机器人造“大脑”(世界模型)完成近5亿元Pre-A+轮融资,累计融资已近10亿元。据公开报道,这家公司成立当年就实现经审计回款收入1000万元。[1]

  穆泽林是95后连续创业者,这已是他第三次创业。此前他做过AI智能客服公司,年收入最高约1亿元,后来选择卖掉公司再次出发。这次与首席科学家陈涛讨论后,他给自己定了三个方向:必须做AI、必须做多模态、必须做“按个卖”的产品,最终锁定“机器人大脑”这一形态。[1]

  本轮Pre-A+轮由深报一本基金、东方证券直投基金等领投,老股东超额追投;成立当年即实现经审计回款收入1000万元,累计融资接近10亿元。[1]

  95后靠做机器人大脑拿到5亿,眸深智能凭什么?

  答案不是靠机器人硬件,而是靠“机器人大脑”这个软件底座。具身智能产业里,做本体、关节、灵巧手的公司已经不少,但能同时理解语言、图像和物理规律的“大脑”仍然稀缺。穆泽林选择的“世界模型”路线,正好踩在这个缺口上。

  眸深智能并不是一家“追风口”的公司。穆泽林的选型逻辑有三个硬条件:必须做AI,必须做多模态,必须做“按个卖”的产品。和首席科学家陈涛讨论后,团队把方向锁定在“机器人大脑”这种可以像软件一样交付、又能源源不断产生数据的产品形态。[1]

  这里说的“机器人大脑”,不是传统意义上的工业控制器,而是能感知环境、理解场景、规划动作的AI系统。它的核心价值在于:让机器人不是重复固定程序,而是面对新环境也能自己判断下一步怎么做。

  机器人大脑和VLA到底有什么不同?

  两者的核心区别:VLA更接近“行为克隆”,世界模型更接近“因果推理”。

  当前机器人领域主流的VLA(视觉-语言-动作模型)把摄像头画面、自然语言指令和机器人动作绑定在一起,通过大量数据训练出“看到什么就做什么”的映射。这种方案的优势是端到端、训练直接,但缺点也很明显:泛化能力不足。公开技术讨论中经常提到的例子是,桌子高度一变,模型可能就不会操作,因为它在数据里“记住”的是特定高度下的动作,而不是物理规律。[2]

  世界模型路线则不同。它希望让机器人先理解物理世界的基本规律,比如重力、碰撞、遮挡、运动趋势,再根据当前环境预测接下来会发生什么,并生成动作。支持者认为,这才是让机器人进入开放环境的根本解。

  从技术链条看,VLA解决的是“感知-语言-动作”的对齐,世界模型解决的是“状态-变化-结果”的推演。后者需要更完整的物理建模、更精细的真机数据和更长的研发周期,因此难度也更高。[2]

  行业里“VLA已死,世界模型才是未来”的说法,目前更多是部分从业者的观点,而不是行业共识。穆泽林把世界模型当作主要方向,但他同时强调,这件事的成熟度并不高。[1]

  世界模型现在能落地吗,成熟度只有20%—30%意味着什么?

  能落地,但离大规模复制还很远。

  穆泽林认为,目前整个世界模型的成熟度可能只有20%—30%。在具体场景中部署仍需要约10%的真机数据,一次交付周期需要2—3个月。[1]这意味着,机器人大脑目前的工程化程度仍然接近定制项目:需要根据现场环境采集数据、调整模型、反复验证,而不是像云服务那样开通即用。

“目前整个世界模型的成熟度可能只有20%—30%。”——据公开报道,这是穆泽林对行业现状的判断。[1]

  即便如此,商业化的第一步已经走通。眸深智能成立当年就实现经审计回款收入1000万元,团队已有40余名博士,并与复旦成立联合实验室,采用成建制研发而非依赖个别天才。[1]

  技术要点表

  从融资、技术到团队,眸深智能事件中的关键信息可以拆解为下表:

技术/产品核心指标应用场景影响对象限制条件信息来源
眸深智能“机器人大脑”(世界模型)Pre-A+轮近5亿元;累计融资近10亿元;成立当年回款1000万元未来可能达到1万台至10万台需求的机器人场景机器人本体厂商、具身智能创业公司、投资机构世界模型成熟度约20%—30%,单次交付周期2—3个月据公开报道[1]
VLA(视觉-语言-动作模型)依赖大规模数据训练,泛化能力目前不足桌面抓取、物体操控等操作任务当前具身智能研发团队场景变化可能导致动作失效,如桌子高度变化据公开技术讨论[2]
复旦-眸深智能联合实验室40余名博士,四个研发板块,成建制研发世界模型基础研究、机器人大脑工程化高校科研团队、公司研发体系研究成果转化周期仍需观察据公开报道[1]
世界模型对算力芯片的新需求从短时序识别转向长时序预测与规划机器人训练、仿真环境、边缘推理部署算力芯片平台、云服务商、机器人厂商需要配合真机数据和场景数据闭环据公开市场信息[3]

  拿到近5亿元之后,机器人大脑会先改变哪些场景?

  最先被改变的,可能是那些“量大、重复、但环境会变”的机器人场景。

  穆泽林的商业原则是:只选未来可能达到1万台至10万台需求的场景,拒绝为展厅里的接待机器人做开发。[1]这说明,他瞄准的不是“演示价值”,而是“规模价值”。

  从行业逻辑看,仓库搬运、工业分拣、装配检测这类场景更容易成为切入点:动作相对固定,但又不像流水线那样完全无变化。真机数据可以从这些场景低成本获得,再反哺世界模型训练。需要说明的是,眸深智能尚未公开完整客户名单,具体落地场景仍需以官方信息为准。

  产业链上谁会直接受益?

  第一是机器人本体厂商。机器人大脑成熟后,厂商可以把核心竞争力从硬件参数转移到“大脑”的适配与场景定义上。

  第二是算力芯片平台。世界模型需要处理视觉、语言、物理推演和动作规划,推理负担明显大于传统识别模型,会给高性能AI芯片带来新的增量需求。[3]

  第三是数据服务商。约10%的真机数据比例虽然不高,但数据质量和场景覆盖度仍然决定模型上限,数据采集、标注、仿真合成都会成为重要环节。

  热闹的“机器人大脑”赛道,机遇与风险在哪里?

  机会在泛化,风险也在泛化。

  世界模型的价值,是让机器人从“记住动作”走向“理解环境”。一旦跑通,机器人软件的可复制性会大幅提升,市场规模会从定制项目变成软件平台。但当前20%—30%的成熟度、10%的真机数据比例、2—3个月的交付周期,都说明它仍然处在早期工程阶段。[1]

  穆泽林对竞争格局的观察也值得注意:他认为真正的竞争对手是两三年前就开始研究世界模型的团队,“国内外就那么几个”;2026年以后才入局的多是追风口。[1]这意味着,资本涌入未必能立即换来技术代差,时间窗口比融资数字更关键。

  关注这条赛道,需要盯住哪些风险?

  • 技术成熟度:世界模型成熟度仅20%—30%,距离硬件产品规模化仍有距离。
  • 数据成本:部署仍需约10%真机数据,数据采集和标注成本不低。
  • 交付效率:一次交付周期2—3个月,意味着商业模式可能偏项目制,毛利率和扩张速度会受影响。
  • 竞争门槛:真正有积累的团队可能只有几家,新入局者容易变成追风口。[1]

  舆论场在争论什么?

  行业里“VLA已死,世界模型才是未来”的说法,属于部分从业者观点,不是行业共识。穆泽林的“国内外就那么几个”的判断,也只是创始人视角,需要更多公开数据验证。另有公开技术讨论认为,VLA擅长具体操作,世界模型擅长环境推演,两者未来可能共存甚至融合。[2]

  你可能还想搜:95后靠做机器人大脑拿到5亿

  95后靠做机器人大脑拿到5亿,说的是哪家公司?

  眸深智能。95后穆泽林创立,做机器人大脑/世界模型,近日完成近5亿元Pre-A+轮融资,累计融资近10亿元;成立当年经审计回款收入1000万元。团队有40余名博士,并与复旦共建联合实验室。据公开报道。

  世界模型和VLA有什么区别?

  VLA是视觉-语言-动作模型,擅长把感知映射成动作,但泛化不足;世界模型试图理解物理规律后再行动。据公开报道,目前世界模型成熟度约20%—30%,部署仍需约10%真机数据。二者谁会胜出尚无官方定论。

  眸深智能拿到近5亿元后会怎么用?

  尚无官方详细规划。据公开报道,创始人只选未来可能达到1万台至10万台需求的场景,拒绝展厅接待机器人;公司已有40余名博士,研发仍是重心。后续资金使用需以官方实时信息为准。

  后续关注什么?

  对关注AI和机器人的科技从业者而言,“95后靠做机器人大脑拿到5亿”带来的启示不是“风口又来了”,而是“下一个平台级机会可能出现在AI的物理世界理解层”。如果只把世界模型当成一个大号VLA,可能低估它;如果把它当成马上能量产的通用大脑,也可能高估它。

  • 眸深智能是否会公布具体落地场景和客户数量。
  • 世界模型能否把交付周期从2—3个月压缩到数周。
  • 融资后的团队扩张是否持续围绕世界模型研发而非市场投放。
  • 是否会出现开源世界模型,降低整个行业的部署门槛。

  #95后创业 #眸深智能 #机器人大脑 #世界模型 #具身智能