2年8轮融资200亿,深圳这家机器人公司凭什么让四大巨头“排队送钱”?
AI超维实验室,探索AI的无限可能,拆解工具的底层逻辑。 不是资讯号,是实验场。
APEC“数字和人工智能部长会议”现场,30多家全球顶尖科技公司同台——Meta、谷歌、微软、松下、腾讯、百度。但全场唯一获邀发表主旨演讲的具身智能企业,是一家成立不到三年的深圳公司——自变量机器人。更让人意外的是,就在两个月前,这家公司刚完成两个月内四轮融资、估值突破200亿元的壮举。投资方名单拉出来,堪称“中国科技投资史的缩影”——美团、阿里、字节、小米四大互联网巨头轮番领投,中国移动、红杉、IDG、源码资本等30多家机构集体下注。创始人兼CEO王潜,本硕毕业于清华大学,是全球最早在神经网络中提出“注意力机制”的研究人员之一。联合创始人兼CTO王昊,北大计算物理博士,曾主导国内第一个百亿级大模型和最早一批千亿级大模型的研发。但当时他们选择的“端到端”技术路线,在行业里是一条“窄道”“险径”。“一开始,一些资本不相信这套逻辑,我们早期的融资难度比一般公司更大。”王潜说。那时的机器人行业,主流做法是把“大语言模型+动作模块”拼在一起——像搭积木一样,各管各的。机器人要真正理解物理世界,必须把视觉、语言、动作、物理预测全部放进同一个网络里,从零开始联合训练。2024年底,自变量发布了基于VLA架构的第一代模型WALL-A。但团队很快看到了VLA的“天花板”——视觉、语言、动作三个模块拼接在一起,数据每经过一次模块边界就发生一次损耗和延迟。更核心的问题是:VLA只能模仿见过的动作,无法真正理解物理规律。2026年4月,自变量发布全球首个基于“世界统一模型”(WUM)架构的具身大模型WALL-B。这不是WALL-A的升级版,而是从底层架构到训练范式的全面重构。WALL-B把视觉、语言、动作、物理预测等所有能力,放进同一个网络中联合训练。它能理解重力、惯性、摩擦力,面对从未见过的场景也能自主推理。紧接着5月,自变量又发布了具备 “事件级预测能力”的世界模型WALL-WM ——不再按固定时间采样,而是以“事件”为基本思考单位,实现了语言、视觉和动作的更好对齐。至此,自变量成为国内唯一同时获得美团、阿里、字节跳动三家互联网大厂投资的具身智能企业。紧接着,B+轮、B++轮、C轮在两个月内连续完成交割。中国移动连续两轮重注加持,红杉中国、IDG资本、源码资本、达晨财智、中金资本等30余家机构参与。58集团带着家政场景而来,奇瑞带着汽车供应链需求而来—— “场景+资本”的双重绑定,让自变量的技术落地先于行业同行进入实质阶段。当行业从“分散押注”走向“头部收敛”,200亿元估值的交割完成,是一个清晰的信号:具身智能的“马太效应”已经开启。家庭是具身智能的“终极考场”,标准化程度最低、环境最复杂。2026年3月,自变量与58到家合作推出人机协作保洁家庭服务,机器人第一次大规模走进真实家庭。5月,搭载WALL-B的新一代机器人入驻首批志愿者家庭。“报名超乎预期,机器人都不够用了。”王潜说。截至目前,已服务超过1000户家庭,从深圳拓展至北京。在产业端,自变量与国内头部物流企业合作,机器人部署到真实物流分拣产线,稳定实现每小时1200件以上的分拣效率,回流率低至3%以内,7×24小时不间断作业。回到开头那个问题:一家成立不到三年的公司,凭什么让四大巨头排队送钱、让30家机构集体下注?答案或许就藏在王潜的一句话里: “具身智能的下一阶段竞争,本质上还是数据闭环构建的基础模型与模型进化能力的竞争。” 图片声明:本文所用图片多数来自网络公开渠道,仅供分享交流使用,版权属原作者所有。如涉及侵权,请及时联系我们删除。