发布信息

展会上端不稳杯子的机器人,用的是最先进的AI

作者:本站编辑      2026-07-26 18:44:17     0
展会上端不稳杯子的机器人,用的是最先进的AI

科技AGI约8分钟阅读

「AGI路线」系列第二期

昨天发的系列第一期被后台拿下了,估计是碰到了某些敏感的词汇。简单复一下昨天聊了什么。

第一期讲了两个要点:

1. AGI是什么。你手机里的AI是偏科生,擅长一件事,换件事就歇菜。AGI(通用人工智能)是另一种东西,全科选手,什么都能上手。行业里各家都在往这个方向冲,但路线分叉了。

2. 梁的AGI路线。语言模型,思维链,智能体,持续学习,自我迭代,最后是具身智能。前两步已经走完了,今年在攻关第三步。所有能快速变现的方向他都说不做,只留一条路,把AI的脑子弄聪明。

今天就来看这条路线的最上面那一级:具身智能。


2026年7月的世界人工智能大会,具身智能第一次被抬到跟AI算力同等重要的位置。200多家公司带着300多台机器人来了。展馆从「舞台」变成了「车间」和「门店」。往年那种机器人跳舞、翻跟头、写书法的场景不见了,一个个穿着不同工装的机器人在拧螺丝、搬箱子、缝衣服、抓药、递咖啡。

机器人开始干活了。这是本届大会最核心的信号。

但走完一圈,你会发现一个奇怪的事。

左边:传统编程机器人在拧螺丝,动作精准流畅。右边:VLA模型机器人端杯子、递东西,动作缓慢发抖。

操作最熟练的机器人,反而不太「智能」。那些穿肉串的、配航空餐的、在货架上理货的,动作精准流畅,吞吐量惊人。但你仔细看就明白了,它们的每个动作路径都是工程师提前写好参数的。环境固定,流程固定,传统方案完全够用。换个场景?一行代码都跑不动。

而那些用着最新VLA大模型的机器人呢?VLA翻译过来就是视觉语言动作模型。你告诉它「我渴了」,它能听懂,会去找杯子、接水、端过来。理论上它什么都能做,因为它在用一套通用的智能策略做决策,不是死板的程序。

可是它端起一个纸杯,手在发抖。递杯冰淇淋,比人类小孩还慢。旁边不断有人围观,等它一只手抖了十几秒,终于把杯子递出去的时候,你心里只有一个想法。

这玩意儿连杯子都端不稳,你跟我说这是通用人工智能的方向?

越聪明的机器人越笨拙。越笨拙的机器人越实用。

这就是2026年具身智能最真实的样子。


具身智能为什么重要?因为人最沉重的需求全在物理世界。翻身、喂饭、搀扶、搬运、清洁。数字AI再聪明,也帮不了一位老人从床上坐起来。

但「走出来」比想象中难一万倍。

先说好消息。硬件方面,中国人形机器人供应链已经基本成熟。2025年,国内发布了51款人形机器人产品,全球出货量接近1.8万台,同比增长超过5倍。核心零部件国产化率持续提高。这届展会上,擎天租部署了60台人形机器人在展馆里当工作人员,承担讲解、接待、导航。走路、平衡、上下楼梯,身体层面的运动能力已经不是最大问题了。

但软件完全是另一回事。

机器人「大脑」现在的主导架构叫VLA模型(视觉语言动作)。原理是用大模型把摄像头拍到的画面和人类的语言指令,直接翻译成机器人的关节动作。它确实比传统编程灵活得多。问题是,这些模型绝大多数在虚拟仿真环境里训练,搬到真实世界就会水土不服。

斯坦福大学2026年的AI指数报告给了一组数字,非常刺眼。机器人在仿真测试中的操控成功率是89.4%,切换到真实家庭场景,骤降到12.4%。

不是调几个参数就能追回来。77个百分点的蒸发,是一道物理鸿沟。

打个比方。一个人在驾校场地里练了一千次倒车入库,地上标线清晰,旁边没有干扰车,次次满分。然后他上了真实的早高峰道路。人挤人、车乱窜、电动车从路口钻出来。他慌了,因为他训练的时候没见过这些

机器人也一样。仿真器里的玻璃碎了,是理想化参数。现实里的玻璃碎了,是真碎片。手指捏瓶盖的摩擦力、布料折叠时的形变、鸡蛋的受力分布。这些毫秒级的微观物理现象,仿真器至今算不准,可能永远算不准。

所以回到开头的矛盾。为什么展会上最笨拙的机器人反而用了最先进的AI?

答案就两个字,泛化。

传统编程的机器人是偏科生。把一条产线上的一个动作做到极致精准,没问题。拧螺丝、配餐、理货,任务越固定,它越强。但它永远不会做第二件事。

VLA模型的机器人是全科选手。它理论上什么都能做,因为它理解语言、理解视觉、能自己生成动作。但它什么都能做,自然什么都不精。它端起杯子会抖,不是模型不够大,是它在用一套通用策略应对无穷大的现实变量。每一次操作都是一次「第一次」。

2026年CVPR的一场挑战赛验证了这一点。主流VLA模型在非预设场景下,任务成功率平均跌了超过50%。桌面换个颜色,灯光换个角度,物体换个朝向,模型直接失效。

行业把那个尚未到来的转折点叫做机器人的「GPT时刻」。就像Transformer出来之前,所有语言模型各做各的应用题,直到一套通用架构重新定义了全局。机器人大模型现在也在等这个东西。所有人都觉得会来,但没人知道什么时候来。


光是泛化问题还不够。具身智能要真正落地,至少还卡在四件事上。

第一件,仿真到现实的鸿沟。前面说的77%蒸发,根源是一个数学难题,叫接触问题。一个物体撞上表面,力在毫秒内激增和反转,这种突变在数学上是不连续的,没有任何数值方法能完美模拟。这不是算力的问题。是物理定律本身给这道题设了上限。

第二件,数据困境。训练一个大语言模型,喂它整个互联网的文本就行。训练一个机器人模型,你得让它亲手操作。一个单一场景的训练数据采集成本,少说几百万。美国《科学美国人》2025年底的深度报道说了一句大实话。支撑ChatGPT的大语言模型根本走不了具身智能的「捷径」,因为它们缺少从真实交互中获得的那种知识。高盛2026年调研报告预测,行业要积累数千万小时的高质量真机数据,大规模商业化才可能落地。时间窗口在2027到2029年。

第三件,续航。当前人形机器人充一次电能用90到120分钟。工厂一个班8小时。差太远。固态电池在可预见的未来还到不了消费级。这不是AI问题,是化学问题。

第四件,跨场景迁移。工厂A跑通的模型,搬到工厂B,货架高度不一样了,地面材质不一样了,光照条件不一样了。成功率立马跳水。每次场景切换都要重新采集数据、重新微调。根本谈不上通用。

四道坎,外加泛化那道天花板,横在「会跳舞的机器人」和「能干活的机器人」之间。差距不是一两个百分点,是77个百分点。


理解了这些坎,回头看那个六步楼梯,梁把具身智能排在最后一步的逻辑就清楚了。

前面五步,全在数字世界里完成。语言模型、思维链、智能体、持续学习、自我迭代,每一步都在纯粹的信息空间里推进。到了第六步,才让已经足够聪明的AI走进物理世界。

他的逻辑很简单。数字世界的问题,错了可以重来,成本是一堆电费。物理世界的问题,错了可能砸东西、伤人,成本不可逆。一个在数字世界里连持续学习都做不到的系统,怎么可能在物理世界里通用?

这跟展会上的现象完全对得上。展会上真正干活利索的机器人,全是任务固定、环境固定的窄场景。场景稍微开放一点,VLA就露怯了。说明什么?说明AI的脑子还没到能驾驭身体的程度。

先脑后身。听起来很合理。在2026年的技术现实下,这确实像一条阻力最小的路。

但有一种学术观点,看法正好相反---具身认知理论。核心思想一句话。智能不是在大脑里凭空产生的,它是在身体与环境的互动中长出来的。

看人类婴儿。一个孩子从出生到学会精确抓取,大约要经历一万八千次失败。每一次伸手、抓空、掉落、重来,都在校准他的手眼协调和时空感知。他通过摔跤学会了平衡,通过碰烫的东西学会了因果,通过推门和拉门学会了力的方向。

这些经验不是附加在认知上的装饰品。它们就是认知本身。没有这些物理交互,大脑里空有语言能力,却建不起对世界的直觉理解。

从这套理论看,先在数字世界把脑子练聪明,再给脑子装身体,这条路有一个潜在的盲区。你可能在培养一个从未碰过任何东西的博学盲人。他背书满分,考试第一,但他从来没见过杯子放在桌上是什么感觉,没体验过硬币从指尖滑落,不理解推和拉在物理世界里那些微妙的力差。

第一期里聊过,现在的语言大模型就像一个博学的盲人,能背百科全书,但从未见过真实世界。具身认知理论追问的是更狠的一层。这个盲人永远不可能通过背更多书来获得视力。因为「看」不是一种知识,是一种需要身体参与才能长出来的能力。

《科学美国人》那篇报道说得更直接。大语言模型从文本中学习的一切,跟具身知识说到底就是两种东西。

到底哪种说法对?现在没人说得准。婴儿的学习方式不能直接套给AI,AI的学习方式也不等于人类的翻版。但具身认知理论逼着一个绕不开的问题。

如果有些智能,必须先有身体才能获得呢?


所以回到那个在展会上端杯子的机器人。

它笨手笨脚,不是因为它的AI不够好。恰恰相反,它用的是人类目前能造出来的最先进的智能模型。它笨,是因为它太新了。它的脑子刚学会理解语言和图像,还没来得及学会理解重力、摩擦力和碰撞。

行业正在努力跨越那个「GPT时刻」。VLA之后,已经开始有人试一种叫WAM(世界动作模型)的新架构,让机器人先在脑子里推演「如果我这么做,世界会变成什么样」,再输出动作。方向有了,但离落地还有距离。

梁把具身智能放在路线的尽头。具身认知理论说,也许它不该排在最后,而应该跟前面几步交织在一起。

谁对,现在没答案。但有一件事是确定的。那个在展台上颤抖的机器人手,和AGI之间的距离,大致等于人类对「智能到底是什么」的理解深度。

第一期我们聊了梁的路线图。这一期我们看了这条路最远的那一步。下一期,我们来看这场路线之争的核心战场。语言模型派和世界模型派,到底在吵什么。这事可能决定了接下来十年AI往哪走。


「AGI路线」系列共四期,本文为第二期。第三期预告:LLM vs 世界模型,AGI的路线之争

相关内容 查看全部