具身智能“闯关” 物理AI泛化不能只靠“肌肉记忆”
【环球网科技报道 记者 李文瑶】“如果只是通过示教进行模仿学习,成功率不管怎样都不会很高。”在2026世界人工智能大会(WAIC)“智启具身论坛”现场,智元合伙人、觅蜂科技董事长兼CEO姚卯青在接受包括环球网在内的媒体采访时,一针见血地点出了当前具身智能行业的核心痛点。

图:智元合伙人、高级副总裁、具身业务部总裁,觅蜂科技董事长兼CEO姚卯青
过去一年,人形机器人从实验室走向工厂产线,行业叙事正从“能不能动”转向“能不能用”。在这场关于物理AI如何翻越Scaling Law“物理墙”的讨论中,数据稀缺、算力瓶颈与路径分歧成为绕不开的三大命题。
数据缺口:与语言模型存在“万倍差距”
如果将机器人的“ChatGPT时刻”定义为在物理世界中“开箱即用”,能跟随开放式自然语言指令完成日常任务,那么当前具身数据的规模还远远不够。
“具身数据规模与语言模型预训练语料存在万倍以上的差距。”姚卯青在采访中透露,要实现对通用物理规律、开放式指令理解与任务规划能力的隐式掌握,至少需要亿小时级别的数据积累,“才能让常见任务的基础成功率达到70%到80%。”
面对这一巨大缺口,行业正探索“开源”与“节流”并行的路径。一方面,遥操作采集的高精度真机数据仍是“数据金字塔”的塔尖,用于后训练阶段的监督微调(SFT);另一方面,低成本、大规模的无本体(No-body)数据采集方案正在兴起。
姚卯青介绍,觅蜂科技通过众包方式采集人类操作视频,成本可降至传统真机摇操的三分之一甚至更低。“今年我们的目标是达到千万小时级的规模,目前已经到百万小时级别了。”但他同时强调,摇操并未被放弃,“它是数据金字塔里最上层的真机部分,在具体场景落地时,后训练依然需要大量摇操数据。”
然而,数据并非“采了就能用”。姚卯青坦言,当前市面上能满足模型精度需求的数据源“说实话不多”,能同时具备大规模运营交付能力的团队更是凤毛麟角。“目前需求还是大于供给,”他表示,数据基础设施建设仍是制约行业发展的关键瓶颈。
算力隐忧:下一代面临挑战
在算力层面,国产端侧平台已在部分场景投入使用,但未来存在隐忧。
姚卯青透露,智元在不少部署场景已依托国产算力平台投放应用。“国产现在在很多应用场景是可以用的状态。”但他同时指出,当前模型参数量偏小——无论开源模型π0.5还是智元的GO-1、GO-2,均在100亿参数以内,能在边缘端实现10到20赫兹的推理频率。
“但如果要进一步形成智能涌现,推进到几百亿参数的MOE架构,现在国内国外最新已投入使用的平台,在算力和显存通信带宽上都存在一些瓶颈。”姚卯青表示,这需要整个产业链向下一代平台推进。
路线分野:技术终局尚未收敛,但语言是必经之路
关于物理AI的技术路径,行业远未形成统一答案。是端到端的VLA(视觉-语言-动作)模型,还是强调物理规律预测的世界模型(WAM)?姚卯青提出了“世界推理动作大模型”(WRAM)的概念。
“动物可以表演杂技,但没法帮你收拾整个家,因为它没法进行任务规划和判断。”姚卯青以此比喻说明,要到达智能涌现的程度,语言知识体系不可或缺。“VLA模型也好,世界模型也好,最终一定是集合了视觉、语言、动作的多模态体系。”
他进一步阐释,未来的具身基座模型必须具备两个特征:一是理解与生成一体化,既能理解指令进行规划,也能生成对未来画面的预测和动作轨迹;二是架构足够简洁,能够通过离散自回归Transformer等可扩展架构,吸收百万甚至千万小时的数据,实现不同模态间的有机融合。
行业预判:2027年底有望看到“涌现时刻”
当被问及物理AI的“GPT-3.5时刻”何时到来时,姚卯青给出了相对明确的判断:“我认为在2027年底到2028年初会看到。”
支撑这一判断的,是数据量从千小时、万小时级向百万小时级迈进过程中,已经浮现的线索。“我们确实看到了很多通用泛化的迹象,无论是指令跟随还是零样本操作泛化。”他说。
过去一年超出预期的,不仅是技术进展,更是商业化落地的速度。“一年前大家认为行业还在做实验室技术展示,但今年我们已经把机器人真正安在工厂里,客户付费,24小时7天高强度运行,硬件稳定,软件做到4个9的成功率。”姚卯青说,从首批项目需要三四个月,到如今二次开发伙伴一两周就能复制落地,边际成本正在快速下降。
对于越来越多大厂入局,姚卯青持开放态度:“更多人来试,能加速并行探索的速度。有些是歪路有些是正路,试过总比没试过好。”他认为,行业需要更多参与者共同推动数据规模的扩大,“1亿小时的数据需要非常多的人一起参与,才能加速在2027年实现。”