行业资讯
📅 2026/7/29 15:09:13
具身智能的“祛魅“时刻——从翻跟头到真干活,2026年发生了什么
过去几年人形机器人最容易被记住的是翻跟头、跳舞和展台上的精巧操作。到了2026年产业关注点正在向后移动机器人为什么能做出这个动作动作数据从哪里来模型怎样转化为本体能力失败后由谁接管数千台设备产生的数据又如何回到下一轮训练一、数据具身智能最大的瓶颈也是最大的机会2023年前后具身行业对数据的焦虑还很笼统。当时连拿纸巾这类简单动作都缺数据不管是什么样的数据都要采。两三年后简单抓取的数据逐渐得到补充缺口开始向更深处迁移按摩、加油等专用任务灵巧手的长程精细操作以及需要全身协调参与的物理交互。2026年是具身智能数据的规模化元年。据行业 estimates今年具身智能领域的数据与评测需求出现指数级增长整体规模已达到去年的百倍至千倍从过去的数千小时跃升至数百万小时量级。WAIC 2026的另一个新趋势是上游数采厂商占比明显抬升——数据是具身智能的瓶颈所在高质量数据才是拉开模型差距的真正变量。数据的生产方式也在重写。艾欧智能把数据需求分为三段预训练需要规模大、场景丰富的人类数据后训练需要与具体本体、具体任务高度匹配的真机数据机器人进入运营后还要把现场数据持续回流。一个关键的数字对比单席位工作8小时真机数据的有效时长可能不到4小时在操作熟练、流程标准的情况下人的第一人称数据可以达到6小时以上。这个效率差距推动人的第一人称数据迅速升温也吸引了一批做过自动驾驶和大模型数据服务的公司进入具身赛道。二、世界模型机器人的想象力如果说数据是具身智能的燃料那么世界模型就是发动机。具身智能领域对世界模型的定义正在趋于一致。智元合伙人姚卯青认为世界模型的核心本质是能够理解物理世界运行规律的AI系统最重要的功能是预测世界的下一个状态而不是简单地渲染世界的下一个画面。要具备这样的能力需要掌握四项技能理解多模态信息并融合理解环境变化掌握物理规律包括动力学和空间理解具备因果推理能力理解作用力与物体移动的因果关系具备长程推理能力且不会在过程中崩坏。它石智航创始人陈亦伦给出了一个更工程化的定义世界模型可以非常高频地联合预测动作和状态。相较VLA而言VLA告诉机器人下一个动作是什么但世界模型会进一步告诉你如果你做了这个动作世界的状态会发生什么样的改变甚至还会告诉你这样的改变是不是大家想要的。这就构成了经典的强化学习三要素状态、动作和奖励。这种方法的好处是可以灵活地结合监督学习和强化学习让整个任务产生非常高的可完成度和成功率。北京智源研究院发布的智源悟界·RoboBrain Orca则展示了另一个方向。当输入视频、图片、文字指令等任意多模态信息后模型可将视觉、语言、任务意图等多元信号统一整合自主学习物体运动规律、场景演变逻辑、动作因果关联、事件时序关系。它既能推演当前场景走向未来的演化路径也能模拟不同条件下世界发展的多元可能性完成从单一输出预测到全局状态推演的范式升级。三、从展台到产线形态被场景打散WAIC 2026直接拿出了一整个展馆给具身机器人相关企业数量从去年的80多家激增到了200多家。但一个有意思的变化是机器人的形态比去年更加丰富但逻辑一致——按场景反推本体。一位从业者表示凭借一款本体打天下的幻觉被订单砸碎了工业要轮式、家庭要人形、消费要小巧、特种要载重机甲每家都在按场景反推本体形态自然就被打散了。国家地方共建人形机器人创新中心与华为在WAIC 2026上宣告联手打造了全国首个具身智能实训场样板点。该中心首席科学家江磊表示目前具身智能的训练大多在一个固定的场景下这个实训场样板点希望兼顾室内环境与生产现场构建可进化的具身智能全流程开发生态。四、一点判断具身智能正在走出演示区。但距离真正的规模化商用仍有距离——就连强化学习之父理查德·萨顿在WAIC 2026现场都指出当前以大语言模型为代表的AI尚处于非常早期阶段。突破具身智能落地最后一公里需要硬件层、模型层、部署服务层的生态协同。好消息是行业预计今年能看到突破性进展。坏消息是从能看到到能规模化可能还需要好几个今年。