行业资讯
📅 2026/8/7 11:42:31
物理 AI 产业破局:人形机器人路径反思与仿真训练基建化趋势
【摘要】基于 A16Z 对李飞飞及 SanaX 联合创始人李芸竹的访谈核心判断拆解人形机器人路线的技术本质与阶段错配问题对比物理 AI 与虚拟 AI 的底层训练逻辑差异论证仿真训练与数字评测体系的核心价值梳理机器人产业三阶落地路径为技术从业者提供完整的产业趋势参考与技术选型依据。引言大语言模型的快速迭代让行业对物理世界的 AI 落地产生了过高预期人形机器人成为资本追捧的热点赛道甚至出现 “不做人形就拿不到投资” 的行业惯性。热闹叙事之下物理 AI 的真实发展节奏、技术瓶颈与落地路径始终缺乏清晰的共识标尺。近期知名投资机构 A16Z 对华人 AI 科学家李飞飞及其收购的机器人公司 SanaX 联合创始人李芸竹进行了深度访谈。李芸竹曾是李飞飞指导的博士后二人从技术本质与产业规律出发提出了一系列反行业共识的判断包括人形机器人未必是最优解、物理 AI 训练逻辑完全不同于 ChatGPT、仿真数据在推演场景价值高于真实数据、训练与评测基建重要性超过机器人本体。本文以二人访谈中的核心观点为主线结合产业现状与工程实践展开深度拆解覆盖路线选型、数据体系、评测基建、商业化节奏等核心问题适合机器人算法工程师、AI 架构师、产业投资人和技术管理者阅读。一、路径反思人形机器人并非物理 AI 的最优解1.1 李飞飞人体形态是进化折中人形路线对应最高技术难度针对行业普遍追捧的人形机器人路线李飞飞从生物进化的底层逻辑给出了不同判断。她提出人体形态并非 “最优设计”而是自然进化形成的通用妥协方案。“如果人类唯一的任务是爬树我们会进化出完全不同的手指。正是因为我们什么都要会一点所以人类才会长成现在这个模样。这个模样是一个样样通但样样不精的妥协设计。它存在的理由是应付野外那种完全不可控的环境。”从工程视角看人体结构的核心优势是泛化性而非单一任务效率。为了适配野外完全未知的生存环境进化牺牲了单一任务的极致性能换取了应对各种突发情况的适应能力。这种设计逻辑对应的是技术难度最高的问题域。李飞飞明确指出做人形机器人不是技术方向错误而是一上来就选择了地狱级难度的路径。用最通用的身体结构挑战最不可控的开放环境这是机器人领域最难解的问题甚至不一定是当前阶段解决产业需求的正确方式。直接押注人形机器人本质是跳过产业发展的中间阶段直接冲击终局场景大概率会拉长商业化落地的整体周期。行业当前的普遍误区是将 “通用机器人” 与 “人形机器人” 划上等号。通用的核心是任务泛化能力而非形态拟人化。工业机械臂、轮式移动机器人、四足机器人都可以在对应场景下实现多任务通用作业只是适用的环境边界不同。形态选择应当匹配落地场景的结构化程度而非单纯追求拟人化的视觉表达。1.2 李芸竹产业落地遵循三阶路径人形叙事存在阶段错配关于机器人产业的落地节奏李芸竹提出了清晰的三阶划分框架这一框架也成为判断人形路线合理性的核心标尺。她认为机器人的商业化落地应当遵循从易到难的分层路径逐步渗透不同结构化程度的场景。第一阶段是全结构化环境典型代表是汽车生产流水线。这类场景中所有物体位置、运动轨迹、环境参数完全可控变量边界清晰相关自动化技术数十年前就已经成熟是机器人应用最广泛的领域。第二阶段是半结构化环境典型场景包括仓储物流、餐厅后厨、酒店配送。这类场景的整体框架固定但存在动态变量比如仓库里的货物位置、餐厅里的行人动线需要机器人具备一定的环境感知与动态调整能力。当前全球机器人产业正处于从第一阶段向第二阶段渗透的关键周期。第三阶段是完全非结构化环境典型场景为普通家庭、开放街道。这类场景没有固定规则环境变量高度随机对机器人的泛化能力要求极高也是人形机器人叙事对应的核心场景。李芸竹的核心判断是当前行业正从第一步往第二步走而人形机器人的叙事直接把故事讲到了第三步。这种阶段错配导致大量资源投入到短期无法落地的技术方向而半结构化场景的真实产业需求反而得不到足够的技术供给。半结构化场景的机器人并不是传统工业自动化的简单升级。传统工业自动化依赖固定编程只能处理预设内的任务半结构化场景的机器人需要具备感知、决策和微调能力核心差异在于是否具备应对环境动态变化的自主能力二者的技术栈存在本质区别。1.3 能效约束从人脑 30 瓦到系统工程的长期挑战针对主持人提出的 “机器人能否达到人类体力劳动能耗效率” 的问题二人分别从系统工程与生物基准两个维度给出了判断共同指向同一个结论实现人类级能效需要极长的技术周期。李芸竹从工程视角指出这一目标需要很长时间才能实现。机器人是典型的复杂系统工程需要从硬件、软件、大脑算法一直抠到末端执行器的细节。“机器人是系统工程要从软硬件一直抠到手指的摩擦系数细节太多了。”每一个细节的优化都需要漫长的迭代不可能通过单点技术突破实现整体能效的跃升。李飞飞则从生物基准的角度补充了佐证数据进一步拉低了行业的短期预期。“人脑功率只有 30 瓦就连已经高速发展了四年的大模型距离这个效率还有很远的距离。机器人起步更晚所以就更遥远了。”能效约束直接决定了人形机器人无法在短期内实现大规模商用。当前人形机器人的续航普遍在 2-4 小时负载能力与作业效率远低于同成本的专用机器人在真实生产场景中不具备经济优势。只有当电池技术、驱动技术、智能算法的能效同时实现量级突破人形机器人才有可能进入实用阶段。能效不是可以通过算法优化快速解决的问题而是贯穿整个产业发展周期的底层约束。二、底层分野物理 AI 与虚拟 AI 的训练逻辑本质不同2.1 两类 AI 的核心边界定义访谈中二人首先明确了两个核心概念的边界这是所有后续判断的基础。行业很多观点认为大模型的爆发会快速传导到机器人领域本质是混淆了两类完全不同的 AI 形态。第一类是虚拟 AI也就是大众熟知的大语言模型、多模态模型。其输入输出均为数字信息核心能力是处理文本、图像、音频等数字内容所有的运算与交互都发生在数字空间内。ChatGPT 等生成式工具都属于虚拟 AI 的范畴。第二类是物理 AI也可称为机器人大脑、具身智能。其输出是物理世界的动作指令核心能力是感知三维环境、执行物理操作、与真实物体交互所有的决策最终都会作用于真实物理世界。二者最核心的区别在于交互对象的不同。虚拟 AI 的交互对象是数字信息规则由人类定义状态可以随时回退物理 AI 的交互对象是真实物理世界遵循客观物理定律动作一旦执行就无法完全撤销。这一底层差异导致二者的训练逻辑、迭代方式、容错机制存在本质不同。很多行业观点认为大语言模型的爆发会快速传导到机器人领域物理 AI 会复制大模型的增长曲线。这种判断忽略了两类 AI 的底层差异本质是用虚拟 AI 的发展剧本套用到物理 AI 上。2.2 数据供给差异从互联网免费教材到物理动作逐次采集数据是 AI 能力的基础两类 AI 的数据供给能力存在天壤之别这也是物理 AI 发展速度更慢的第一个核心原因。大语言模型的训练数据来自整个互联网公开的文本、代码、网页内容都可以作为训练素材数据获取成本极低且可以实现近乎无限的供给。正是这种海量免费的数据供给支撑了大模型在几年内的快速迭代。物理 AI 的训练数据则完全不同。每一条训练数据都对应一次真实的物理动作要获取 “机器人叠衣服” 的训练数据就需要真实的机器人实际完成一次叠衣服动作。当前主流的数据采集方式是操作人员穿戴外骨骼设备进行遥操作采集效率甚至低于人类手动完成任务的速度。访谈中对此做了非常形象的总结虚拟 AI 的教材是现成的而物理 AI 的教材得一个字一个字手抄。二者的供给效率差了数个数量级。除了采集效率数据的维度复杂度也完全不同。同样是 “拿起杯子” 这个动作杯子的材质、重量、形状、表面摩擦力环境的光照强度、背景纹理、桌面倾斜角度都会影响动作的成功率。每一个变量的变化对机器人来说都是全新的样本需要单独学习。如果靠真实采集覆盖所有变量组合数据成本会高到无法承受。2.3 容错机制差异从可修正文本到不可逆物理动作除了数据供给容错成本的差异同样关键这是物理 AI 发展更慢的第二个核心原因。虚拟 AI 的输出是文本或数字内容出错的影响有限。哪怕是生成了错误的代码、错误的分析结论在产生实际影响之前都可以由人工检查修正。人类可以作为虚拟 AI 的安全缓冲层在输出落地前完成校验与纠错。物理 AI 的输出是物理动作绝大多数动作的结果都是不可逆的。抓取力度过大可能捏碎玻璃杯移动路径偏差可能撞倒货架平衡控制失误可能导致机器人摔倒损坏设备甚至伤及人员。这些错误一旦发生就会造成真实的财产损失甚至安全事故不存在前置的人工校验缓冲。访谈中对此的判断非常直接对于虚拟 AI 来说人可以当成安全垫但机器人没有这个安全垫。“机器人的输出不是文字你要知道绝大部分动作的结果都是不可逆的所以错一次可能就是打碎东西伤到人造成不可逆的损失。”容错成本的差异导致物理 AI 对模型可靠性的要求远高于虚拟 AI。大语言模型可以接受 80% 的正确率剩下的由人工补全但工业场景的机器人往往需要 99.9% 以上的任务成功率否则就会因为故障成本过高而失去商用价值。可靠性要求的量级差异决定了物理 AI 的迭代周期必然远长于虚拟 AI。2.4 访谈核心判断物理 AI 无法复制大模型的爆发节奏综合数据供给与容错机制两个维度访谈给出了明确的产业判断虚拟 AI 发展这么快可以说是奇迹而这个奇迹建立在两个前提上数据无限、错了能改。物理 AI 两个前提都没有这就是机器人的进步大概率会比 ChatGPT 类虚拟 AI 慢得多的主要原因。这一判断的现实意义是纠正行业普遍存在的速度幻觉。很多从业者参照大模型的迭代速度规划机器人路线预期 3-5 年就能实现通用人形机器人落地。从底层逻辑看这种预期严重偏离了技术发展的客观规律。物理 AI 的技术迭代速度大概率会远慢于大语言模型的发展节奏行业需要对发展周期有更理性的预期。快速提升物理 AI 的数据供给效率当前最可行的解决方案是仿真训练。通过数字仿真生成合成数据可以大幅降低数据采集成本提升数据供给规模这也是当前全球机器人行业的主流技术方向更是李飞飞团队重点押注的技术路线。三、破局核心仿真数据的价值定位与工程落地3.1 李飞飞仿真是智能的必要组成而非权宜之计机器人圈长期流行一种刻板认知仿真终究失真真实数据才是王道。很多人将仿真视为真实数据不足时的权宜之计是退而求其次的降本方案。李飞飞在访谈中直接反驳了这一认知提出了一个非常深刻的判断有一个重要的场景真实数据搞不定只能靠仿真数据这个场景就是推演。推演指的是将没有发生过的事、不敢让它发生的事、凑不齐条件让它发生的事先在虚拟环境中预演一遍。李飞飞举了体育竞技的例子教练备战世界杯比赛本质就是沙盘推演因为比赛还没有发生所以没法收集真实数据。“人类的智力本身就是大量依赖脑子里的仿真和推演所以仿真不是省钱的权宜之计而是智能的必要组成部分。”这一定位的转变是理解仿真技术价值的核心。仿真不是因为真实数据太贵才用的替代品而是智能本身的核心构成要素。高级智能的核心标志就是具备对未发生事件的推演能力而仿真就是机器实现推演能力的载体。工业实践已经验证了这一逻辑。李飞飞在访谈中提到头部自动驾驶企业官方披露其训练体系中使用了数十亿小时的仿真数据仿真数据的比重比真实路测数据还高。自动驾驶属于复杂度最低的移动机器人品类尚且高度依赖仿真训练更复杂的操作类机器人对仿真的需求只会更高。推演能力是高级智能的核心特征而仿真就是机器的推演载体。这一定位决定了仿真技术不是过渡方案而是物理 AI 长期发展的核心基础设施。3.2 李芸竹仿真无需精确还原核心是覆盖世界可能性针对行业长期纠结的 “仿真失真” 问题李芸竹给出了非常干脆的回答根本不用破。她提出仿真的目的本来就不是精确模拟真实世界的每一个细节而是覆盖世界的可能性。如果追求 1:1 精确还原真实环境不仅技术成本极高而且训练出来的模型只会适配这一种特定环境换一个场景就会失效。正确的技术路线不是追求极致还原而是抓住问题的本质结构然后在数字世界里做海量随机化。具体实现方式是域随机化技术在仿真环境中对光照、摩擦、地形、物体属性等变量做几万种组合的随机变化让机器人在各种不同的参数环境下完成粗粒度训练然后再用真实数据做精细化的对齐。“仿真只需要抓住问题的本质结构然后在数字世界里做海量随机化用这种方式让机器人完成粗练然后再跟真实世界做精细化的对齐。”李芸竹特别强调这不是说真实数据不重要真实数据依然很重要。真实数据和仿真数据是分工关系不是取代关系。仿真负责大规模粗训练、覆盖边界场景、降低试错成本真实数据负责基准标定、精细化对齐、最终效果验证。二者各司其职共同构成完整的训练体系。好的仿真训练不是让模型适应完美的虚拟环境而是让模型适应不完美的真实世界。通过海量的随机化训练模型会对环境参数的波动产生鲁棒性部署到真实环境时就能自然适配真实世界的参数差异大幅降低虚实迁移的难度。当然域随机化也有其边界。随机化的参数范围必须符合真实物理规律不能出现违背物理常识的设定否则会训练出错误的策略。同时核心物理参数的基准值需要通过真实场景标定确保随机化的区间覆盖真实场景的波动范围。3.3 虚实闭环Real-to-Sim-to-Real 的工程架构结合二人的技术判断当前主流的仿真训练落地路径是 Real-to-Sim-to-Real 的闭环架构也是 World Labs 与 SanaX 技术整合后的核心体系。整个流程分为三个核心阶段第一阶段是 Real-to-Sim也就是将真实世界搬进数字空间。通过三维重建、物理参数辨识等技术把真实场景中的机器人本体、操作物体、环境结构转化为数字孪生体确保仿真环境的核心物理参数与真实场景对齐。这一步的核心不是 100% 还原每一个视觉细节而是抓住影响任务结果的核心物理参数。第二阶段是仿真内训练。在构建好的数字环境中对光照、摩擦系数、物体形状、位置偏差等变量做海量随机化处理生成数万甚至数十万种不同的场景组合让机器人策略在虚拟环境中完成大规模试错训练。这一阶段的训练成本极低可以快速覆盖各种边界情况完成模型的粗粒度训练。第三阶段是 Sim-to-Real也就是将仿真训练好的策略部署到真实机器人上通过少量真实数据完成精细化校准同时将真实运行中的失败案例回传到仿真体系反向优化仿真环境的参数形成持续迭代的闭环。3.4 仿真与真实数据的分工边界结合访谈中的判断可以清晰梳理出两类数据的分工边界避免行业常见的非此即彼的认知误区。数据类型核心优势适用场景核心局限仿真数据成本低、速度快、无风险、可覆盖极端场景粗粒度训练、边界场景覆盖、大规模参数搜索、评测验证无法完全替代真实物理细节需要真实数据对齐真实数据物理真实性高、参数准确基准标定、精细化对齐、最终效果验证采集成本高、速度慢、极端场景复现难、存在安全风险仿真数据的核心价值是把所有可以在虚拟空间完成的试错都前置完成最大程度降低真实世界的试错成本。真实数据的核心价值是守住物理真实性的底线确保最终部署的可靠性。二者是上下游的协作关系而非竞争替代关系。仿真训练出来的模型到真实环境中的性能衰减幅度取决于场景复杂度和仿真质量。在简单的结构化场景中经过良好域随机化的模型真实环境成功率可以达到仿真环境的 80% 以上在复杂的非结构化场景中性能衰减会更明显通常需要更多的真实数据做微调。不存在完全零衰减的虚实迁移这是行业的客观现状。四、产业重构训练与评测基建的行业价值4.1 李芸竹数字评测体系是被低估的行业迭代核心访谈中提出的第四个反认知是训练场和考场甚至比机器人本身更重要。其中训练场的价值比较容易理解而考场也就是评测体系的价值长期被行业严重低估。李芸竹从工程实践的角度指出了当前行业的痛点假如手里有两个机器人大脑想知道哪个干活的成功率更高如果在真实世界做测试机器人得一遍一遍真跑又慢又贵又危险。但如果在仿真世界里做测试又快又便宜绝对不会有任何危险。“谁把考试搬进数字世界谁就掐住了整个行业的迭代速度。”在大语言模型领域评测基准的重要性已经得到公认。各类标准评测集成为衡量模型能力的通用标尺支撑了整个行业的快速迭代。但在机器人领域标准化评测体系仍然缺失。不同公司的测试场景、任务定义、评价标准都不一样两个机器人模型的能力无法横向对比甚至同一公司的不同版本模型都很难量化能力提升的幅度。数字仿真评测可以完美解决这些问题。在仿真环境中可以并行运行成千上万台虚拟机器人同时完成数百项任务测试几个小时就能输出完整的评测报告全程没有安全风险成本几乎可以忽略。标准化评测体系的缺失已经成为制约机器人行业迭代速度的核心瓶颈。没有统一的标尺技术进步就无法被精准量化行业资源就无法向最优的技术路线集中。数字评测体系的建设是机器人行业从野蛮生长走向标准化发展的必经之路。4.2 李飞飞不做本体做基建打造全行业的机器人学校基于上述判断李飞飞团队切入机器人行业的角度非常清晰不造机器人本体而是给所有机器人办学校也就是搭建面向全行业的机器人训练场和考场。这是非常彻底的 “卖铲子” 商业模式。李飞飞在访谈中明确表示这套体系不挑本体不挑大脑单臂、双臂、轮式、人形任何身体、任何大脑都能来上学。这种中立的基础设施定位让它可以服务整个行业而非只服务自有产品。从产业分工的角度看这种模式有清晰的合理性。机器人行业已经逐渐形成分层分工的趋势底层是零部件供应商中间是本体制造商上层是智能算法提供商而训练与评测基础设施就是支撑所有上层玩家的公共底座。就像大模型行业的云厂商不直接做模型但所有模型公司都依赖云算力基础设施。当行业发展到一定阶段通用基础设施的商业价值往往会超过单一产品公司的价值。这也是 World Labs 选择这条路线的核心商业逻辑。训练与评测基础设施的商业价值不止于提供训练服务。更长期的价值在于行业标准的制定权。当一套评测体系被全行业广泛采用它就会成为事实上的行业标准。所有机器人公司的产品宣传、技术迭代都会以这套评测体系的分数作为参照。标准制定者可以通过调整评测任务的权重引导整个行业的技术发展方向其行业影响力远超过单一的产品公司。从商业模式上看基础设施业务具备很强的规模效应。平台搭建完成后新增客户的边际成本极低客户越多平台积累的场景和数据就越丰富平台的价值就越高形成正向的网络效应。这种商业模式的长期盈利能力往往比硬件产品更稳定。4.3 商业验证从付费客户到收购的产业闭环这条技术路线的商业可行性已经得到了初步的市场验证。李飞飞在访谈中透露公司的世界模型 Marble 发布之后有很多机器人公司主动找上门来当客户客户多到根本服务不过来。最具代表性的案例就是本次收购的 SanaX。这家公司最早就是 Marble 的付费客户李飞飞后来才发现这是自己带过的博士后李芸竹的公司双方深入沟通后发现技术理念高度契合能力边界高度互补最终一通电话聊成了收购。从客户到收购的故事侧面印证了机器人训练基建的真实市场需求。机器人公司有强烈的动力采购外部的训练与仿真工具而非全部自研。对于绝大多数机器人公司来说自研全套仿真训练体系的成本太高直接使用成熟的第三方平台是更经济高效的选择。对于绝大多数中小机器人团队来说没有必要自研完整的仿真平台。仿真平台的开发需要物理引擎、三维渲染、机器人控制等多领域的专业人才开发周期长、投入大。优先使用成熟的第三方平台把研发资源集中在自身核心算法上是更合理的工程选型。五、趋势研判基于访谈判断的三条产业主线结合李飞飞与李芸竹的核心判断以及当前产业的发展现状可以推导出物理 AI 行业三条确定性的发展趋势。5.1 数据与评测基建成为行业公共底座机器人行业的发展会先完成基础设施的搭建再迎来产品的爆发。这和互联网行业先铺光纤基站、再涌现应用大模型行业先搭算力平台、再涌现模型的产业规律一致。未来 3-5 年仿真训练平台、标准化评测体系会率先走向成熟成为整个行业的公共基础设施。会有专门的公司专注于这一层级的技术研发为全行业提供数据生产、模型训练、效果评测的一体化服务。这一层级是典型的 “卖铲子” 赛道行业竞争格局会相对集中头部玩家会占据大部分市场份额。据多家研究机构测算2026 年中国具身智能市场规模预计达到万亿元级别其中仿真训练与评测基础设施的增速会高于整体行业平均水平成为产业链中率先兑现商业价值的环节。5.2 仿真算力先于机器人本体放量机器人产业的增长会先带动算力需求的增长再带动硬件本体的增长。在机器人大规模量产之前仿真训练的需求会率先爆发。每一台真实机器人的背后可能对应着数十台甚至上百台虚拟机器人在仿真环境中训练。仿真训练对 GPU 算力的需求会持续增长成为继大语言模型之后算力行业新的核心增长驱动。从产业周期的角度看仿真算力相关的产业链会比机器人本体更早进入业绩兑现期。算力芯片、云服务、物理引擎等上游环节会率先受益于物理 AI 行业的发展。5.3 半结构化场景专用机器人率先商业化在落地节奏上不同场景的商业化进度会有明显的先后差异。结合李芸竹提出的三阶落地框架可以清晰梳理出不同场景的商业化周期。场景类型环境结构化程度代表场景技术难度商业化周期全结构化场景完全可控汽车生产线、3C 组装低已大规模落地半结构化场景部分可控仓储物流、餐饮后厨、酒店配送中3-5 年规模化落地非结构化场景完全不可控家庭服务、开放公共空间高10 年以上长期周期仓储物流、工业柔性生产、餐饮服务等半结构化场景会是未来 5 年机器人商业化的核心阵地。这类场景的环境边界清晰商业价值明确技术难度适中能够支撑起成熟的商业模式。人形机器人对应的家庭非结构化场景仍需要长期的技术积累短期很难实现大规模商用。结论物理 AI 是人工智能下一阶段的核心发展方向但其发展逻辑与大语言模型存在本质区别。李飞飞与李芸竹在访谈中提出的一系列反共识判断本质是回归技术与产业的基本规律跳出人形机器人的路径依赖理性看待技术迭代的周期与节奏。仿真训练与数字评测体系是突破物理 AI 数据瓶颈与迭代瓶颈的核心路径。它不是过渡性的权宜之计而是智能本身的必要组成部分。围绕仿真与评测搭建的行业基础设施会成为机器人产业的核心底座先于本体产品迎来价值兑现。产业落地会遵循从结构化到非结构化的路径逐步推进半结构化场景的专用机器人会率先实现规模化商业落地。从业者与决策者应当尊重技术发展的客观规律在合适的阶段选择合适的技术路线而非盲目追逐终局形态的叙事。 【省心锐评】物理 AI 不会复制大模型的爆发速度基建优先、场景分层、仿真先行是更务实的产业路径人形叙事需让位于真实的落地节奏。SEO 关键词