10万小时UMI预训练验证Scaling Law机器人策略模型的数据范式变革2026年7月国内头部科技企业发布了一款基于10万小时真实世界数据预训练的机器人策略基座模型。这是全球范围内机器人策略模型首次被如此规模的无本体Body-Free数据采集方案训练出来也是Scaling Law在具身智能领域的首次系统性验证。本文将从技术架构、数据采集范式、训练方法论三个维度深入拆解这一里程碑事件的技术细节和工程意义。一、Scaling Law的具身智能验证大语言模型的成功已经证明Scaling Law——数据量、参数量和模型性能之间的幂律关系——是通往更强AI能力的底层规律。但这条规律在机器人领域是否存在一直缺乏充分的实验支撑。核心原因在于机器人数据的采集成本极高、多样性极差、规模极其有限导致无法像在NLP领域那样轻松地将数据量提升几个数量级。这次发布的技术报告给出了明确的答案。实验数据显示了两条关键曲线曲线一预训练数据量从2500小时增加到20000小时模型在下游任务上的预测损失Prediction Loss持续单调下降。曲线二模型参数量从2B扩展到10B动作生成的精度指标同步提升。这两条曲线的存在意味着具身智能领域终于有了自己的Scaling Law。数据规模的扩大和参数量的增加同样能带来机器人策略模型能力的可预测增长。这个发现对整个行业的影响是深远的——它告诉所有从业者大规模数据这条路是走得通的投入数据采集是有确定回报的。二、UMI无本体数据采集架构解析传统的机器人数据采集方式有一个根本性限制数据绑定本体。你在A机器人上采集的数据不能直接用于训练B机器人。这种一机一数据的模式严重制约了数据的可复用性和规模扩张速度。UMIUniversal Manipulation Interface方案的创新在于它彻底解耦了数据采集和机器人本体之间的关系。具体而言UMI使用自研的便携式穿戴设备——通常是一个带有相机和传感器的手持或腕部装置——在不绑定任何特定机器人硬件的前提下记录人类操作者在真实场景中的操作轨迹。从技术实现来看这套方案包含几个关键组件1多模态传感融合腕部设备集成了RGB相机、IMU惯性测量单元、力/力矩传感器能够同时捕获视觉信息、末端位姿和接触力数据。这些多模态信息构成了后续模型训练的完整输入。2场景大规模覆盖数据采集覆盖了1700多个家庭、商超、工厂场景涉及收纳、搬运、整理、装配等全品类操作任务。这种场景多样性是保证预训练模型泛化能力的基础。3动作轨迹标注穿戴设备记录的不仅是视频还包括操作者的手腕轨迹、抓取策略、力度变化等结构化信息。这些信息经过坐标变换后可以映射到不同机器人本体的动作空间中。从工程角度看UMI方案的核心优势在于数据复用率极高。同一段人类操作数据理论上可以被多个不同构型的机器人系统利用只需在跨本体迁移阶段完成坐标映射和动力学适配即可。三、两阶段训练范式的技术细节该策略基座模型的训练采用了明确的两阶段设计每个阶段有独立的目标和数据配置。第一阶段通用预训练使用10万小时的无本体UMI数据。这一阶段的核心目标是让模型学会理解物理世界中的操作逻辑——不是记住某台机器人怎么动而是理解人类是怎么操作物体的。具体包括物体抓取的稳定策略、空间路径的规划逻辑、力度的自适应调节、多步骤任务的分解与执行。模型架构采用了基于Transformer的序列建模方案将视觉观测、本体感知此处为穿戴设备数据和动作指令编码为统一的token序列。第二阶段跨本体后训练使用约10000小时的跨本体数据包括7200小时以上的移动操作和双臂机器人数据、1000小时以上人工标注的UMI数据、以及Bridge V2、RT-1、DROID等公开数据集。这一阶段的核心目标是将预训练阶段积累的通用操作知识适配到具体的机器人本体上。技术挑战在于不同机器人构型之间的动力学差异——同一抓取杯子的动作在不同臂长、不同关节自由度的机器人上对应完全不同的关节角度序列。跨本体迁移的本质是在不同动作空间之间建立映射关系。这种两阶段范式的实际效果非常显著。在多个下游新任务上每个任务平均仅需不到10小时的微调数据就能达到远超此前标杆模型的成功率。这意味着新任务的开发成本被大幅压缩——过去需要数周甚至数月才能完成的任务适配现在可能只需要几个小时的数据采集。四、自动标注流水线的工程突破10万小时数据的标注工作量是极其庞大的。传统的做法是人工逐条标注一条5分钟的操控视频通常需要3-4小时才能完成高质量标注。按照这个效率10万小时的人工标注需要数千人的标注团队工作数月。该团队采用了一套基于视觉语言模型VLM的自动标注流水线将整个标注周期压缩到两周。从技术角度看这套流水线的核心能力包括1动作语义理解VLM不仅能识别画面中的物体还能理解操作动作的语义——区分抓杯口和握杯身、竖直拿起和倾斜倒水等细粒度动作差异。2多模态标注生成自动生成包括目标物体检测框、操作阶段分割、关键帧标注、动作标签在内的多维标注信息。3质量控制闭环通过抽样验证和置信度评估机制确保自动标注的精度满足模型训练需求。这种VLM驱动的自动标注方案为VLAVision-Language-Action模型的大规模数据标注提供了一条可落地的工程路径。它解决了数据规模化和标注成本之间的矛盾使得十万小时级别的数据集处理成为可能。五、性能评测与基准分析在RoboDojo评测基准上该模型取得了20.07分的成绩成功率为13.93%。作为参考此前的最高纪录为13.07分成功率8.80%。这种断档式的领先幅度在机器人评测历史上相当罕见。在RoboCasa评测基准上该模型以57.4%的平均成功率获得全球第一超越谷歌此前46.6%的历史最优成绩。RoboCasa侧重评估机器人在复杂家居环境中的长序列操作能力对模型的泛化性和鲁棒性要求极高。性能上的碾压式领先根源在于训练数据规模的数量级差异。此前全球范围内的机器人策略模型训练数据量级通常在数百到数千小时之间。10万小时的预训练数据量是此前最大规模的数十倍。这个结果从实验层面证明在机器人策略模型上数据规模是决定性能上限的关键变量。六、对行业技术路线的启示这一技术突破对整个具身智能行业的技术路线选择具有深远的指导意义。在数据采集策略层面UMI无本体方案的成功验证了先通用、后专用的数据积累路径的可行性。行业无需再为每台机器人单独建设数据采集体系而是可以基于人类操作的通用数据预训练基座模型再通过少量跨本体数据完成适配。这将大幅降低机器人策略模型的开发门槛和周期。在模型架构层面两阶段训练范式有望成为行业标准。预训练阶段追求数据的规模和多样性后训练阶段追求本体适配的精度和效率。这种分工使得数据工程和模型工程可以独立迭代有利于整个生态的专业化分工。在数据工程层面自动标注技术的突破释放了一个明确信号数据标注不能继续依赖人工必须走自动化、规模化的路线。VLM驱动的标注方案、基于仿真数据增强的方案、以及两者的混合方案将成为下一阶段数据基础设施竞争的核心赛道。从产业数据来看IDC预测中国具身智能市场支出将从14亿美元增长至770亿美元年复合增长率94%。2026年上半年国内具身智能融资总额达到935亿元超过一半投向VLA模型和世界模型等底层智能方向。在这个大背景下数据基础设施——特别是大规模数据采集、自动化标注、跨本体迁移等核心能力——将成为决定行业竞争格局的关键变量。七、总结10万小时UMI数据的发布标志着具身智能正式进入数据规模化时代。Scaling Law在机器人策略模型上的首次验证为整个行业指明了一条清晰的技术路径大规模高质量数据 两阶段训练范式 自动化标注工程。这三大支柱的确立意味着具身智能的发展不再依赖零散的小规模实验而是可以像大语言模型一样通过系统性的数据工程来实现可预测的能力增长。接下来行业需要解决的核心问题包括如何进一步扩大数据采集的场景覆盖和多样性、如何提升跨本体迁移的精度和效率、如何建立统一的数据格式标准以降低生态协作成本。这些问题的解决将直接决定具身智能从实验室走向规模化产业应用的速度。此外数据质量和数据安全的保障体系也需要同步建设。当训练数据的规模从千小时级跃升到十万小时级数据来源的多样性、标注质量的一致性、以及数据在不同组织之间流转时的安全合规性都成为不可回避的工程挑战。特别是当多个机构共同参与数据采集时数据去重、冲突检测、版本管理等基础能力都需要在平台层面得到系统性解决。这些看似枯燥的工程问题实际上是决定数据基础设施能否支撑行业规模化发展的关键因素。八、数据基础设施的工程化挑战从工程实践的角度来看10万小时级别的数据处理暴露了一系列此前未被充分重视的基础设施挑战。数据采集端1700多个场景的并行采集需要一套完整的设备管理、数据回传和质量监控系统。采集设备需要标准化——保证不同批次、不同场景采集的数据在格式和精度上具有一致性。数据回传需要高带宽、低延迟的网络基础设施特别是在工厂等复杂环境中网络条件的不确定性会直接影响采集效率。标注端的挑战更为复杂。VLM自动标注虽然大幅提升了效率但模型本身的泛化能力仍有局限——对于某些特殊场景如暗光环境、高反射物体表面、柔性物体操作VLM的标注精度会明显下降。这要求标注流水线具备自适应切换能力在VLM高置信度场景下走自动标注在低置信度场景下切换到人工复核。这种混合标注策略需要在工程层面实现无缝切换同时保证最终交付数据的质量一致性。从产业数据来看IDC预测中国具身智能市场支出将从14亿美元增长至770亿美元年复合增长率94%。2026年上半年国内具身智能融资总额达到935亿元超过一半投向VLA模型和世界模型等底层智能方向。在这个大背景下数据基础设施——特别是大规模数据采集、自动化标注、跨本体迁移等核心能力——将成为决定行业竞争格局的关键变量。谁能在工程层面率先解决十万小时级数据的采集、标注和交付问题谁就能在这个高速增长的市场中占据先发优势。