行业资讯
📅 2026/7/21 2:46:57
Mistral发布8B机器人导航模型Robostral Navigate,仅需单目RGB摄像头
Mistral AI推出了Robostral Navigate这是一个拥有80亿参数的具身导航模型旨在通过自然语言指令和单个RGB摄像头的图像引导机器人在陌生环境中自主移动。与许多视觉语言导航系统不同该模型无需激光雷达、深度传感器或全景多摄像头装置。在R2R-CE验证未见集基准测试中Mistral报告的成功率为76.6%。据该公司称这一成绩比最强的单摄像头系统高出9.7个百分点比使用深度传感或多摄像头的最佳系统高出4.5个百分点。Robostral在验证已见集上也达到了79.4%的成功率。R2R-CE比原始的Room-to-Room基准测试更具挑战性因为机器人在连续的三维环境中运行而非在已知导航图上的预设全景视点之间移动。智能体必须理解指令、感知周围环境并执行底层运动且无法依赖精确定位或已知的环境拓扑结构。Robostral的动作表示方式是其较为有趣的设计选择之一。该模型通常在当前摄像头图像中预测一个点指示机器人应移动的位置以及到达时的目标朝向。Mistral表示这种图像空间表示方式提高了对摄像头内参变化和机器人尺度变化的容忍度。当目的地超出摄像头视野范围时模型则改为在机器人本地坐标系中输出位移向量。Mistral完全在仿真环境中训练该模型使用了跨35万个场景的约240万条轨迹数据。一种前缀缓存训练方法将一个完整回合压缩为单一序列并在一次前向传播中完成所有时间步的训练与将每个时间步作为独立样本处理相比Token使用量减少了22倍。随后通过在线强化学习进一步将导航成功率提升了3.2个百分点。对于边缘AI工程师而言这一结果表明更强的空间推理学习能力有时可以替代额外的传感硬件。然而这并不能证明低成本RGB摄像头可在量产机器人中取代激光雷达。Mistral的公告未提供推理延迟、功耗、算力或内存需求、安全性能以及大量真实世界测试结果。该公司也要求潜在用户直接联系其团队而非提供可下载的模型权重或部署文档。尽管如此这一基准测试结果仍值得关注一个仅使用单目RGB输入的80亿参数模型在公认的连续导航任务上能够超越传感器更为丰富的系统。下一个问题是Mistral能否在实时、功耗受限的部署条件下以及在仓库、工厂和公共场所等控制程度较低的环境中保持这一优势。QAQ1Robostral Navigate是什么有什么特别之处ARobostral Navigate是Mistral AI推出的一款拥有80亿参数的机器人具身导航模型。它的特别之处在于仅依靠单个RGB摄像头和自然语言指令就能引导机器人在陌生环境中自主移动无需激光雷达、深度传感器或多摄像头装置。在R2R-CE基准测试中其成功率达76.6%超越了使用多传感器的系统。Q2Robostral Navigate是怎么训练出来的ARobostral完全在仿真环境中训练使用了跨35万个场景的约240万条轨迹数据。训练中采用了一种前缀缓存方法将整个回合压缩为单一序列进行训练Token使用量减少了22倍。此后还通过在线强化学习进一步优化使导航成功率额外提升了3.2个百分点。Q3Robostral Navigate现在能直接用于实际机器人部署吗A目前尚不能直接用于生产部署。Mistral的公告未提供推理延迟、功耗、计算及内存需求等关键部署参数也未提供可下载的模型权重或部署文档。用户若有需求需联系Mistral团队。此外真实世界中仓库、工厂等复杂环境下的表现仍有待验证。Edge AI and Vision Alliance - Latest News具身导航Robostral NavigateMistral AI