ω‑0 家务测试成功率达 81.8%:这项结果真正说明什么

Humanoider Roboter wischt einen Tisch und koordiniert dabei Bewegung und Manipulation [图像内容由人工智能生成]



一个类人机器人正在擦桌子,同时横向移动,保持平衡,并调整与抹布的接触——而不将任务分解为单独的行走和抓取阶段。 正是这种同时的全身协调是ω‑0的目标。新的研究模型在一个包含十一项家务任务的实际测试中达到了81.8%的成功率。这个数值很显著,但只有在阅读测试设置、数据基础和限制条件的情况下才有意义。

要点概述

  • ω‑0 不是一个新的机器人,而是一个用于人形全身任务的学习型控制模型。
  • 该系统将语音指令、摄像头图像和关节状态结合起来,从而生成可执行的全身动作序列。
  • 在实验设置中,最强的版本成功完成了81.8%的完整测试运行;平均任务进度为90.3%.
  • 测试是在配备额外灵巧手的Unitree G1上进行的——在十一项定义好的任务中,每项进行了十次操作。
  • 结果是一个明显的研究进展,但还不能证明可以自由使用的家用机器人。

为什么家务对类人机器人来说如此困难

对人类来说,擦桌子看起来很平凡。然而,从机器人的角度来看,这个过程中感知、动作规划、平衡、手臂运动、手部力量和与表面的接触都必须持续协调。类似复杂的任务还有从深滚筒中拿起衣物、打开冰箱或在收集不同高度物品的同时携带容器。

许多现有系统将移动和操作视为独立的模块:机器人先走到一个位置,然后尽量保持静止并移动手臂。这在结构化演示中可行,但在行走、弯腰、支撑、抓取和拉动同时发生的任务中就会出问题。在研究中,这种结合被称为局部操作. 她是决定是否的关键类人机器人将来在人类设计的空间中真正变得有用。

ω‑0 技术上做了什么不同

ω‑0 是所谓的潜在世界动作模型。它接收语言指令、当前视觉观察以及机器人自身的身体状态。这包括关节位置、手部配置和躯干方向等。从这些信息中,它预测出紧凑的全身动作表示,这些表示会被下游的低级控制器转化为实际动作。

关键点:模型不需要先生成完整的未来视频画面。相反,它学习场景中相关图像特征可能如何变化。这种预测发生在一个紧凑的特征空间中。与此同时,一个扩散模型生成下一序列可执行的全身动作。简而言之,机器人不仅学习“接下来会有什么动作?”,还学习“之后的场景应该是什么样子?”——而无需为了生成逼真的未来图像浪费计算资源。

因此,ω‑0 属于下一个发展阶段的视觉-语言-行动模型经典的VLA直接将图像和语言转化为动作。世界-动作模型补充了对动态的学习理解:它们应当理解某个动作对身体、物体和环境的影响。对于接触频繁的家务工作,这尤其重要,因为在压力、抓握角度或站姿上的微小偏差可能导致长动作链失败。

如何正确理解 81.8% 的结果

研究人员按照相同的协议测试了七个模型系列。每种方法都在真实的示范数据上进行训练或微调,并且必须完成每个包含十次独立尝试的十一项任务。只有当所有子目标在时间窗内完成时,一次运行才被视为成功。ω‑0的Omni版本实现了81.8%的完全成功率,最大41个子任务点中的36.7点,以及90.3%的连续任务进展率。

模型 完全的成功 任务进度
扩散政策 15.5% 40.6%
π‑0.5 27.3% 52.8%
GR00T‑N1.7 22.7% 49.8%
ψ‑0 44.5% 59.6%
DiT4DiT 43.6% 61.0%
ω‑0 自我 79.1% 88.7%
ω‑0 全向 81.8% 90.3%

因此,这个数字并不是家用机器人的通用“智商”。它是在作者开发的明确定义的测试领域内的平均值。更强大的Omni版本在训练时使用了多种视角,包括外部RGB和深度图像;Ego版本的工作方式更接近后来的车载摄像头视角。根据论文,在自主执行过程中没有使用遥控操作、动作重播或脚本化干预。

测试了哪十一项任务?

测试范围从简短的抓握任务到带有空间移动的较长流程。包括以下内容:

  1. 拿起一个苹果放进篮子里,
  2. 把一个苹果放在货架上,
  3. 把床上的衣服扔进篮子里,
  4. 把毛巾从筐子里放进洗衣机里,
  5. 擦桌子,
  6. 拖地,
  7. 将来自不同高度的垃圾收集到一个携带的容器中,
  8. 把一个苹果扔进抽屉,然后用膝盖关上它,
  9. 把床上的垃圾扫掉,翻身,把它扔进一个容器里,
  10. 从洗衣机里取出衣服,
  11. 从冰箱里拿一杯饮料。

十一个任务中有十个明确要求下半身运动。因此,该基准测试不仅考察手的灵巧性,还考察腿、躯干、手臂和抓取器的协调使用。这正是它与许多桌面基准测试的区别,后者通常是固定安装的机械臂在准备好的物体上工作。

ω‑HOME:为什么数据几乎和模型一样重要

性能提升不仅依赖于架构。对于 ω‑HOME,团队收集了 40.3 小时的真实家庭数据,包括 4,827 个情节和 24 种任务类型,帧率为每秒 30 张图像。每条轨迹都同步记录了语音指令、自我视角摄像头、外部 RGB-D 采集、身体动作、关节状态和可执行动作表示。对于后来的十一项任务,共收集了约 2,220 次遥操作示范,每项任务约 200 次。

一名人工操作员使用 VR 头显、控制器和足部追踪器控制数据采集。来自公开人体数据集的动作也通过 SONIC 全身控制器在模拟中重现。系统会筛除物理上不合适的轨迹。这个中间步骤很重要:人类动作在视频中看起来合理,但对于具有不同运动学、质量分布和关节限制的机器人来说可能无法执行。

对于企业来说,这显示了一个核心趋势的物理人工智能比赛不仅仅是关于更大的模型。关键是高质量的真实动作数据、可靠的远程操作、仿真、稳健的全身控制器以及来自摄像头和关节传感器的清晰反馈。

实验室里有什么硬件?

自动驾驶试验在Unitree G1为了操作,该团队为人形机器人配备了Inspire-DexHands。一台ZED迷你相机提供第一人称视角;另一台ZED深度相机捕捉外部RGB-D数据。因此G1是物理平台,而ω‑0则是研究软件。提到“ω‑0机器人”的人,将模型和硬件混为一谈。

这种区分对于评估很重要。目前尚未广泛展示该方法是否可迁移到具有不同尺寸、手部运动学、计算平台或驱动设计的其他类人机器人。在G1上取得的良好结果是对模型理念的强烈信号,但并不意味着自动具备硬件独立性。还包括……质量的传感器融合控制的延迟和整个平台的安全功能决定了之后的实际应用成功。

这一结果尚未证明

首先,这是一个最新的预发布,而不是已经长期复制的工业研究。其次,基准测试、数据处理和分析都来自同一个研究项目。尚缺乏在其他机器人和独立住宅中的外部复现。第三,每个模型的测试包含110次试验——对于项目中的明确比较已经足够,但不足以推导出数千小时家庭运行的故障率。

第四,任务已经被定义和训练。一个真实的家庭环境在不断变化:光线、家具、包装、地面摩擦、宠物、孩子以及不可预测的人类动作都会产生一个开放的世界。虽然论文报道了在保留的物体和场景上有希望的泛化能力,但由此还不能得出对任意新任务的可靠处理能力。

第五,高任务完成率对安全性、噪音、能耗、磨损、清洁性、数据保护或成本的意义不大。家用产品不仅需要完成任务,还要能够可重复、安静、安全、低维护地执行——在不确定时还能有控制地停止。

为什么ω‑0仍然是一个重要的步骤

决定性的进展不在于单一的壮观动作,而在于统一化。一个模型控制着十一种不同的任务,并将感知、未来表示和全身动作结合起来。它表明,潜在预测可以成为纯反应性策略和计算密集型视频生成之间的可行折中方案。

对于机器人行业,这可能会产生三条发展路线。首先,远程操作和数据采集平台将变得更加重要。其次,人形机器人制造商可能会在高层模型与低层全身控制器之间建立标准化接口。第三,该行业需要基准测试,不仅测量短期成功视频,还要测量完整任务、部分进展、故障情况以及多次重复执行。

结论:实验室取得突破,但尚未成为家用产品

在十一项真实家务任务中取得81.8%的完全成功,对于类人移动操作来说是一个强有力的成果。ω‑0展示了机器人如何将运动和手工操作作为一个整体问题进行学习。尤其值得注意的是紧凑的未来预测、统一的全身控制以及精心同步的数据基础。

然而,合理的结论并不是说家庭机器人现在已经“解决”了。展示的是在特定平台和受控任务空间中的一种高效研究方法。下一步的证明必须来自独立的测试、其他机器人、未知的住宅以及明显更长的运行时间。如果这种转移成功,ω‑0 可能确实成为将仿人机器人从令人印象深刻的演示者转变为可靠助手的组成部分。

Bewerte den Beitrag hier!
[Total: 0 Average: 0]
Nico Nuss [图像内容由人工智能生成]

作者 Nico Nuss 自 2001 年起专注于移动计算和自动化软件领域。凭借丰富经验以及对未来技术的浓厚兴趣,他重点关注机器人技术与人工智能。