双子座机器人控制阿波罗:人形演示意味着什么

Gemini Robotics 2 [图像内容由人工智能生成]

谷歌深度思维推出了 Gemini Robotics 2,这是一个适用于人形机器人和其他机器人的新模型系列。在Apptronik的Apollo 2上,AI首次展示了连续的全身控制。该机器人可以独立行走、弯腰、抓取物体以及执行复杂的任务。同时,该系统提高了精细运动技能、多个机器人的协作以及无需永久云连接的操作。谷歌 DeepMind 希望将专用机器变成适应性强的助手,能够理解环境、计划行动并对变化做出反应。

简而言之,最重要的事情

  • Gemini Robotics 2 将视觉感知和语言直接与机器人动作联系起来。
  • Apptronik的Apollo 2可以用它来协调从脚到指尖的整个身体。
  • 三个专门的模型处理全身控制、具身思维和本地人工智能处理。
  • Gemini Robotics ER 2 规划了更长的流程,并使不同类型的机器人能够协同工作。
  • ASIMOV-Agentic 安全基准测试除其他外,还检查机器人是否拒绝危险命令并及时请求人类帮助。

Gemini 机器人 2 是什么?Gemini Robotics 2 是一系列适用于自主机器人的 Google DeepMind 模型。它处理图像和语音命令,规划多步骤任务,并将决策转化为整个机器人身体的协调运动。

Gemini Robotics 2 成为机器人的智能层

谷歌 DeepMind 将 Gemini Robotics 2 称为机器人的“智能层”。该平台旨在使机器超越严格的预编程工作流程。因此,机器人不应仅仅重复存储的动作。相反,他感知周围的环境并解释语言顺序。然后,他决定实现预期目标需要采取哪些行动步骤。在执行过程中,它可以对不断变化的条件做出反应。这使得机器人更接近能够在难以预测的环境中处理任务的系统。

该型号系列并非专门针对人形机器人。据谷歌DeepMind介绍,它还可以转移到双臂系统和其他类型的机器人上。对新事物的适应硬件有时应该可以在几个小时内完成。这一点很重要,因为机器人在尺寸、关节结构、传感器和抓取技术方面存在显着差异。因此,多功能人工智能平台可以减少开发自己的控制模型所需的工作量。这样,制造商就不必从头开始训练每个机器人的所有技能。因此,该软件将与特定的机械平台更加分离。

此次发布建立在 Google DeepMind 和 Apptronik 之间持续合作的基础上。 Apptronik 于 2026 年 7 月初开放了所谓的机器人公园。在该设施中,阿波罗 2 号机器人在收集训练数据的同时执行实际任务。这些数据将被纳入下一代机器人模型的开发中。其中还包括 Gemini Robotics 2。机器人公园将真实的机器人工作与持续的人工智能训练相结合。阿波罗 2 号既充当演示平台,又充当新运动和交互数据的来源。

三种人工智能模型承担不同的任务

Gemini Robotics 2 由三个模型组成,每个模型都有自己的功能。主要模型结合了感知、语言和运动。另一方面,Gemini Robotics ER 2 处理规划和具体推理。设备端版本专为机器人硬件上的本地操作而设计。这些模型共同覆盖了自主机器人的中心层。这包括理解任务、计划行动并实际执行。这使得 Google DeepMind 可以根据各自的应用程序使用模型。

模型 型号类型 中心功能 适当的系统
双子座机器人2 视觉-语言-行动模型 将视觉和语言输入转化为动作并控制整个身体 人形机器人和双臂系统
双子座机器人 ER 2 具身推理模型 规划多步骤任务、与人类沟通并协调多个机器人 单一机器人和混合机器人车队
设备 2 上的 Gemini 机器人 本地运行的VLA模型 直接在硬件上工作,只需一些训练数据即可进行调整 云连接有限或不可靠的机器人

缩写VLA代表“愿景-语言-行动”。这种模型结合了图像、口头指令和具体行动。例如,它识别一个物体并了解它在空间中的位置。然后它将命令转换为适当的移动命令。机器人不必接收每个单独的步骤作为单独的指令。相反,命令可以描述完整的目标。这种直接连接使更自然的人机交互成为可能。

Gemini Robotics ER 2 通过更长的思考和规划流程补充了这种执行水平。该模型可以分解多阶段任务并监控其进度。它还与人类和其他机器人进行通信。另一方面,Gemini Robotics On-Device 2 专注于高效的本地执行。这创造了一个集感知、规划和运动于一体的模型系列。然而,这三个名称并不一定意味着三个系统相互隔离。在实际应用中,他们的技能可以交织在一起。

阿波罗 2 号将获得完整的全身控制

最引人注目的创新是 Apptronik 的人形 Apollo 2 的全身控制。以前版本的机器人模型主要集中于上半身的操作。 Gemini Robotics 2 现在可以协调从脚到指尖的运动。因此,阿波罗2号可以自主行走、弯曲和倾斜上半身。同时,他可以识别物体,抓住它们并将它们移动到另一个位置。系统必须持续监控人形机器人的平衡。因此,感知、运动和操纵成为一个共同过程的一部分。

Google DeepMind 通过具体的语音命令展示了这一功能。阿波罗 2 号原本应该将喷壶放在底部架子上的绿色容器中。机器人首先必须理解所提到的顺序和物体。然后他穿过房间走向喷壶。他拿起那件东西,把它搬到了货架上。由于目标容器位于较低区域,阿波罗2号不得不相应调整其姿态。最后,他将喷壶放在了想要的位置。

这个演示最初看起来像是一个简单的运输任务。然而,它需要众多子技能的协调。机器人必须在视觉上区分喷壶和绿色容器。他还需要对房间的空间概念和安全的步行路线。抓握时,必须考虑物体的形状和位置。在运输过程中,他不得失去平衡或对喷壶的控制。他还必须识别货架上目标区域的高度。只有这些步骤的相互作用才能将单个动作转变为自主的全身动作。

手、夹具和工业精密任务

除了运动之外,谷歌 DeepMind 还提高了机器人的灵活性。 Apollo 2可配备五关节SharpaWave机器人手。 Gemini Robotics 2 使用它来控制单个手指的复杂运动。在演示中,机器人绑了一个垃圾袋。在另一项任务中,他拧开了一个灯泡。这两项活动都需要受控的运动和不断调整所用的力量。因此,它们不仅仅是简单地捡起一个固体物体。

对于机器人来说,系垃圾袋尤其具有挑战性。塑料薄膜柔软、有延展性,每次触摸都会改变形状。因此,机器人不能一次性记录物料的准确位置,然后盲目行动。他必须根据新的视觉信息纠正自己的动作。当拧下灯泡时,还会出现其他困难。手必须牢固地抓住物体并进行旋转运动。同时,她既不能让灯泡掉落,也不能用力过猛损坏灯泡。

然而,Gemini Robotics 2 不仅仅支持类人手。该模型还可以控制传统的平行夹具。这种夹具广泛应用于工业工厂。它们适用于可重复且精确的搬运任务。 Google DeepMind 提到组件的精确插入作为可能的应用。包装和分类工作也是一种选择。该平台结合了人形手的多功能性和工业抓取工具的坚固性。

抓取技术 显示或提到的任务 特殊要求
五指 SharpaWave 手 绑好垃圾袋 处理柔软且有延展性的材料
五指 SharpaWave 手 拧下灯泡 精确的力控制和协调的旋转运动
平行夹爪 精密组装和插入 组件精确定位
平行夹爪 包装工作 在重复过程中可靠地抓取和放置

多个机器人一起计划和工作

Gemini Robotics ER 2 还旨在使多个机器人能够协同工作。不同类型的机器人可以交换信息并协调行动。复杂的工作流程不再需要完全由一台机器来执行。相反,系统可以将各个步骤分配给合适的机器人。例如,移动机器人可以运送材料。然后,人形机器人可以承担非结构化的搬运任务。然后,固定双臂机器人可以执行精确的组装步骤。

这种合作对于工厂和物流中心来说尤其有趣。那里经常使用各种具有专门功能的机器人系统。到目前为止,他们经常在不同的区域或按照固定的交接规则工作。 Gemini Robotics ER 2 可以更灵活地连接此类系统。为此,模型必须跟踪整个工作流程的状态。它还需要识别任务何时完成或需要切换。因此,协调成为一项独立的人工智能任务。

推理模型是为持续几分钟的过程而设计的。同时,它监控进展情况。如果操作步骤失败,系统不应立即终止。相反,它可以检测错误并计划新的尝试。它还可以根据不断变化的情况调整策略。这项技能对于现实世界的工作环境至关重要。物体并不总是处于完全相同的位置,人们也可以改变计划的过程。

与人交流也是 Gemini Robotics ER 2 的一部分。该模型可以接收指令并处理查询或状态信息。这使得员工能够在工作目标层面指导机器人。您不必对每个关节运动或路径点进行编程。然而,模型识别模糊指令的可靠性仍然至关重要。还必须明确规定错误的责任。因此,工业应用仍然需要明确定义的流程和安全限制。

本地执行和新的安全机制

Gemini Robotics On-Device 2 直接在机器人的硬件上运行。因此,该模型并不永久依赖于云连接。此功能适用于工厂、仓库和网络覆盖范围有限的偏远地点。此外,本地处理可以减少感知和运动之间的延迟。每个决策都不必将敏感摄像头和操作数据传输到外部服务器。但是,性能和响应能力取决于可用的硬件。 Google DeepMind 尚未为每个可以想象的机器人平台提供一般性能指标。

低调整力度尤其重要。据谷歌 DeepMind 称,On-Device 2 可以转移到新的双臂机器人上。少于 200 个训练示例就足够了。数据可以在几个小时内收集完毕。这可以显着加快新机器人的调试速度。与此同时,目前还不清楚,由于特别复杂的硬件或不寻常的任务,所需的数据量会增加多少。因此,所提到的阈值应理解为制造商针对所演示的适应场景的信息。

Google DeepMind 将安全基准 ASIMOV-Agentic 添加到模型系列中。他研究了代理安全协调和处理不确定性。例如,检查机器人是否拒绝危险命令。它还应该识别任务何时无法安全执行。在这种情况下,系统必须请求人工帮助。因此,该基准将安全性视为不仅仅是紧急停止功能。它还检查人工智能在规划过程中是否适当评估了风险。

据 Google DeepMind 称,Gemini Robotics ER 2 还改善了人类的感知能力。该系统旨在检测附近的人并触发适当的安全功能。如果有人进入工作区域,机器人可以以受控方式停止。当自主机器不能在防护围栏后面永久工作时,这种能力尤其重要。然而,此类人工智能功能并不能取代强制性的工业安全概念。传感器技术、风险评估和独立保护系统对于实际操作仍然是必要的。因此,所提供的功能形成了额外的安全层。

新视角:最重要的变化可能不在于单个壮观的动作,而在于缩短的学习时间。当设备上模型实际上可以通过少于 200 个示例适应新硬件时,小型自动化项目的经济性就会发生变化。机器人还可以承担以前传统编程成本太高的任务。然而,与此同时,对一些训练示例的质量产生了新的依赖。不正确或有偏见的数据可以更快地转化为真实的走势。因此,公司不仅需要机器人技术人员,还需要检查训练数据、行为限制和更新的程序。

Gemini Robotics ER 2 已可通过 Google AI Studio 获取。该模型还在 Gemini Enterprise Agent Platform 上提供私人预览版。对其他两种模型的访问受到更多限制。 Gemini Robotics 2 和 Gemini Robotics On-Device 2 最初可供选择的早期访问合作伙伴使用。公告中没有提及全面发布。也没有有关价格或具体商业部署日期的信息。因此,所展示的功能标志着重要的发展步骤,但尚未全面推向市场。

结论

Gemini Robotics 2 展示了人形机器人如何快速地从编程工具转变为适应性强的动作系统。阿波罗 2 号首次作为一个协调单元运行、攻击和计划。然而,特别令人兴奋的是本地处理、对新硬件的快速适应以及多台机器的协作。这是否会产生可靠的工厂助手取决于真实的耐久性测试、安全证据和运营成本。 Google DeepMind 为此提供了强大的智能层。现在,除了受控演示之外,它还必须证明它的实际效果如何强大、安全和经济。

分类:演示展示了什么以及没有展示什么

通过机器人模型控制人形机器人是实体人工智能的重要一步。然而,演示并不能自动证明串联操作的稳健性。在不断变化的现实环境中,可重复性、安全限制、错误处理、速度和性能至关重要。

常问问题

双子座机器人是什么?

Gemini Robotics 是 Google DeepMind 的一种人工智能方法,专注于机器人感知、规划和行动。它的目的是将语言和感知信息与身体动作联系起来。

这是否意味着阿波罗2号可以完全自主运行?

显示的控件或演示并不自动意味着在每个环境中完全自主。具体使用级别取决于任务、传感器、安全概念和培训。

为什么工厂对人形机器人感兴趣?

您可以在已经为人员、工具和货架设计的环境中工作。只有当性能可靠、可重复和可维护时,它们才具有经济意义。

来源

  • 谷歌 DeepMind:双子座机器人
  • 应用电子:阿波罗
Bewerte den Beitrag hier!
[Total: 0 Average: 0]
Nico Nuss [图像内容由人工智能生成]

作者 Nico Nuss 自 2001 年起专注于移动计算和自动化软件领域。凭借丰富经验以及对未来技术的浓厚兴趣,他重点关注机器人技术与人工智能。