重新编程一台机器人通常需要数小时甚至数天。Skild AI的S1希望通过一个视频,就理解栽种植物、制作手冲咖啡或组装套件等陌生任务。不过,公司公布的成功率也说明,从引人注目的演示到可靠的工业生产,仍然存在明显距离。

这一承诺听起来非常直接:人类完成一次任务,摄像头记录过程,机器人随后尝试复现,不需要采集新的训练集,也不需要更新模型权重。如果这种方法能在精心选择的展示之外稳定工作,它可能改变机器人行业最昂贵却不显眼的环节之一——让机器适应新工位、新物体或新客户。

本文目录

Skild S1究竟改变了什么

Skild AI把S1描述为具备上下文学习能力的通用机器人模型。视频并不是用于耗时的微调,而是在执行时充当提示。模型保持同一套权重,却要理解一个以前没有见过的长流程,并把观察到的步骤转化为机器人动作。

Skild与NVIDIA展示的任务包括给植物换盆、制作煎饼、冲泡咖啡和组装套件。这些例子并非单一抓取动作,而是包含多个连续环节。机器人必须定位物体、选择下一步、控制力度、记住进度,并在现实场景与视频不完全一致时调整策略。

NVIDIA表示,植物换盆案例从录制人类示范到在真实硬件上执行,大约用了11分钟。其他画面还显示物体被移动后机器人能够适应,并在出错后继续任务。恢复能力比剪辑后的完美结果更有价值。真实工作场所充满小变化,一台每次偏差都需要人工重置的机器人,只会把成本重新转移给操作员。

视频提示为何不同于传统编程

工业机器人擅长重复精确规定的动作。工程师会设定位置、轨迹、速度、安全区域和异常处理。在稳定的大批量生产中,这种方式仍然高效;当产品频繁变化,或任务包含太多变体时,刚性程序的配置成本就会迅速上升。

示教学习并不是新概念,S1可能带来的变化在于压缩适配过程。Skild称,一次上下文视频示范的效果,大致相当于380个用于后训练的示例。公司估计,通过远程操作收集同等数量的数据可能需要50至100小时。如果适配时间真的从数天缩短到几分钟,小批量制造、实验室、物流和服务机器人都可能出现新的商业空间。

但“上下文学习”不代表机器人在打开摄像头时从零开始。S1此前已经通过大规模训练建立了视觉、物理和行为模式。新视频帮助模型选择并组合已有能力。这更像给一名经验丰富的员工看一次示范,而不是在11分钟内教会一个新手所有物理规律。

如何正确理解66%的成功率

Skild报告,在陌生的多步骤任务上,仅看一次示范后,S1每个步骤的成功率约为66%;一个仅依靠语言提示的类似系统约为9%。如果测试条件具有代表性,超过七倍的提升非常有意义。公司还表示,使用2000个特定任务示例进行后训练的基线系统达到约86%,已见任务则约为96%。

然而,每步66%并不等于能够可靠完成一个十分钟流程。每一次抓取、倾倒和放置都会增加新的失败机会。各步骤并不一定相互独立,因此简单相乘也不科学,但运营层面的结论很明确:长任务会放大小缺陷。研究演示可以重新开始,生产线在一个班次中却不能频繁重置。

这些数字目前主要由公司发布,并非经过广泛复制的独立基准测试。它们是有希望的证据,却不能视为通用自主能力认证。外界仍需要知道测试覆盖了多少机器人类型、物体、光照和工作环境,循环时间如何,需要多少人工干预,以及失败是否可能造成损坏或安全风险。

结果背后是一个数据工程问题

通用机器人模型需要的经验规模,无法完全依赖真实硬件经济地获得。远程操作产生的数据与物理世界高度相关,但速度慢、成本高。人类视频数量巨大且多样,可人的身体、手部结构和活动范围与机器人不同。仿真能够快速安全地产生数据,却无法完美复制接触、摩擦和材料特性。

Skild试图组合这些不完美的数据来源。NVIDIA提到该公司在开发中使用Cosmos、Omniverse、Isaac Sim和Isaac Lab。核心挑战是领域差距:如何把来自人类视频、仿真环境和某一种机器人机身的知识,转化为另一台机器可用的动作。S1的一次视频学习之所以重要,是因为它暗示足够广泛的先验知识可以在部署时缩小部分差距。

缩小差距不等于消除差距。双臂机器人可能理解人的意图,却没有相同的手部几何结构、触觉反馈或柔顺控制能力。视频能够展示发生了什么,却不总能显示动作成功所需的具体力量、摩擦或隐藏接触。

哪些场景可能最先受益

短期内最可信的价值并不是替代所有传统机器人程序,而是降低经常变化任务的工程成本。合同制造、履约中心、实验室、食品加工和维护团队都面对结构化但不完全相同的工作。这些任务过去往往因为配置费用过高而无法自动化。

企业可以用视频条件模型生成第一版行为策略,再加入安全限制、验证流程和针对性数据。即使仍然需要人工批准,把初次配置从几十小时缩短到几分钟也可能很有价值。因此,真正应该比较的是总调试成本、人工干预率和有效运行时间,而不是单个视频看起来多么流畅。

NVIDIA的报道还引用了Skild的商业数据:运营十个月后,年化收入运行率达到1亿美元,并拥有60多个部署合作伙伴。这说明市场兴趣强烈,但数据来自企业方面,不能替代对收入质量、客户留存和机器人队伍实际表现的独立审计。

安全与验证不会消失

能够从视频推断任务的机器人仍然需要边界。运营方必须明确允许接触的物体、力量和区域,规定感知不确定时的行为,以及何时停止或请求帮助。模型越灵活,监控、可追溯测试和异常记录就越重要。

示范本身也要经过审核。错误的示范可能编码危险捷径,摄像头角度可能隐藏关键步骤。对泡沫材料安全的动作,换成玻璃、热液体或锋利工具后可能带来风险。一次学习把工作从传统编程转移到流程设计、审核和风险管理,并没有取消责任。

Alpha Bionic观点

S1最值得关注的是它可能形成一种新的人机接口。重点不是机器人神奇地通过一个短片学会一切,而是一个经过广泛训练的物理模型,可以把新示范当成临时指令,类似语言模型在上下文中使用一份新文档。

对采购方而言,下一个里程碑是跨工厂、跨机身和跨普通操作员的重复性证据。合理的评估应同时公布完整任务成功率、人工干预分钟数、错误恢复、循环时间和失败严重程度。如果这些指标持续改善,同时不依赖隐藏的大量工程师,视频提示才可能成为通用机器人智能与现实工作之间的实用桥梁。

资料来源

Bewerte den Beitrag hier!
[Total: 0 Average: 0]