
机器人学习一项新任务,曾经意味着数以千次的重复训练与大量数据标注。
但美国机器人初创公司Generalist AI最新发布的模型GEN-1.5,正在挑战这一根深蒂固的假设。这套系统只需观看一次长达3到12秒的人类演示,便能尝试完成从未见过的物理任务,整个过程无需梯度更新,也无需任何针对性的微调。
在覆盖十项具体任务的测试中,GEN-1.5仅凭一次示范就取得了平均59%的成功率。若额外提供五分钟的任务特定数据并进行10次梯度更新,成功率则进一步提升至83%。
这些测试任务贴近日常生活场景,包括拧开玻璃罐盖、从钱包中取出纸币、叠放杯子、清扫垃圾、翻开书本、拉开笔袋拉链以及取下吸尘器滤芯。
GEN-1.5的核心创新在于一种被称为"物理提示"的机制。
这是一个融合视频、传感器数据、语言指令与本体感觉信息的大型多模态模型,能够在其上下文窗口中保留长达30秒的信息,并以每秒100次的频率生成动作轨迹。
一次演示,无论是由人类操作手持夹爪完成,还是由机器人自身执行,都可以作为"物理提示"直接输入模型的上下文窗口。
一旦该示例被载入,机器人便可立即尝试执行任务,跳过了传统机器学习流程中反复训练与参数调整的环节。
Generalist AI特别强调,他们并未针对上下文学习能力对GEN-1.5进行专门训练。
公司也没有为促使模型具备这种"即学即用"能力,添加任何架构改动、元学习循环或额外的优化目标,这种能力似乎是模型规模与训练方式共同催生的自然结果。
这与传统机器人训练方式形成了鲜明对比。
在常规流程中,教会机器人完成一项新任务往往需要海量的任务专属数据,以及反复的优化迭代过程,而GEN-1.5试图从根本上绕开这一负担。
更值得关注的是,该模型展现出了将多个物理提示组合使用的能力。
研究人员先后向模型展示了"拉开笔袋拉链"与"从笔袋中取出钱币"这两个独立动作的演示,GEN-1.5随即将两者衔接成一段连续的动作序列。
在衔接过程中,模型自主生成了两段演示中都不存在的过渡动作,包括重新定位手部与应对操作失误的恢复动作,这意味着它并非简单复制,而是理解了任务之间的逻辑关系。
GEN-1.5的泛化能力还体现在跨越仿真与现实的鸿沟上。
研究团队用一段在模拟环境中录制的演示,成功提示了一台真实机器人完成任务,而这一模型的预训练数据中并不包含任何模拟场景。
由此产生的行为还能适应不同的机械手形态,以及物体位置与尺寸的变化,显示出较强的环境适应能力。
在另一项测试中,一名操作者在机器人摄像头前用自己的双手演示动作,机器人随后用它自身的机械手复现了这一操作,完成了从人类肢体到机械结构的动作迁移。
这种跨形态学习能力,恰恰是通用机器人技术长期追求却难以突破的方向。
真正令人印象深刻的,是模型在面对工具缺失时表现出的创造性应变。
在学会用刷子将方块扫入碗中后,当研究人员给它一根香蕉,它随即将香蕉当作临时刷子完成了同样的清扫动作。
而当研究人员改用一把畚箕时,模型并未生硬模仿此前的扫刷动作,而是发展出截然不同的操作策略,用畚箕直接铲起方块并倾倒入碗中。
Generalist AI认为,这些行为共同指向机器人编程方式的一次深层转变。
未来的用户或许不再需要为每一项新任务编写详尽的操作指令,只需演示一次期望达成的结果,剩下的物理执行细节将交由机器人自行推演完成。
如果这一技术路径能够持续扩展并保持稳定,机器人从"专用工具"迈向"通用助手"的进程,可能比外界预期的更快到来。
更新时间:2026-08-22
本站资料均由网友自行发布提供,仅用于学习交流。如有版权问题,请与我联系,QQ:4156828
© CopyRight All Rights Reserved.
Powered By 61893.com 闽ICP备11008920号
闽公网安备35020302035593号