EMBODIED DAILY

Generalist AI 发布 GEN-1.5:看 3–12 秒单次演示就能学会物理任务

原标题:New robot model learns physical skills from just 3–12 seconds of a single demo
Generalist AI 发布 GEN-1.5:看 3–12 秒单次演示就能学会物理任务

Generalist AI 推出了一款名为 GEN-1.5 的机器人基础模型,它可以从仅 3 到 12 秒的单次物理演示中学会新任务,并且无需梯度更新或微调就能立即尝试执行。

该模型被设计为直接从物理示例中学习,工程师不必为每一项新任务重新训练模型。公司表示,GEN-1.5 能从简短的传感器-运动演示中推断出应该做什么,并立即亲自尝试。

在 10 项刻意设计得简单且短小的物理任务测试中,仅给一次演示时,GEN-1.5 的平均成功率为 59%。如果额外提供 5 分钟任务专属数据并进行 10 次梯度步骤微调,平均成功率则上升到 83%。这些任务包括拧开玻璃罐盖子、从钱包里取钱、叠杯子、扫地、打开书本、拉开铅笔袋拉链以及取下真空吸盘等。

GEN-1.5 是一个大型多模态模型,能够同时处理视频、传感器、语言和本体感觉数据。它保持 30 秒的上下文信息,并以 100 Hz 的频率生成动作轨迹。演示本身被 Generalist AI 称为「物理提示」,可以来自人使用手持夹具的操作,也可以来自机器人自己执行该任务的过程。

一旦示例被放入模型的上下文窗口,机器人就会在没有训练阶段的情况下尝试任务。公司强调,他们并没有专门训练 GEN-1.5 进行上下文学习,也没有添加架构改动、元学习循环或额外的即兴目标。这使得该结果有别于传统的机器人训练——后者通常需要大量任务专属数据和反复优化。

GEN-1.5 还能组合多个物理提示。在一次演示中,模型分别观看了拉开铅笔袋拉链和从钱包取钱的示例,随后它拉开拉链并取出了一张美元钞票,完成了从未训练过的组合任务。

← 返回第 22 期 阅读原文(Interesting Engineering)↗