机器人前瞻(公众号:robot_pro)
作者 | 钟宸
编辑 | 漠影

机器人前瞻8月26日报道,今天,美国机器人独角兽Skild AI正式发布全新机器人基础模型S1。

目前,该模型发布的X(原推特)帖子已获得190万浏览、近五千人点赞

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

S1具备上下文学习能力,只需提供一段演示视频,无需微调或更新模型权重,就能学会预训练阶段从未见过的任务,最长持续10分钟,包括煎松饼、手冲咖啡、移栽植物和套件组装等涉及几十个操作步骤的复杂任务。

Skild AI成立于2023年,由卡内基梅隆大学机器人研究所教授阿比纳夫·古普塔(Abhinav Gupta)和迪帕克·帕塔克(Deepak Pathak)创办。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

▲右为Abhinav Gupta,左为Deepak Pathak(来源:ISN)

而在今年初,Skild AI宣布完成近14亿美元(约合人民币94.07亿元)融资,本轮融资由软银集团领投,英伟达风险投资部门、麦格理资本、杰夫·贝佐斯、Disruptive以及1789资本共同参与。

且Lightspeed、Felicis、Coatue和红杉资本均加码投资,三星、LG、施耐德电气、CommonSpirit及Salesforce Ventures等多家战略投资者也加入投资行列。此轮融资已使该公司估值突破140亿美元(约合人民币940.86亿元)

一、做煎饼、种植物、制作咖啡,模型还能抗人类干扰

通过运用在预训练阶段学到的技能,或者创造新的技能,该模型可以制作咖啡、种植物、煎饼等,Skild宣称这些都是预训练阶段从未涉及过的任务

在该公司展示的视频中,S1可以完成煎饼的任务,其可以自主完成放油、倒入面糊、翻面、盛入碗中以及倒入调料的工作。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

且开发者可以通过向该模型展示如何冲泡咖啡,使其学会该任务。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

包括种植物,在示范后,S1可完成栽培土壤、种入植被、浇水等任务。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

Skild称,当S1第一次翻煎饼时,该公司假设这种动作已经出现在训练数据中,但其搜索了所有的预训练数据,没有找到任何涉及翻转操作的例子。 由此,该公司推断S1能够从通过一个视频提示完成超出预训练数据范围的任务

该公司表示,S1像语言模型一样学习新的任务。开发者可以通过视频演示来指导模型,S1就会输出相应的机器人动作,从而在任何环境、以任何形态完成任务,Skild在S1模型上采用了“上下文学习”(In-Context Learning)策略

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

在Skild展示的视频中,任务演示进入上下文窗口后,S1会将其转换为适应当前场景的的实现路径。

二、性能实现大提升,让模型学会“分布外”技能

Skild重点介绍了S1从“上下文”(context)学到了什么。首先是“分布外”(out-of-distribution)技能。

该公司指出,在机器人技术领域,训练数据仍然十分稀缺且成本高昂,这意味着许多重要的任务超出了预训练数据所涵盖的范畴。

因此,能够处理“分布外”技能的“上下文学习”(ICL)对于通用型机器人策略的开发至关重要。ICL预训练过程中产生的丰富视频信息有助于建立从示范到行动的功能映射,从而使得机器人在测试过程中能够学习到新的行为能力。

此外,该模型通过“上下文学习”,得以在长程任务中进行操作。要完成一个需要十分钟才能完成的任务,就需要具备多种能力,而这些能力在短时域(short horizons)内是难以被有效评估的:比如将各种操作步骤依次组合起来、跟踪任务进度、以及从错误中恢复过来。

Skild指出,这些能力与经过良好配置的ICL预训练模型天然契合,也是成功完成复杂任务所必需的。且该公司宣称,与传统的VLA模型相比,S1在性能上实现了质的提升。

对于已知的任务,S1能够达到与基于语言提示的VLA模型(language-prompted VLAs)相当的性能水平。Skild宣称,对于新的任务,随着预训练规模的扩展,S1在性能上远远优于任何现有的基于语言提示的VLA模型。该公司认为这有望建立机器人技术的scaling laws。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

在Skild发布的技术报告中,S1面对见过和未见过的任务,在成功率上都优于语言提示驱动的VLA模型,且在未见过的任务成功率上领先57个百分点

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

Skild指出,要达到S1仅通过一个视频提示就能达到的成功率,目前的VLA模型需要在收集50到100小时的数据后进行二次训练,再进行微调后才能达到。

该公司宣称,上下文学习的单次演示,大约相当于380个后训练(post-training)的示例数据。且上下文学习策略从来不会在任务上进行后训练,仅一个示例就能使该策略的成功率达到66%。不过值得注意的是,语言提示型VLA模型通过2000次示例的后训练之后,成功率达到86%,超过了采用上下文学习策略的S1。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

但在不同条件的干扰下,该模型成功率都高于语言提示型的VLA模型,鲁棒性更强。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

Skild也在技术博客里展现了该模型的鲁棒性,S1可以在受到灯光、物体移动等多种干扰的情况下完成任务。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

三、涌现新能力,是否里程碑突破待商榷

且值得注意的是,该公司指出,S1并不会盲目地重复视频演示的操作,它展现出了超越视频提示的常识性理解能力。该模型能够承受干扰,并且在没有人类帮助的情况纠正错误,有时执行精度甚至高于视频提示中的人类操作。

在Skild展示的视频中,S1还展现了抗干扰性,可在工作人员移动盘子后继续执行煎饼任务。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

该模型也能够在调换位置的情况下正确识别所需工具并进行使用。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

并且,该模型也展现了纠错能力。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

最后,该模型还展现了较高的操作精度,即使在人类操作视频提示出现问题或精度不足的情况下,S1会推测用户需求,并通过常识推理(common sense)完成任务。在视频中,人类操作员因操作失误,在敲碎鸡蛋后,蛋壳被带进了碗里,但S1在学习后并未将蛋壳带进碗里。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

评论区有人表示,该模型的发布将改变世界。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

也有人希望看到更多技术细节与demo之外的具体实操情况。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

不过,也有技术人员表示,这一模型并未实现根本性的突破,建议Skild摆脱对随机梯度下降(stochastic gradient decent)的依赖,并不仅仅通过上下文学习,而是在一次训练中实现永久性的学习。

百亿美元独角兽Skild 发布新模型,让机器人看一个视频,就学会煎饼种树做咖啡

Skild称,其将与工业合作伙伴一起部署系S1模型,并在接下来的几个月内,继续为更多的客户提供服务。

技术博客:https://www.skild.ai/blogs/s1

结语:看视频学会干活,真拐点还是好demo?

从“看视频学干活”到抗干扰、会纠错,S1让机器人基础模型在“上下文学习”这条路上跑通了完整的闭环。

单段演示替代数十小时的数据采集与微调,对数据稀缺、成本高企的机器人行业而言,这无疑是一条极具想象力的技术路线:它把大语言模型已经验证过的scaling故事,讲得有了点具身的模样。

但热潮之下仍需冷思考:单次演示66%与后训练2000次示例86%的成功率之间,依然横亘着一道鸿沟。对于现实场景而言,失败比成本更难以忍受。

正如推特网友所言,上下文学习能否进化为“一次训练、永久习得”,也决定了S1是阶段性的惊艳demo,还是通用机器人真正的范式拐点。随着Skild携手工业伙伴推进落地,答案或许很快就会走向真实产线。