机器人前瞻(公众号:robot_pro)
作者 | 周加琦
编辑 | 漠影

机器人前瞻7月31日报道,昨晚,Google DeepMind在X上宣布正式推出Gemini Robotics 2

Google DeepMind配文称:“一颗大脑,适配所有机器人。Gemini Robotics 2:作为新一代物理AI,为人形机器人赋予全身智能,实现灵巧操作、多机协同等能力。”

机器人通用大脑来了,谷歌连发三款模型

▲(图源:X)

Google DeepMind同步公布多个演示视频,借助Apptronik Apollo 2人形机器人,搭载Gemini Robotics 2完成各项能力验证。

机器人通用大脑来了,谷歌连发三款模型 机器人通用大脑来了,谷歌连发三款模型

▲(图源:X)

评论区有网友将机器人的自主学习过程,类比成儿童学习行走、操控肢体的成长模式,认为持续学习、建立事物间关联是智能进化的关键;并有网友对此技术成果表示肯定,期待家庭机器人的到来。

机器人通用大脑来了,谷歌连发三款模型

▲(图源:X)

但也有网友评论称,“它看起来比宇树慢得多。”

此前,Google DeepMind就已经发布过机器人相关模型。

2025年3月,Google DeepMind首次发布Gemini Robotics,这是基于Gemini 2.0构建的VLA模型。同步,Google DeepMind发布Gemini Robotics-ER,该模型具备空间理解能力。

2025年6月,Google DeepMind发布Gemini Robotics On-Device,该模型具备通用灵巧操作能力与任务泛化能力,并支持机器人本地部署。

2025年9月,Google DeepMind再次发布Gemini Robotics 1.5和Gemini Robotics-ER 1.5。

其中Gemini Robotics 1.5,能够在行动前进行推演并输出思考过程。Gemini Robotics-ER 1.5可对物理世界进行推理,生成详细的多步骤任务方案。

此次发布的Google robotics包含三个模型:

Gemini Robotics 2能将视觉和语言输入,转化成电机控制。该模型能够控制人形机器人(从脚趾到指尖),以及其他双臂机器人。此外,该模型可驱动灵巧手和夹爪完成更多高难度精细任务。

Gemini Robotics ER 作为视觉语言模型(VLM),它能够充当agent,让机器人能够实现与人交互、理解物理世界,并可自主规划长时序的多步骤任务。此外,该模型新增了多机协同作业能力。

Gemini Robotics On-Device 2作为一款端侧VLA模型,针对机器人设备在本地运行进行优化。该模型仅需数小时训练,就能快速适配不同的机器人本体。

一、夹爪任务表现最佳,多指灵巧操作仍是短板

Gemini Robotics 2通过控制三种不同硬件平台完成大量全身运动与精细操作任务。

三种硬件平台分别为:Apollo 2搭载的SharpaWave灵巧手与Inspire灵巧手,以及配备Robotiq夹爪的Franka Duo机械臂。

测试结果显示:在全身协同完成拾取任务中,桌面拾取任务成功率为68.4%,货架拾取任务成功率为76.3%,地面拾取任务成功率仅45.7%

因为地面拾取任务需要弯腰、调整全身姿态,难度相对高,所以成功率低。

机器人通用大脑来了,谷歌连发三款模型

▲全身协同拾取任务成功率(图源:Google DeepMind)

在多指灵巧操作任务中,拧灯泡任务成功率最高,达到92%,其余精细化任务成功率普遍在32%~44%

机器人通用大脑来了,谷歌连发三款模型

▲灵巧手操作任务成功率(图源:Google DeepMind)

在夹爪任务中,整体表现都很亮眼,通用拾取放置任务成功率达74.2%,多样工具组装任务成功率为78.9%,精确插入任务成功率高达89.6%,表现最优。

机器人通用大脑来了,谷歌连发三款模型

▲夹爪任务成功率(图源:Google DeepMind)

二、全身协同+跨末端适配:人形机器人运动与精细操作能力升级

Gemini Robotics 2将物理AI能力扩展到全身运动控制范畴,首次实现人形机器人全身控制。该模型能够将指令意图转化为智能全身控制的指令。

如下达指令“把洒水壶放到底层货架的绿色收纳箱中”,Apollo 2便可解析指令,走向桌面拿起洒水壶,移步至货架区域并精准完成放置。

在官方发布出来的视频中可以看到,研究人员下达指令“儿童需要进行运动”,Apollo 2便自动解析已设置的日程任务,完成棒球与匹克球运动工具的搜寻与放置。

机器人通用大脑来了,谷歌连发三款模型

▲抓取棒球手套(图源:Google DeepMind)

机器人通用大脑来了,谷歌连发三款模型

▲放置匹克球拍(图源:Google DeepMind)

另外,Gemini Robotics 2在适配不同末端执行器上的操作能力大幅提升,该模型可以控制Apollo 2上搭载的22自由度五指SharpaWave灵巧手,可操控Franka Duo平台配置的夹爪。

机器人通用大脑来了,谷歌连发三款模型

▲清洁桌面(图源:Google DeepMind)

机器人通用大脑来了,谷歌连发三款模型

▲密封食物袋(图源:Google DeepMind)

机器人通用大脑来了,谷歌连发三款模型

▲扭灯泡(图源:Google DeepMind)

机器人通用大脑来了,谷歌连发三款模型

▲打结(图源:Google DeepMind)

机器人通用大脑来了,谷歌连发三款模型

▲紧凑工具装配(图源:Google DeepMind)

三、ER 2升级规划能力,支持长时序任务与多机协作

现实场景中大多数任务都需要长时间去持续执行,且包含着一连串的复杂操作步骤。此次发布的Gemini Robotics ER 2可充当机器人的“大脑”,负责理解人类指令,完成与人类交互,感知周边环境,并推演完成目标所需的操作流程。

该模型协同VLA模型,持续追踪任务进度,直到任务完成。因此,机器人能够执行复杂、多阶段任务,出错能自主纠错。面对从未见过的新场景和目标,该模型同样能完成任务,泛化能力显著提升。

此次升级,机器人能够更加稳定执行数分钟、上百次决策的长时序任务。同时支持多机协同,不同类型机器人可配合作业,完成更多复杂工作任务。

四、On-Device 2实现高效迁移,快速适配各类机器人平台

Gemini Robotics On-Device 2支持多硬件载体兼容,延续了Gemini Robotics 1.5的运动迁移技术。

该模型仅需数小时,并在不足200条示例数据情况下,就能完成对全新双臂机器人平台的适配。对于外形、传感器、自由度差异大的机器人硬件,同样能够快速适配,在Dexmate、SO101、Trossen多款平台已完成多样化任务验证。

机器人通用大脑来了,谷歌连发三款模型

▲(图源:Google DeepMind)

此外,Google DeepMind还推出了ASIMOV-Agentic评测基准,能够检验具身推理agent是否会拒绝来自VLAA模型的危险指令。

同时ASIMOV-Agentic可评估agent预判任务可行性的能力,当agent认知不确定时,是否会主动请求人类帮忙。

结语:从单点突破走向通用迁移

从2025年3月首次发布到如今一口气推出三款模型,Google DeepMind在一年多时间里完成了四次重要迭代。这不仅仅是模型版本的升级,更展现了物理AI赛道的核心竞争逻辑:从“单一技能突破”转向“跨本体通用能力迁移”

但回到本次发布的模型,无论是全身协同,还是手部精细操作,都有明显的提升空间。全身协同决定了机器人能不能走进真实环境,手部操作决定了它能不能真正干活。想要实现规模化落地、真正走进家庭,二者缺一不可。