机器人前瞻(公众号:robot_pro)
作者 | 周加琦
编辑 | 漠影

机器人前瞻10月9日报道,昨天,Aether AI正式推出了因果机器人智能系统CRIS-0,并发布了一段长达7分钟的机器人真机演示视频,展示了机器人在动态环境下的自主执行和任务恢复能力。

Aether AI成立于2026年,是一家专注于因果世界模型的企业。今年6月,该公司完成2000万美元(约合1.35亿元人民币)融资。

其创始人黄碧薇,是美国加州大学圣地亚哥分校(UCSD)Halıcıoğlu数据科学研究所(HDSI)助理教授。

她在NeurIPS、ICML等国际顶级会议及期刊发表论文逾百篇,获得Apple Scholar等奖项,还主导开发了因果发现领域的全球标准开源工具Causal-Learn和Causal-Copilot,在因果发现与机器学习领域有着超过十二年的研究经历。

华人教授黄碧薇新成果:机器人干活,终于会三思而后行了

▲Aether AI创始人黄碧薇(来源:黄碧薇个人网站)

在演示视频中,当旁边的人不断移动咖啡袋的位置时,机器人能够实时调整手臂动作,重新定位并准确抓取。即使受到光照干扰,机器人仍能完成倒咖啡豆、打开设备等操作。

更有意思的是,当旁边的人把盘子里的蛋糕换成了其他物品时,机器人能识别刚刚抓取的物品发生了变化,不符合任务要求,重新将其替换成蛋糕。

而在关闭微波炉门的过程中,旁边的人突然伸出手挡住炉门,机器人也能及时停止关门动作,避免发生碰撞。

面对接连不断的人为干扰,机器人不仅能够识别环境变化,还能判断当前任务是否完成,并根据实际情况调整操作,甚至重新执行此前的步骤。

与单纯按照预设流程执行动作不同,CRIS-0通过因果状态记录任务进展,持续检查操作结果,并根据环境变化自主调整后续动作。实现上述能力,该系统主要依靠两大核心模块:

因果驱动的机器人Agent:以因果状态转移为核心框架,根据任务状态选择操作工具、执行任务并验证结果。

因果世界模型:建模并预测不同动作可能产生的物理结果,辅助机器人进行操作决策。

两大模块相互配合,让机器人不仅能够判断下一步该做什么,还能检查上一步是否真正完成,并在出现意外情况时及时调整。

一、统一任务状态与工具调用,机器人能自主纠错

机器人在真实环境中执行任务时,往往需要调用不同的能力,例如识别物体、移动手臂、抓取物品,以及判断操作是否成功。如何让这些能力相互配合,并在出现意外情况时及时调整,是机器人完成复杂任务需要解决的问题。

CRIS-0将所有控制和验证策略封装成可调用的工具,包括策略模型、Agent生成的规则函数、基于SLAM的导航模块、世界模型以及验证器等。

通过少量示范数据,CRIS-0能获取这些可复用的工具和技能,并在执行任务的过程中,根据当前状态实时调用。另外,当某个工具在执行过程中出现故障时,该系统还会自动修正工具,并重新尝试执行对应的任务阶段。

华人教授黄碧薇新成果:机器人干活,终于会三思而后行了

▲Agent架构(来源:Aether AI)

具体来看,该系统主要通过统一因果状态、统一工具接口以及结构化状态转移循环,实现任务的自主执行和纠错。

首先,在任务状态方面,CRIS-0通过一组关键因果变量来描述每个任务阶段,并将输入和输出组织成统一格式。

如调整桌布一角,机器人需要关注三个关键变量:是否抓住桌布、桌角距离目标位置还有多远,以及拖动过程中是否发生滑脱。

这些变量决定机器人能否开始拖动、需要向哪个方向移动多远,以及是否需要重新抓取。在整个过程中,CRIS-0会根据摄像头观测和工具反馈持续更新任务状态,判断当前操作是否完成,以及下一步应该采取什么动作。

其次,CRIS-0设计了一套统一工具接口,让不同类型的机器人能力能够按照一致的调用方式运行。

例如,当用户要求机器人拿一瓶符合自身健身目标的饮料时,系统首先根据用户需求选择合适的饮品,然后调用基于规则的运动规划函数,将夹爪移动到目标饮品附近,最后再调用策略模型完成抓取。

在这一过程中,不同工具承担着不同的任务。规则函数主要负责目标定位和接近动作,策略模型则负责需要精细接触控制的抓取操作。

除了选择合适的工具,CRIS-0还需要判断每一步操作是否真正成功。该系统采用了状态评估、工具执行、结果验证的循环机制,并通过任务图管理整个执行过程。

华人教授黄碧薇新成果:机器人干活,终于会三思而后行了

▲分解步骤(来源:Aether AI)

CRIS-0会根据少量遥操作示范,将完整任务拆解为多个可以独立验证的阶段,并为每个阶段设置执行工具和成功条件。

这些阶段会按照依赖关系连接成任务图,其中每个节点代表一个具体任务阶段,节点之间的连接则表示任务状态的变化与转换。

以收拾桌布为例,机器人需要先将桌布推出桌沿,再移动夹爪、抓住桌布、完成折叠,最后将其放进篮子。每完成一个阶段,系统都会检查操作结果。

这种机制让机器人能够在错误影响后续操作之前,及时发现并修正问题。

此外,CRIS-0不仅能够重新执行任务,还能根据错误反馈修改工具本身。

如机器人抓取水果失败后,该系统会结合当前任务状态和执行反馈分析失败原因,并针对性地调整,重新尝试对应的操作。更重要的是,修正后的工具可以被保留下来,在后续执行类似任务时重复调用。

这让机器人不仅能够处理当前遇到的问题,还能逐步积累可复用的操作能力。

二、不只预测未来,还能直接生成机器人动作

除了因果驱动的机器人Agent,CRIS-0的另一项核心技术是因果世界模型。

大多数的世界模型侧重于预测未来的图像画面,而CRIS-0的因果世界模型则引入了与任务相关的因果变量,不仅关注未来画面会发生什么变化,还关注机器人执行某个动作后,物理状态会如何改变。

该系统的因果世界模型主要采用了一套结构化预测机制。当输入当前环境观测和候选动作后,模型会首先预测关键因果变量的变化,再根据这些变化生成未来的视觉画面。

Aether AI通过几组视频展示了因果世界模型生成的能力,涵盖了人机交互和日常操作。其中,在人机交互场景中,模型生成了机器人向人递送杯子、人伸手接过杯子。

华人教授黄碧薇新成果:机器人干活,终于会三思而后行了

在柔性物体操作场景中,模型预测了夹爪提起衣服下摆,并将衣服折叠的过程。

华人教授黄碧薇新成果:机器人干活,终于会三思而后行了

此外,模型还展示了将蓝色瓶子放入抽屉、摆放餐盘、将红色小球移动至下层货架,以及双手交接物体等操作的未来画面。这些演示覆盖了不同物体之间的空间关系变化,以及柔性物体和双手协调的操作过程。

不仅如此,Aether AI还进一步将因果世界模型扩展为能够直接生成机器人动作的策略模型,在原模型基础上增加了一个动作模块。

世界模型主干继续负责学习和预测物理世界的状态变化,新增的动作模块则利用共享的特征表示,将模型对未来状态的理解转化为机器人可执行的控制动作。

这说明,该模型并非仅根据当前观测直接输出机器人动作,而是能够结合预测的未来因果状态,以及动作相关变量,生成最终的控制指令。

结语:机器人不仅要会做事,更要能应对物理世界变化

过去,机器人能力的提升更多体现在能完成多少种任务、操作成功率有多高。但进入真实环境后,机器人面临的挑战远不止于此。

物体位置可能随时改变,操作过程中可能出现意外,人类也会不断介入。CRIS-0正是让机器人在执行任务的同时,持续判断当前状态、预测动作结果,并在出现异常时自主调整。

当然,目前CRIS-0展示的能力仍需要在更多未知场景和长时间连续作业中得到验证。机器人真正走进现实世界,拼的不只是一次操作能否成功,更是面对不断变化的环境,能否发现问题、解决问题,并最终把任务完成。