机器人前瞻(公众号:robot_pro)
作者 | 刘俐杉
编辑 | 许丽思
机器人前瞻8月20日报道,今天,在宇树科技成立近十周年之际,宇树科技创始人兼CEO王兴兴在2026世界机器人大会上发表《从展品到产品:人形机器人产业的下一个十年》主题演讲。
王兴兴在演讲提出,当前人形机器人最大的问题不是“能不能动”,而是“换了个地方还能不能干”。他回顾了公司近十年的技术积累与产品迭代,指出泛化能力不足是全球具身智能行业面临的共同瓶颈,而宇树正在尝试一条新的路径,让物理AI模型自己编程、自己进化。
此外他还提出具身智能“确定性时刻”的判断:快则2—3年,慢则5—10年。
以下是王兴兴本次演讲内容的整理(机器人前瞻在不改变原意的前提下,进行了一定程度的增删修改):
一、十年历程:从四足到人形,从H1到G1
首先,回顾一下我们公司的情况,宇树科技成立于2016年8月,到现在将近10年整。宇树最早做四足机器人,最近几年进入人形机器人领域。

▲全产品预览
2024年推出的G1是近年较为成功的一款产品,推出后已成为全球人形机器人领域的标杆性产品之一。目前大家看到的绝大部分机器人产品,基本与G1为同款或外观高度相似。

▲G1
今年年初比较有代表性的产品是武BOT,我们提前采集了几十个中国功夫动作进行AI训练,将训练后的动作呈现于舞台表演。
这个节目最大的亮点是,结合了当前全世界最顶尖的人形机器人技术与中国传统功夫武术文化。这个视频在海外播放量达几百亿次。

▲武术表演
另外,今年2月,我们在天坛上有一个简单的演示,现场大概有49台机器人,进行全自动表演。天坛有着数百年的文化和历史,机器人技术在此呈现,过去中国几百年的文化和当前最新的技术交融在一起。这种穿越时空的感觉非常震撼。
4月份,我们也刷新了人形机器人奔跑速度纪录,其时速超越了10米每秒。
过去几年,宇树一直在推动机器人真正走进生活和工业场景。2024年,我们开始与汽车工厂合作推进产线落地应用,同时也在自己的工厂部署机器人进行测试与落地应用。
其实,我们公司绝大部分AI团队聚焦于机器人在家庭或工厂场景中的实际作业能力。但为什么现在没有大规模推广?最主要原因就是当前机器人的效率和泛用性能力不够高。虽然机器人已能完成部分简单装配任务,但效率仍低于人工
另外,每次遇到新任务,机器人又要重新训练,进一步拉低了整体效率。所以我们还是希望能够提高机器人泛化能力,再进行大规模推广。这也是目前全行业共同面对的核心瓶颈。
二、AI驱动的机器人:从数据采集到实时动作生成
当前机器人技术以AI为核心驱动,而AI的性能高度依赖数据支撑,有多少高质量数据,就有多少AI。我们通过自有采集或与第三方合作采集更多数据。
关于AI机器人训练数据,我认为核心构成包括两类:一类是海量互联网数据或真人演示数据,用作主要预训练数据;另一类是部分真机数据。从规模上看,前者占据主导地位,但后者同样不可或缺。因为只有通过真机数据,才能真正让机器人与物理世界进行匹配。
今年5月份,我们发布了全球第一款量产级的载人机甲。这款机器人身高大概有3米,载人以后,重量大概500千克左右。某种意义上,大家可能会好奇这款机器人的应用。

▲载人机甲
简单做个比喻,这款机器有点像一辆越野车,它并不是在家庭或者城市里面使用,它适用于户外徒步或复杂环境下的运输。另外比较有趣的是,它可以变形成四条腿的模式,稳定性和越障能力会更好。这也是为什么我们把它拿出来预售。
前几个月,我们演示了基于多模态和端到端的自动AI动作生成。这部分动作都是基于实时语音生成的。
它需要语音识别,识别以后上传到云端,云端进行AI动作生成,动作生成以后进行动作验证,验证好没有问题以后才下发给机器人,所以整个过程还需要几秒钟的延迟。
但我们希望未来机器人应用落地的时候,动作都是完全实时生成的,而不是提前做编程。
此外,我们也在推动机器人真正在会议室里干活,我觉得这也非常重要。

▲整理会议室
我们主要训练的是:在一个会议室,如果把环境任意打乱以后,机器人都可以把它恢复到干净整洁的状态。
因为完全基于端到端实现,所以运动效率目前相对较低。场景里布置了7到8个不同的任务,用一个模型驱动机器人自动切换并完成不同任务。
正因为是AI实时生成和识别的,大家可以看到它的动作可能没有那么流畅,因为它每走一步,动作都要进行推理,所以动作丝滑性相对较差。
我们前段时间也发布了最新一代的轮足As2-W机器人。这款机器人自重约20千克,但它的负载能力和续航非常强劲,并且可防雨水的,适用于室内外多种场景。
目前我们把部分人形机器人的技术迁移至四足机器人上,进一步提升四足机器人的灵活性。我们非常希望把这款机器人真正落地应用到户外徒步等场景。
以及,前段时间我们预览了一款新的机器人。这款机器人开发时间比较短,只花了三个多月的时间。
从某种意义上,这款机器人目前只是预览产品,还未正式发布。它的速度最快已经达到了12.65米每秒,超越了目前全世界历史上人类最快奔跑速度。跳跃高度同样超过人类历史最高纪录。
另外,2025年,我本人、我们公司及产品都登上了时代杂志的榜单。
三、数据、多模态与具身智能瓶颈:从数据驱动到“确定性时刻”
回顾最近几年具身智能的AI模型发展,最主要的流派是VLA模型,还有世界模型。当然今年大家听到最多的还是世界模型这个方向。我们公司对AI模型的投入非常大,是目前资金和人力投入最大的一个方向。

▲大模型演进
在2020年初,宇树就开始做基于视频生成的世界模型研发,但是在2024年底,发现效果不是特别理想,所以中间搁置了一段时间。但在去年我们又重新开始了基于视频生成的世界模型。
最典型的一个问题是,真正通用的机器人什么时候真正走进生活、走进家庭?其最大的问题,还是具身智能的泛化能力不足。
简单来说,目前多数AI模型在一个固定场景上,经过足够的采集训练,成功率可接近100%。但是如果操作的物品,或者环境发生变化,成功率会大幅下降。
所以我希望未来,快则2到3年,慢则5年或者10年,大家能看到,当一台机器人被带入任意陌生环境,带到家庭,可以完成80%左右的任务,我觉得就差不多已经到达了具身智能的确定性时刻。这就是未来产业的临界爆发点。

▲具身智能的确定性时刻
这个评价指标也非常简单,比如,将机器人带入约80%陌生的场景,通过语音和语言指令即可完成80%的任务。
目前要达到这个时刻,最大的瓶颈是目前的AI模型的输入输出与真实机器人对齐程度不够。
现有的机器人模型,在执行移动、装配或搬运等任务时,它的整个趋势是没有问题的,但最后的几厘米或者几毫米的偏差,让它没办法精准匹配物理世界。

▲核心挑战
比如,机器人在接近目标物体时,视觉上已接近抓取位置,最后一点触觉、最后一点误差,它没办法很好地修正,导致成功率急剧下降。这是目前全球具身智能领域面临的核心技术瓶颈,AI模型的输入和输出跟真实世界有偏差。
为什么机器人会有这个问题,而一般的语言模型或多模态模型没有?因为语言模型的输入输出均为数字编码,一个文字,输入是什么,输出就是什么,严格限制在向量空间里,基本不会有大的偏差和损失。
但对于机器人来说,每进行一次输入输出都存在偏差和损失,所以导致目前模型真正的泛化能力和成功率受限。但是我觉得在未来几年,这是必然可以解决的问题。
四、开启物理AI自进化新纪元:让大模型自己写代码、自己进化
过去很多年,AI已在编程与开发中得到广泛应用,但我认为在机器人领域上的开发,还是相对比较欠缺。
所以我们公司最近一段时间在推动的一件事情,就是直接让物理AI计算模型自进化。
也就是让目前最前沿、顶尖的AI大模型来驱动,我们自己设定规则、经验,约束和工具,让其自主去网上搜索最新的论文、研究成果和开源方案,并自己编程,生成机器人控制代码。控制代码生成后,它可以在仿真环境里面运行,或者调用大模型状态控制实物机器人。
我们在实物机器人上做一些部署测试,进行评价和打分。评价和打分的一部分由机器人AI模型自动实现,还有一部分由人工参与,因为人非常容易判断出来这是好的还是坏的。
这套逻辑成体系后,一旦运行起来,将显著提升机器人开发效率与迭代速度。一旦这个流程运行一段时间,真的可实现机器人自我进化能力的提升。
这里有一个简单示例:左下角就是一个Coding智能体,它自己编写机器的一些控制代码,借助深度强化学习算法,实现自动编程。

▲机器人自进化
把这部分编程效果放到仿真环境里做验证,训练好以后,我们再把它部署到机器人上测试,测试好后,通过AI模型和人打分评价,再反馈给编程智能体,形成一个正向循环。
为什么要这么做?
第一,随着每个月、每年的基础模型能力提升,自进化循环会进一步提升,所以某种意义上是可以跟随全球AI技术进步。
第二,可以更好地使用多元数据。因为人使用数据效率非常低,机器人使用这个自循环,可以把各种数据,训练数据,包括真实世界、人的数据整合利用,效率会更高,并支持更多真机部署。
随着真机部署越来越多,测试数据和评价指标增加,可以保证数据的利用率和增长率更加规范。
而且我们可以每天或者每个月累加一些技能。真正使用AI,把机器人开发效率或者机器人进化效率大幅度提升,这是非常重要的。我认为这也可以开启一个物理AI机器人自进化的新纪元。
未来10年,在当下新的起点,尤其在AI大爆发、全球关注度非常高的时间,整个机器人进化速度已经大幅度提升。可能未来发展速度比我预估的还会更快一点,我觉得这是一个全新的起点、全新的开始。