机器人前瞻(公众号:robot_pro)
作者 | 周加琦
编辑 | 漠影
第二届世界人形机器人运动会刚刚结束,各种跑步、越障、跳远等运动竞技项目热度拉满,在各大网络平台刷屏。在这些充满观赏性的项目外,场景赛则将机器人放入家务、餐饮、商超等任务环节,考验其在复杂场景下的感知、理解与执行能力。
当机器人从“展示运动能力”走向“完成实际任务”,再到“真正规模化落地”,行业一直在思考:机器人如何获得接近人类的真实经验?
答案是:大量高质量、与真实物理世界交互的数据。但这类数据极度稀缺,截至2026年年初,全行业此类数据总量仅约50万小时。
上周,Figure下场自采数据并发布Index数据集,在上线的APP中内置数据管线,进一步探索从数据采集、管理和使用构建的闭环能力。这说明行业竞争正在从“采集更多数据”转向“生产更高质量、更可用于模型训练的数据”。
而在这一方向上,Ropedia早已开始布局。
在Ropedia CTO洪方舟看来,决定机器人模型最终能力边界的,依然是数据本身。但过去依靠遥操作采集数据的方式存在规模限制,难以满足具身智能大模型训练对于数据量和多样性的需求。
因此,Ropedia选择从第一视角数据采集切入,希望通过更高效的数据采集方式扩大真实世界经验的获取规模。不同于传统数据服务商,Ropedia从一开始将目光聚焦于真实世界数据基础设施。
近日,Ropedia进一步推出新一代数采设备HOMIE Gen2,作为面向Human Experience Capture的360°多模态采集系统,HOMIE Gen2进一步提升了真实场景数据采集与结构化输出能力。

机器人前瞻与Ropedia CTO洪方舟进行了深入交流,围绕HOMIE Gen2背后的产品逻辑与数据基础设施布局,探寻Ropedia如何把人类经验转化为Physical AI开箱即用的数据。
一、从“采数据”到“搭基座”,全栈能力是关键
今年以来,具身数据赛道持续受到资本关注,多家数据基础设施企业相继完成融资。Ropedia也完成了总计约三千万美元的融资。
成立不到一年,融两轮,资本为何选择Ropedia?答案在于其数据全栈闭环的能力。
现在行业需要的不是简单的“把数据采回来”。同样是一段真实世界数据,采集方式、任务类型和最终用途不同,对数据的要求也完全不同。
在洪方舟看来,当前市场上的数据企业大多聚焦某一个环节:有人负责采集,有人做设备,有人处理数据。但问题在于,前端采到的数据,未必是模型真正需要的;而到了后端发现数据不合适,再回头调整采集方式,成本又很高。
这意味着,数据采集和后续的数据使用不能割裂。只有把前后的需求连起来,才能知道什么数据值得采、应该怎么采,以及采回来之后如何继续用。
洪方舟表示,“我们把整个具身智能的数据基座当成一体来做,包括硬件、平台、算法、数据运营,形成一个完整闭环。在这个过程中,我们能知道什么是好数据,并且能在整个环节做对应优化”。
Ropedia并不是单纯扩大数据采集规模,而是从模型需求出发,反向定义数据采集和生产流程。
二、HOMIE Gen2升级:让第一视角数据采集更完整
在硬件上,Ropedia下足了功夫。
成立之初,团队用3D打印结构件,搭出了第一台第一视角数据采集原型机,内部将它称为“竹蜻蜓”。
后来,Ropedia优化了头戴结构,完成相机的布局,迭代出第二代设备R-Ego,这代实现了他们的第一笔硬件销售。随着技术和经验的积累,今年1月,他们研发的HOMIE系列Gen1正式走向产品化。

3月,其发布并开源旗舰人类经验数据集Xperience-10M,该数据集涵盖近1000万的真实世界交互片段、1万小时的第一视角视频与音频、超过10种同步模态,总规模接近1PB。
在使用情况上,Xperience-10M已位列Hugging Face全品类数据集下载量Top 2、具身智能数据集Top 1,并被AI2、Qwen等全球顶级AI实验室采用。
此次推出的HOMIE Gen2,则在数据获取的完整性、空间音频上进一步升级。
首先解决的是数据的完整性。
HOMIE Gen2搭载四枚广角摄像头,每颗相机独立持续输出一路实时画面,实现360°无死角,补齐了人类视线看不到的环境信息,第一视角数据更加完整。

在容错率极低的工业场景,机器人面对的是持续变化的三维环境,仅依靠正前方的画面,很容易留下视觉盲区,侧后方的人员、设备等变化都可能影响机器人。
除了看得全,HOMIE Gen2还加入空间音频能力,理解声音来源。
洪方舟举例,如果有人从身后叫了一声,普通音频只能记录“听到了声音”,而空间音频则可以进一步判断,声音来自哪个方向。这意味着,未来机器人不仅能听到环境中的声音,还能够理解声音与周围空间之间的关系。
同时,采集到的多模态数据还要解决对齐的问题。
HOMIE Gen2还加入200Hz 6DoF IMU,能够高频记录设备的运动状态。同时4路视频与IMU实现硬件级同步,时间同步误差低于50微秒。
此外,HOMIE Gen2还埋入了与外部硬件同步的端口。洪方舟介绍,有了这样的端口,头环就可以作为一个集中式Hub,外接其他可穿戴硬件,实现高精度同步触发,让不同设备采集的多路数据都能够在同一个时间轴上实现对齐。
这样一来,HOMIE Gen2不只是采集更多类型的数据,也进一步解决了不同设备、不同模态数据如何同步的问题。
最后,如果要让数采员能长时间大量采集,则需要提升产品的佩戴舒适度。
洪方舟表示,过去市面上一些头环产品可能更关注数据采集本身,对佩戴舒适性的考虑相对较少。HOMIE Gen2则专门进行了人体工学设计,一方面减轻设备重量,另一方面增加了用于托住后脑勺的支撑结构,让设备佩戴更加稳定、舒适。

佩戴时间变长,意味着单个采集者每天能够完成更多数据采集。不仅如此,该产品还支持离线采集,最高2TB本地microSD存储,进一步提升真实场景数据的日采集产能。
三、从能用到好用,构建多模态数据生产能力
采集只是第一步。从HOMIE系列头环采集到原始数据,本质上是视频、音频以及IMU等多种传感器信号,这类数据并不能直接用于模型训练,需要清洗、标注为可用的结构化数据。
转化是关键,洪方舟用两个例子详细解释。
其一是手部动作标注,过去手部识别和检测大多数基于第三人称视角训练,而具身智能更需要的是第一人称视角。在该视角下,手部位置、运动轨迹与视觉呈现方式都发生变化,传统模型在此场景下识别精度不足。
为此,Ropedia对数据和模型进行了针对性优化,使其能够更准确地提取第一视角下的手部动作信息。
其二是数据算法管线,Ropedia会将不同的算法算子串联起来,通过数据平台自动化生产所需的数据模块。在平台上完成标注、质检、人工终检等流程,生成相机位姿、双目深度、手部动作、全身动作等多模态数据。

可以看到,Ropedia用三层能力,把数据从采集端连接到模型端:以HOMIE系列硬件为入口,持续获取真实世界中的人类经验;将采集到的数据,通过自动化数据生产引擎转化为可用的数据资产;再通过数据集、模型训练与验证,判断数据对VLA、世界模型等模型的实际作用,并将结果反向用于下一轮数据生产。

三层能力相互衔接,让数据从“被采集”走向“可验证、可迭代、可持续生产”。
结语:补齐最后20%,数据基础设施走向产业落地
从最初团队用3D打印的产品到HOMIE Gen2,四代设备迭代背后,变化的不只是硬件形态,更是数据采集、处理和使用能力的不断补齐。
洪方舟告诉我们,对于操作成功率要求非常高的场景来说,80%的成功率远达不到部署要求,因此必然需要用数据来补齐这最后缺失的20%。
这背后反映的是,数据当下的角色正在迁移。当机器人从实验室里跑通demo,到真正放到工厂、商超、家庭里干活,数据的价值就不再只是“喂模型”了,而是直接决定机器人到底能不能用、好不好用。
未来,数据基础设施不仅服务于模型迭代,也将帮助产业方提前沉淀真实场景中的高价值数据。