机器人前瞻(公众号:robot_pro)
作者 | 周加琦
编辑 | 漠影

机器人前瞻8月267日报道,近日,杭州AI数据运营商景联文科技发布了一批用宇树机器人采集的真机数据集,包含近15000小时的真机数据,用于模型训练。

对于当前的具身智能行业而言,15000小时真机数据已经是一笔不小的数据量。但对整个行业来说,远远不够。

相比大模型时代已经积累了亿级的互联网数据,具身智能没有现成的大规模数据可用于训练。

对于长期处在数据产业的企业而言,这种差异感更明显。景联文科技在数据行业做了8年,也经历了数据需求从大模型时代向具身智能时代不断变化的过程。

景联文科技CEO刘云涛告诉机器人前瞻,具身智能与大模型时代最大的区别,在于数据来源的不同。大模型时代有互联网数据,市面上已经积累了大量文字、图片、视频。但具身智能不同,它没有现成的大规模数据用可供训练。

华为的数据供应商,拿下90%的具身大脑企业|对话景联文CEO

▲景联文科技CEO刘云涛(图源:景联文科技)

在他看来,这也是为什么具身智能数据不会像大模型数据一样快速被填补。

语言模型的数据每天都在自然而然产生,刘云涛说:“我们现在对话的视频拿去标注一下,就能用来训练。”

但机器人不一样,它需要在真实场景中,完成真实任务来采集数据。“具身智能不是万众全民都替你干,更何况现在具身智能设备本身也有很多技术挑战。”刘云涛说。

除了数据数量,他认为,现在最重要的是采的数据质量要高,种类要足够丰富。

他们将高质量数据总结为“四真两度”,即真人、真场景、真任务、真机,以及根据不同任务需求定义数据维度和精度。

但同时满足这些要求,并不容易。

一方面,真实场景和真实任务难以规模化复制,机器人需要在不同环境中完成不同任务,才能获得有效训练数据;另一方面,机数据采集成本较高,涉及机器人本体、多模态传感器以及后续的数据处理流程。

这也意味着,具身智能的数据缺口并不是简单增加采集数量就能解决的问题,而是需要建立一套覆盖数据采集、治理、标注和应用的完整体系。

数据质量和数量最终都会反馈到模型能力上。只有不断积累真实、多样、高质量的数据,模型才能从真实世界的交互中学习更多任务和动作。

正是看到了这一数据缺口,景联文进一步布局具身智能数据方向。但景联文并不是一开始就做数据,刘云涛也不是一开始就加入了景联文。

景联文成立于2012年,早期主要从事指纹算法业务。正是因为看到传统算法向AI算法转型的趋势,他选择了景联文。加入后,他发现,算法本身不容易被用户感知。同时,如果数据源掌握在别人手中,公司很难形成长期壁垒。

“我当时感知到,指纹算法总有没落的一天”。

2019年,刘云涛带动公司转型做数据。从最初卖指纹膜的数据,到后来布局大模型数据、具身智能数据。

数据就像石油,源源不断被需要。”他说。景联文不只是提供数据采集服务,而是连接数据生产、处理、流通和应用的数据运营商。

机器人前瞻与刘云涛进行了近一个半小时的深入交流。我们聊了聊景联文为什么把数据作为新的方向;如何让大多数大脑厂商都选择景联文的;以及具身数据的缺口该如何去解决。

以下为本次对话实录,机器人前瞻在不改变愿意的基础上进行了整理。

一、从指纹算法到数据服务,刘云涛的两次选择

机器人前瞻:当时是什么样的契机,让您决定加入景联文科技的?

刘云涛:景联文当时是一家做指纹算法的公司,并且拿了LivDet(国际活体指纹检测大赛)的一等奖,华为、vivo、oppo都是合作伙伴。起初,我对AI完全没有感觉,但敏锐地感受到传统算法正向人工智能迁移,这是一个不可逆的结构性机会,所以我选择加入。

机器人前瞻:景联文最初做指纹防伪算法,到后来转型做数据服务,这个转型是在什么时间节点、基于什么判断决定的?

刘云涛:我加入景联文后负责指纹防伪算法,但是这项技术会额外消耗手机存储和算力,并且用户也缺乏感知,很难成为手机厂商的核心卖点。

转折点出现在2019年,安卓系统要求所有的指纹、人脸识别都得搭载防伪算法,景联文迎来了短暂的红利期。

防伪的本质是攻防博弈,防守手段最好,恰恰证明我们的攻击手段最好。所以当时全球的传感器厂商、手机厂商、测试机构,基本上都用景联文的数据进行测试和训练。

机器人前瞻:转型是一个非常重大的决定,您刚加入景联文就带动转型,内部核心团队对这个方向的分歧大吗?

刘云涛:我刚加入时,公司内部就已经形成共识——算法业务瓶颈非常明显

1、景联文指纹方案算法很好,但还需要打通客户方,让客户方真正愿意买算法;

2、另一个是指纹传感器。比如客户已经决定要买景联文的产品,但我们需要指纹传感器企业把指纹的原始图像开放给我们去做训练,如果这家企业不开放,我们就一点办法都没有。

所以,大家逐渐意识到,算法是“点状”突破,而数据是“面状”基建,团队的转型分歧比想象中要小。

机器人前瞻:为什么当时会选中数据服务这条赛道?

刘云涛:复盘AI的发展历程,无论是早期的自动驾驶,还是当下的大模型与具身智能,每一轮爆火的背后,数据始终被需要。

更重要的是数据像汽油一样是消耗品。景联文做的,就是把石油炼成汽油。所以AI时代的数据生意,本质上是“能源生意”,一旦做成,护城河会非常深。

机器人前瞻:目前公司整体团队规模如何?

刘云涛:目前整个团队的规模大概是300人左右,全国服务的供应商大概有14万人。并且我们还联动了当地21所院校,最快7天之内能组建千人的标准化采集团队,这是我们柔性交付能力的重要保障。

二、让数据从“原油”变“燃料”,推出SolarSense数据工程平台

机器人前瞻:业内在数据和基础建设这块,您观察到有哪些突出的痛点?比如采集场景标准化不够、数据质量把控难,采集成本高等。

刘云涛:其实整个数据行业到现在为止就三个痛点。

第一个是数据源获取难,现在要么没有数据场景,要么有了场景也缺乏标准化的采集手段。

第二个是标注难。在标注需求分散的情况下,需要专家级的标注需求难以满足。比如外卖配送、台球赛事、数学推导等等,每个领域都有不同的专业知识。

第三个是工具难。数据类型多样化,不同数据类型需要不同的工具支撑,比如平台没有遥感、多模态等特定处理功能,数据就打不开,用不了。

机器人前瞻:这些行业痛点,景联文是如何针对性去解决?

刘云涛:面对这三个行业痛点,景联文的策略是以赋能替代包办,让更多合作伙伴加入生态。

1、技术赋能。通过AI智能化标注,AI智能化质检,以及把我们的标注平台开发给供应商使用,帮助供应商实现盈利。

2、项目赋能。很多供应商拿到需求书后拆解不明白,团队管理经验不足。我们派驻项目经理帮助他们做项目赋能,直到他们有能力承接。

可以说,景联文应该是国内真正带动供应商数量最多的数据公司。

机器人前瞻:目前景联文已推出的核心产品是什么?

刘云涛:今年9月,我们会推出Solar Sense,这是中国第一款数据工程平台。这个平台打通了从数据汇聚、清洗、标注再到模型训练的全流程。

它的核心优势体现在三个方面:

1、工具覆盖全面。SolarSense覆盖了从图片、文本、音频、视频到点云、时间序列等多类型数据处理需求,能够支持分类、检测、分割、识别等机器学习任务,一站式支撑多领域模型研发。

2、管理体系完善。通过数据版本管理、流程配置和数据治理能力,SolarSense能够对数据生成过程进行记录和追踪,提升数据交付过程的规范性和可控性。

3、平台级智能体。平台采用AI原生设计,内置智能体Solarclaw,帮助用户进行数据分析、信息汇总、风险识别等工作,为项目执行和管理提供智能化辅助。

机器人前瞻:具身智能对数据的要求和AI相比,最大的不同在哪?

刘云涛:大模型时代有互联网这座“矿山”, 文字、图片、视频早已大量存在。但具身智能是从0到1创造数据,没有现成的矿可以挖。

所以我们内部总结“四真两度”标准——真人、真场景、真任务与真机,以及根据场景定义的数据维度和精度

为什么强调“真机”?

因为现在真机的成本极高,租赁和损耗都是实打实的投入。大模型是在存量数据上做文章,具身智能则是在物理世界里从零开荒,而且每个场景的采集标准都不一样。

大模型是在已有数据上做文章,具身智能是从0-1去创造数据,而且每一类场景的采集标准都不一样。

机器人前瞻:数采基地的建设及后期运营的成本很高,公司为什么会选择自建数采厂?

刘云涛:我们数采厂跟市面上“机房式”数采完全不同。大多数数采厂采购大量真机摆在那里,这些成本是巨高的。

我们的数采厂坚持真人、真场景、真任务。地方政府也给予很大支持,贵州、重庆、芜湖等地方政府把真正的场景给我们开放出来。

我们会招募真正有工作经验的人,如保洁、操作工,佩戴轻量化设备进入真实环境中作业。数据不会凭空产生,总要有人走进物理世界的毛细血管里去挖掘。

华为的数据供应商,拿下90%的具身大脑企业|对话景联文CEO

▲第一人称视角(Ego-centric)的轻量化采集

机器人前瞻:数采基地选在芜湖、重庆、贵阳,是出于什么样的考量选择这三个地区?

刘云涛:选址背后是产业逻辑。

芜湖的整个制造业比较发达,这里世界五百强公司就有两家,周边配套业的公司也非常多。另外,政府对场景开放也非常支持。

具身智能要大量的数据采集,就需要有大量的存储,也要有大量的基础设施支撑。

同时,贵州一直把数据作为第一产业,包括我们今天Iphone用的云上贵州都是贵州大数据集团。当地对数据的认知是超出其他地方的。

重庆对我们的力度支持也比较大,它幅员地貌多,生活环境多样,所以我们就在这个地方建了。

三、拿下90%大脑厂商,在途订单数亿元

机器人前瞻:您曾说“上下楼就是上下游”,宇树在你们楼下。这种物理上的便利对景联文带来怎样的实际影响?

刘云涛:因为这个数据和研发是分不开的,有一家数据公司就在楼上,沟通方面会更加便捷、迅速。上一秒还在楼上开会,下一秒就能到楼下出个差。

机器人前瞻:目前公司在具身智能领域的合作客户主要是哪些?

刘云涛:国内主流的本体公司、大脑公司,我们基本上都合作了。

机器人前瞻:对于具身智能的客户,如本体、模型等公司,在数据上遇到的痛点,公司是怎么帮他们解决的?

刘云涛:客户最大的痛点就是场景。很多高价值的场景都在政府和大型企业手里,所以我们选择了贵州、芜湖,政府协调场景给我们去做采集。

另外,我们合作企业有大量场景方,他们可以给我们提供真实场景去做数据采集。

第二个痛点是合格数据的稳定交付,这包含三个维度:场景、标注和速度。在场景上,合作方、政府都给我们提供了大量场景采数据。

在标注上,我们跟模型厂商合作,我们买他们的模型,用他们的模型来给我们做自动化的标注。

在速度上,景联文多年积累的供应商画像能力,能够做到精准匹配、快速响应,确保数据交付的速度和质量。

机器人前瞻:具身智能领域正处于增长的爆发期,公司在这个方向上的业务发展怎么样?相比较去年发展情况,今年这半年在具身领域上的业务增长如何?

刘云涛:在具身智能这块,我们主要选择大脑公司和场景公司。其中本体公司和大脑公司实际发生签单的至少有80%

整体来看,国内90%的大脑厂商与景联文有合作,在途的具身智能订单规模已达数亿元,今年的增速远超去年。此外,不只是AI公司,包括蚂蚁、腾讯、华为等大型传统科技企业,在数据服务上也首选景联文。

机器人前瞻:可以用一句话或者是一个词来形容一下景联文吗?

刘云涛:灵活。在具身数据领域,专业性是基础,但灵活性是生命线

比如我们的项目经理提出一个需求,要求是6个小时之内研发人员必须要响应到位。因为在高速迭代的行业里,响应速度决定了数据的时效价值——你不可能比模型公司更懂算法,但你可以比他们更懂如何高效地把物理世界翻译成数据。

四、数据缺口不会快速填平,但千亿公司终将出现

机器人前瞻:与语言模型数据比,具身智能数据缺口大。截至今年年初,数据总量仅约50万小时,无法满足模型训练迭代,您作为数据领域的专家,您觉得这个问题能快速得到解决么?

刘云涛:短期内很难。语言模型的训练数据是人类日常交互自然产生的副产品。比如微信聊天、每天的飞书钉钉,每天打多少的语音通话,是自发的,只是授权和使用的问题。

但具身智能的数据无法依靠全民自发产生,它必须由专业团队携带设备进入真实的物理世界主动采集。

更何况,现在的采集设备在连接、精度、重量、续航、存储等方面仍面临大量工程挑战。这条路没有捷径,只能一公里一公里地采集,一个小时一个小时地积累。

具身智能的本体一定会越来越灵活,大脑一定会跑通,但是需要时间。

机器人前瞻:哪一条技术路线是有可能解决这个问题的?

刘云涛:坦白说,每一条路线都面临巨大挑战。自动驾驶花了近十年才在单一场景积累足够数据,具身智能面对的是家庭、工厂、商场等成百上千倍的场景复杂度。

我认为具身智能不是一个行业,而是一个载体——载体+场景,才构成完整的数据命题。

当下最重要的是先把“四真两度”的高质量数据采出来,种类足够丰富、精度足够高。至于触觉、力觉等多模态数据的成熟,还需要传感器硬件的协同突破,这都需要时间。

机器人前瞻:面对数据缺口,不少本体、模型企业已经在着手自己采数据了,您觉得本体厂商自研数据和第三方数据服务商的差异在哪?第三方数据服务商会不会被取代?

刘云涛:术业有专攻,数据需求量足够大,且呈现碎片化、多场景特征,专业分工是产业成熟的必由之路。

我们的核心价值在于成本结构和复用效率。例如,我们租下一个场景进行集中采集,可以将基础设施和部署成本分摊给多家客户,边际成本远低于每家客户单次租用、单次采集的模式。

在AI行业全面追求降本增效的背景下,专业第三方数据服务商不是“可选项”,而是“更优解”

机器人前瞻:您认为真正能够长期存活下来的数据服务企业,应该具备哪些核心能力?

刘云涛:我认为是技术驱动的灵活性。灵活性体现在技术上——比如在智能标注环节,我们能快速搭建作业流的智能体,真正做到高效,帮助客户降本。

景联文正在加大研发投入,做成一个标注领域的垂域模型。

机器人前瞻:您说过未来3到5年,中国一定会出现千亿级的数据公司。那您希望景联文未来会占据一个怎样的位置?尤其在具身智能领域,发展目标是什么?

刘云涛:我觉得中国一定会出现一个千亿的市值公司,甚至我觉得比千亿的公司更大。

但观察现在的行业,现在很多数据公司承载两三个亿就上不去了。因为场景太分散——今天采100个家庭,明天要采放电站,后天要采石油化工,单靠一家公司的自有资源根本无法覆盖。

景联文给自己的定位是做数据的“运营商”,而非单纯的“采集队”。

我们要建立的是数据生产、流通、应用的标准和生态,不仅自己成长,更要带动上下游供应商一起壮大。在具身智能领域,我们的目标是成为那个定义数据标准的链接者——我们不视任何同行为竞争对手,而是希望与各方共建这个生态