智东西(公众号:zhidxcom)
作者 | 程茜
编辑 | 漠影
一块屏、一位数字人,AI线下新物种诞生了!
下面屏幕里的数字人不仅能走动带路、实时讲解,还能无缝切换多国语言,按需更换自己的外形、声音,直接把沉浸式交互效果拉满。
这依托的正是科大讯飞今日推出的数字人全系列产品升级:首发实时生成的超拟人数字人,讯飞智作、讯飞AI虚拟人交互平台、讯飞绘文全面更新。
传统数字人往往只在屏幕里,科大讯飞这次令人眼前一亮的升级便是上面的移动数字人,直接自带自动引路、躲障避行、声源追踪、多模态感知全套buff,配合透明屏就实现虚实同步的沉浸式视觉观感。
这样一来,一台设备就能包揽展厅、门店、展馆、展会里带路、讲解、一对一接待等各种任务,让数字人真正从屏幕里走到现实场景中。
讯飞这波升级,折射出整个数字人行业的转向:数字人不再只是锦上添花的营销工具,而是逐步成为企业新的交互入口。
过去企业靠App、小程序、官网、客服电话、线下柜台和用户打交道;现在更具亲和力、贴合人们沟通习惯的数字人已逐渐成为企业业务的统一入口,用户咨询、办事、消费、服务、购物对接等都可以通过数字人完成。
但热潮背后,数字人规模落地仍面临不少挑战,如今定制贴合企业形象的数字人,定制门槛仍不低,还有受限于上述分段处理技术,数字人的对话不稳定、表情五官偏移、音画错位等问题时有发生。这也导致数字人的各项核心运营数据整体还是不及在岗运营的实际效果,进一步拉高了行业规模化落地门槛。
这次讯飞的数字人升级正是瞄准这一痛点,让其真的能听能看、能聊能互动,拉近与真人主播的体验差距。
一、数字人赛道冲上百亿规模,增量空间正在加速释放
泸州老窖的数字品鉴师“泸麟儿”帮用户解疑答惑、桂林银行的数字人理财顾问帮用户办业务……

这些案例验证,数字人已经深入电商直播、企业客服、企业培训、文旅等场景等多元化场景,成为承接企业对内对外服务的新一代通用交互载体。
这也使得数字人进入规模化应用的高速增长期。今年5月,弗若斯特沙利文发布最新数据,中国AI数字人市场规模2021-2025年复合增长率达52.0%,2030年的市场规模将从去年的54.4亿元,增长到153.4亿元。
市场热度高涨之下,行业的评判重心已从虚拟形象的外观展示,转向真实可用的交互服务能力。但受底层技术制约,市场对数字人的落地价值始终褒贬不一。
站在产业价值视角,数字人的商业优势不可替代。
其能7×24小时在线值守拉长企业的经营、服务时长,并且在讲解产品参数、做标准化导览培训、参观指引时能输出标准化的话术,不会出现人工讲解参差不齐的问题。
再加上专属数字人IP可长期复用,甚至根据不同阶段宣传需求灵活迭代形象与内容,长期折算下来,这一方案有明显的成本优势。
但光鲜价值之下,数字人规模化落地的现实痛点也颇为突出。
现阶段大量落地的数字人只是套用固定话术机械讲解,遇到用户的随机提问会出现反应延迟、音画不同步等问题;高品质数字人形象定制、全息硬件、线下大屏终端部署与长期运维的持续性投入,是中小体量企业布局数字人业务不可小觑的负担。
因此,企业试图用数字人降本增效,但当下数字人存在的不自然、低交互、难落地痛点,又让其和真正的用户之间横亘着一道鸿沟:一头卡在数字人底层技术的短板,另一头卡在商业化落地的部署门槛上。
首先,数字人必须翻越几座技术大山:长效在线稳定度是数字人商用的基础底线,要避免数字人长时间在线出现形象漂移、画面卡顿等问题;想要复刻真人级流畅自然的对话体验,需实现语义理解、肢体动作规划、实时视频渲染、编解码传输、大模型推理整套环节并行运转、毫秒级同步联动;还需要保证数字人拿取商品、手指别处时遵循合理的空间关系……
其次,企业同样渴求低门槛、低成本、开箱即用的一体化工具体系,以降低数字人从建模、调试到上线运维的综合投入成本。
而科大讯飞本次升级的数字人技术,外加讯飞智作、AI虚拟人交互平台、讯飞绘文产品矩阵全线升级,恰好就为这一鸿沟,搭建起一条从技术研发到商业落地的完整通路。
二、状态稳定、动作协同、自然交互,背后靠三大技术加持
想要看懂数字人升级的核心价值,首先要明确一个核心问题:真正可用、适配商业化落地的理想数字人,究竟长什么样?
正在7×24在线直播的旅游搭子主播寻笙就给了我们答案。
寻笙一举一动全是真人的松弛氛围感,她开口和大家聊天会配上自然手势、脑袋跟着语气轻轻晃动,低头刷手机、随手撩拨头发、拿杯子喝水这些下意识小细节拉满,就算起身热舞、挪动座椅调整姿势,画面也不会穿帮。
她还会时不时弹幕互动,这更是拿捏了资深主播的营业精髓。她会为网友分享旅行好物,以及自己之前去新疆、陕西打卡的景点,还会主动答谢粉丝赠送的礼物,察觉到弹幕刷屏变少,还会主动抛出话题盘活直播间气氛。
这些肉眼可见的体验升级,背后是数字人正式从“实时驱动、提前生成”的传统模式,迭代为“全链路实时生成”的关键跨越。
其核心能力有三大重点,单张照片即可生成,语义驱动数字人的台词、表情、肢体变化,无限自由生成动作的底层能力。
而为这套方案托底的是科大讯飞首发实时可交互营销超拟人数字人的三大技术创新以及超拟人语音合成技术。
第一个解决的是数字人长时间运行画面不畸变、形象不崩坏,依托的是双时域记忆驱动的长时视频生成技术。
讯飞将连续视频构建为携带状态记忆的时空序列,依靠双层记忆体系完成画面管控:短期记忆守住相邻帧表情、肢体、画面纹理的连贯性,长期记忆锁定人物样貌特征、外观风格与固定场景基底。该系统搭配动态状态压缩、关键特征回溯、跨片段一致性约束三重手段,可以抑制长线推演中的误差累积。

第二个是平衡高画质和低延时的数据引导式低步数流式蒸馏技术。
视频扩散模型直接做少步蒸馏,会出现生成画面失真、畸变、闪烁、动作僵硬的问题,讯飞针对视频扩散模型完成少步蒸馏改造,依托教师模型基于真实视频样本打分校准,引导学生模型生成结果贴合真实画面分布。
在此基础上,研究人员叠加跨视频历史条件与时序一致性约束,在推理时复用历史时序信息,降低延迟的同时兼顾画面质量、动态多样性和前后衔接稳定性。整套推理链路搭建异构流水线,统筹增量生成、解码、编码、推流全流程,优先输出首帧画面,后续帧在播放间隙异步运算,最终把模型生成能力转化为稳定可持续的长时间实时数字人播出能力。

第三个是让数字人摆脱机械播报,做到应答准确、神态动作逼真、指令即时响应,依托的是基于多模感知评价体系的强化学习。
研究人员搭建起囊括文本、语音、图像、视频、动作信号的全域评测体系,围绕语义-动作对齐度、视听自然度、指令跟随能力、人物身份一致性、时序连贯性,以及人物—商品交互合理性多项指标核验生成内容,并将其转化为强化学习奖励信号。
整套训练流程形成“高质量数据-SFT能力学习-多模态感知评价—RL偏好优化—效果回流”的闭环。

人物形象、画面做到位了,补齐最后一块拼图的还有声音。
其超拟人语音合成技术可以支持70多种语言,并且依托多模态预训练、微调对齐、多任务强化学习搭配多维度奖励模型评测,让合成语音由单纯复刻相似音色升级为贴合语义意图的真实情感表达。
在这背后,科大讯飞多管齐下:通过多模态预训练,语音、文本和情感标注数据,学习语言内容和声音表现关系;结合领域自适应和声纹特征对齐,捕捉目标人物音色特征;通过多任务强化学习,精细优化韵律、停连、重音、语气及情绪变化;引入奖励模型对音色相似度、情感表现等维度进行综合评价。

从稳定不崩的人物形象、实时自然的动态交互到超拟人的发音,讯飞此次完成了数字人从虚拟交互到可感知、沉浸式交流的进阶。
三、稳定、易用、好用的数字人,才能扛住业务长期营收
不过好看的数字人Demo固然吸睛,但扛得住真实业务打磨的数字员工,才算真正跨过商业化及格线。
当数字人形态稳定自然、实时生成、拟人语音等核心底层技术全部打磨成熟时,产业的重心便自然从技术攻坚转向应用普惠。
洽洽瓜子的首位AI代言人Chacky(洽可儿)已上岗,已经出单曲、发MV。这支专属MV镜头里的 Chacky,唱跳全程在线,表情灵动不呆板,情绪卡点精准适配曲风,抬手、回眸等各类肢体动作行云流水。
这也是我们从科大讯飞此次升级看出的第二层重要布局,用SaaS化产品降低企业使用门槛。
整体来看,科大讯飞搭建了底层基座+上层应用的产品体系,包括技术能力底座讯飞AI虚拟人交互平台,并在其之上构建了SaaS化产品讯飞智作。
其中,AI虚拟人交互平台作为技术底座,结合了语音合成、语音识别、语义理解、多语种翻译、星火大模型,把IP资产构建、多模态交互等软硬一体的产品。更重要的是,其无需开发、复杂接口对接,用户1个小时仅在平台配置就能创建对话应用。

在发布会现场,演示人员就0代码手搓了一个“HR校招回复”的数字人,其可以依次选择合适的形象、声音、背景、人设、技能,其中在人设功能中,可以选择主流大模型进行生成,还能上传知识库获取更专业的数据。

讯飞智作的核心是一口气完成数字人音视频创作,提供上百种现成的数字人形象和AI配音,一张照片、一句话即可打造数字分身、复刻声音。
再加上该平台这次上新的Agent产品,更是将创作门槛降到最低。讯飞智作的营销Agent,能让用户和Agent对话直出完整营销短视频;还有视频Agent一口气搞定意图理解、大纲设计、文案撰写、分镜设计、素材生成、音色配置,然后交付成片。

用户不需要会拍会剪,只需要告诉Agent自己想表达的主题,其就会一口气直出视频大纲、口播文案等,如下面的就是汽车连锁门店的年轻人选车指南视频。

在这之上,科大讯飞的数字人在电商直播、培训、客服、导览等多元化应用场景遍地开花。
在营销场景,中储粮等企业已经基于数字人进行直播带货。与此同时,配套的讯飞绘文作为图文生产工具,新增了电商、自媒体场景套图模版,还有AI抠图、多尺寸适配等丰富的AI工具,补齐了直播之外的图文宣传物料需求。

其次是培训场景,区别于传统统一授课的标准化培训模式,讯飞智作打造的培训数字人,可在单日之内解析、梳理企业上传的全部学习资料,生成体系化培训课程,让数字人来扮演“企业人力培训师”,面向员工开展一对一针对性教学,实时解答个性化疑问。
第三个场景是交付服务,基于AI虚拟人交互平台,讯飞构建了能自主移动、交互的移动数字人。
这一硬件产品包含两大部分,一是用一张普通照片生成的神态自然、拟人的专属数字分身,二是一款高清透明显示屏+移动底座,设备移动时,数字人就会向前迈步,让其在引路、讲解等场景里更沉浸。
可以看到,移动数字人形象可以根据场景切换,还支持丝滑的多语种对话,即使在高噪环境下其也能通过摄像头和麦克风阵列锁定对话人。

历经多行业真实项目落地打磨,科大讯飞这套软硬一体、工具齐全的数字人方案已经具备成熟的交付与运维经验。
放眼整个行业,企业需要的不仅是完美的数字人形象、语音效果,还有低成本、快上线、能创收的数字化工具。面向未来,硬核技术打底+轻量化平台承载,才能成为数字人规模化普及的标准答案。
结语:数字人赛道的竞争焦点改写,讯飞给出数字人长久立足的标准答案
作为数字人赛道的资深玩家,我们可以从讯飞此次的更新窥见数字人赛道的竞争焦点。其通过硬核技术拉高用户的体验上限,再加上普惠化平台进一步拓宽应用场景,二者结合从而帮助实体企业真正把数字人转化为稳定的经营收益。
数字人行业的竞争本质正在切换,早年行业玩家扎堆比拼虚拟形象精致度、面部渲染效果,如今行业淘汰赛正式开启,单点算法优势不再构成长期壁垒,底层自研技术、一站式交付平台、垂直场景落地经验的整套闭环能力,才是企业站稳市场的核心护城河。
科大讯飞所做的就是用硬核技术负责拉高体验上限,普惠化平台负责拓宽市场边界,二者结合才能跳出同质化低价竞争的泥潭,帮助实体企业真正把数字人力转化为稳定的经营收益。