智东西(公众号:zhidxcom)
作者 | 毕伟豪
编辑|漠影
当下,大语言模型赛道在历经声势浩大的底层模型“互卷”后,逐渐进入了能力趋近、价格竞争的新阶段,资本也从这一逐步稳定的市场中抽出手,开始寻找下一条仍具备结构性壁垒的AI赛道。
从大语言模型到多模态大模型,再到能够理解、推演真实世界的世界模型,这条通往下一代人工智能的探索路径,正在成为资本关注的新方向。
智东西7月24日报道,近日,多模态大模型公司智象未来(HiDream.ai)宣布完成15亿元人民币C1轮融资。社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,厦门国贸资本、上影新视野基金、华策影视等十一家机构跟投,老股东合肥产投、东方富海持续加注。
该公司近三个月内连续完成多轮融资,融资金额累计超过21亿元,投后估值突破10亿美元,成立仅三年便正式跻身全球AI独角兽行列。
智象未来创始人兼CEO梅涛表示,本轮资金将用于持续推进原生全模态世界模型的底座构建,他认为:“从多模态走向构建原生全模态世界模型,是通往AGI的必经之路。”
关于世界模型能否通往AGI,行业仍在持续探索,但部分资本已经用真金白银回答了另一个问题:在AI竞争进入下一阶段之后,什么样的公司,值得长期下注。
一、大语言模型成熟之后,多模态正成为资本新的押注目标
资本不会因为一种技术“更先进”就下注,而是因为它看到了一条新的增长曲线。
从商业化看,大语言模型仍处于高速增长期。Anthropic的年度经常性收入(ARR)从90亿美元增长到490亿美元,仅用了6个月,作为对照,传统SaaS公司亚马逊从10亿到100亿用了6年;国内智谱的ARR在5个月内从1亿美元跨越至10亿美元,同等规模Anthropic耗时15个月。
与此同时,OpenRouter平台每日Token消耗量从今年3月约2T增长至7月接近7T,短短几个月增长约3.5倍。这意味着,大语言模型市场远未见顶。
但高速增长,并不意味着竞争格局仍有巨大变量。随着DeepSeek V4、GLM-5.2、Kimi K3等模型密集发布,通用大语言模型的能力差距正在不断缩小,MaaS逐渐进入价格竞争阶段,平台型模型公司的估值逻辑也开始趋于稳定。对于资本而言,继续押注“下一个大语言模型”的想象空间正在收窄。
正是在这样的背景下,资本将目光从通用大语言模型,转向更具产业壁垒的方向,视频生成、多模态、世界模型逐渐成为新的投资焦点。
而智象未来从创立之初,就闷头扎进了“下一个方向”。梅涛在微软亚洲研究院从事计算机视觉研究十余年,随后又在京东负责多模态业务。2023年ChatGPT爆发后,大多数创业团队选择涌向大语言模型,他却直接押注多模态技术。
在他看来,多模态大模型天然包含时间、空间和物理信息,比大语言模型更接近真实世界,也是通向世界模型更自然的一条路径。

相比大语言模型,多模态大模型天然具备更深的竞争壁垒:首先是数据壁垒,高质量视觉数据涉及版权、IP、肖像权,不可爬取、也难以替代:其次是工程壁垒,视觉模型需要处理空间关系、时间连续性、光影物理和角色一致性,像素级生成远比文本Token预测复杂;再次是工作流壁垒。影视制作、广告营销等行业一旦完成AI流程改造,迁移成本远高于切换模型API。
此外,还存在行业Know-how壁垒。不同内容行业对镜头语言、叙事节奏、情绪表达都有长期积累。这意味着,多模态竞争不会只围绕参数规模和推理成本展开,更容易形成长期护城河。
也正因为如此,多模态赛道的市场格局远没有大语言模型集中。在智象未来看来,未来真正有竞争力的玩家,大厂约三家,中型公司三四家,市场将呈现多个垂直领域并行发展的格局。影视、传媒、广告、教育、文旅等行业,都可能孕育出各自的头部模型。
世界模型是否最终通向AGI,今天还没有答案。但至少现阶段,多模态所具备的数据、工程、工作流和行业壁垒,已经足以支撑一家公司的商业价值。
而世界模型,则代表着一种更长期的技术想象力。如果它最终能够建立起对真实世界更完整的理解、推演与构造能力,将有机会成为通向AGI的重要技术路径之一。
短期看产业价值,长期看技术上限,正是在这种双重预期下,智象未来获得了多种资本的青睐。
二、五类资本,同时看向一个方向
智象未来这轮融资最特别的地方,不是15亿元,而是投资人名单,不同于融资金额反映的市场热度,这份名单代表的,是资本共识。
国家队、金融资本、市场化基金、地方国资、产业资本,同时出现在一轮融资中,这样的资本组合,在AI创业公司中并不多见。这五类资本背后,代表着五种不同的投资逻辑,但这一次,它们指向了同一个方向:原生全模态。
国家队的判断,往往比收益周期更长。相比财务回报,国家级基金往往更关注技术路线以及是否具备长期产业价值。
社保基金此前作为LP在大模型领域直接投资过的公司只有智谱AI,而此次投资智象未来,则释放出一个信号:多模态大模型已经进入了国家级长期资本的视野。
而金融资本押注的不是应用,是底座。工银资本在大模型领域将智象作为首家投资标的,交银资本、兴业AIC基金同步进入。这类资金长期坚持“投早、投小、投长期、投硬科技”的策略,更关注底层技术能力,而非短期商业机会。
市场化资本持续加码,看重的是公司的成长性。敦鸿资产连续三轮加注,东方富海从B轮持续跟投至C轮,意味着投资机构仍在不断上调对智象未来长期价值的判断。
敦鸿资产创始人袁国良表示,“世界模型正是串联人工智能、具身智能、新一代算力等前沿领域的关键纽带”。连续加码,本身就是市场化资本对这条技术路线和公司成长性的认可。
地方国资看重的,则是产业生态。本轮融资中,合肥、厦门、余杭等多地国资同步加注或入局。以合肥为例,合肥产投从A轮一路跟投至C轮,延续了当地“以投带引”的产业培育模式,希望借助资本引入企业、完善产业链。
厦门、余杭等地国资此前也已布局阶跃星辰、摩尔线程等AI企业,智象未来成为其AI产业版图中的又一重要落子。
影视产业资本押注的,是下一代AI内容生产体系。华策影视将围绕智能体协同创作、语料共建、内容共创、IP全链路开发展开合作;上影新视野基金瞄准院线场景升级和大屏AI制片标准制定;湖北长江电影集团已与智象共建影视AI联合实验室。
与前四类资本逻辑完全不同,它们看重的不仅是一家AI公司,更是未来AI影视内容生产的基础设施。
五类资本同时出现,本质上传递的是同一个信号:资本正在寻找大模型之后的新机会,而多模态大模型,及其发展路线的长期产业价值,正在走进越来越多长期资本的视野。
三、多次登顶全球榜单,聚焦统一架构,锚定世界模型
这轮融资背后的长期价值,是资本对于技术路线的判断与选择。
智象的自研UiT架构,试图回答一个底层问题:多模态究竟应该建立在模块化拼接之上,还是建立在原生统一架构之上?
当前行业主流方案是“文本编码器+VAE+图像生成器”的模块化拼接,这种模式虽然较为成熟,但有两个问题:VAE压缩会导致高频细节损失,文本和图像分别处理则会造成语义对齐间隙。
智象的UiT架构砍掉了VAE和独立文本编码器,将文本、图像、视频以及更多模态信息全部映射进同一个共享Token空间,由同一套Transformer统一处理。
这种变化最大的意义,在于让不同模态从一开始就在同一套表示体系中完成理解和生成,而不是依赖多个模块之间不断对齐。
一个新架构是否成立,首先要接受公开能力的检验。HiDream-O1系列是智象未来基于UiT统一架构打造的新一代原生全模态世界模型。
4月发布的千亿参数闭源版本在六项基准测试中达到SOTA;5月,HiDream-O1-Image开源版本登顶Artificial Analysis文生图榜单全球开源模型第一;6月,商用版HiDream-O1-Image-1.5再次登上AA图像生成模型榜单,位列中国第一。

从4月推出千亿参数闭源模型、5月开源登顶全球、到6月商用版本持续刷新成绩,短短三个月的连续迭代,验证了UiT统一架构的竞争力。
更重要的是,这条路线并非只有智象未来一家公司在做,统一架构也正在成为国际厂商的探索方向。Google推出Gemini Embedding 2,NVIDIA发布Nemotron 3 Nano Omni,均在尝试将更多模态纳入统一表示空间。
但对于世界模型来说,统一架构只是起点。
梅涛认为:世界模型需要同时具备“表达世界、推演世界、构造世界”三种能力。基于这一方向,智象未来也在探索原生全模态世界模型在不同领域的应用可能,与诺亦腾机器人合作探索具身智能训练数据生成,与百图生科共建微观世界模型用于分子动力学理解,尝试验证统一架构的跨领域复用能力。
对于底层技术路线而言,榜单表现证明了模型基础能力,而能否在更多场景中实现复用,才决定其长期产业价值。
四、真正的护城河,正在从模型向智能体迁移
一家AI公司的价值,最终不能只靠模型能力来支撑。对于投资机构来说,真正决定长期价值的,是模型能否通过智能体架构转化为生产力,持续创造商业价值。
如果说UiT架构解决的是模型如何理解世界,那么智象未来在WAIC 2026上发布的全球⾸个⽆限时⻓内容创作智能体vivago R1,就是在回答另一个问题:模型如何在世界里完成复杂任务。

它所谓的无限时长不是简单把视频拉长,而是把完整创作流程拆解成多个可执行环节,由多个智能体协同完成。
从理解需求、规划故事线,到分镜设计、素材生成,再到长视频输出,模型开始承担过去需要一个团队完成的工作。本质上提升的不是视频生产的时长,是AI处理复杂任务的能力。
对于企业来说,比模型能力更重要的是稳定交付结果。传统大模型存在概率性输出偏差,企业真正的成本不只是调用模型,还有后续的人力返工。
vivago R1依托智象未来自研HD-AgentOS智能体操作系统,通过资源层、系统层、能力层三层架构实现创作全链路可控可校准,将内容有效可用成功率提升至85%。企业最终采购的,是一套能够稳定交付结果的“基础模型+智能体系统”生产系统。
vivago R1并不是孤立的产品,而是智象未来从模型能力走向行业工作流的一次最新尝试。截至目前,围绕内容创作、商业营销、影视制作,智象已经形成了“1+1+3”的产品架构:以基础模型和Token Hub为底层支撑,通过三大场景智能体矩阵,将模型能力转化为可执行的行业解决方案。
该公司产品覆盖全球100多个国家和地区,超5000万用户、4万家企业客户、百万级付费用户。其中,HiBurst进入广告营销,成为TikTok官方前五大AI合作伙伴之一;“帧赞”深入影视创作,累计制作短漫剧超5000分钟。

模型领先可以帮助一家AI公司进入牌桌,但真正决定长期竞争力的,是能否持续进入行业,并持续提供生产力。
从多模态大模型,到智能体,再到行业解决方案,智象未来正在形成一套可持续复制的商业模式,而不仅是一款模型产品。这也是资本真正看重的地方:即使世界模型最终未必是AGI的终极答案,它依然可能成为下一代AI产业的重要基础设施。
结语:融资背后,资本市场在重新思考AI公司的价值所在
对于行业而言,世界模型最终是不是通往AGI的答案,是一个技术问题,而智象未来的这几轮融资,是资本综合技术路线、产业落地以及投资回报等因素做出的判断。
在AI产业进入新的竞争阶段后,资本开始重新评估AI公司的价值标准。如果一种技术能够沉淀为产业基础设施,进入行业工作流,并持续创造商业价值,那么它就值得长期下注。
对智象未来而言,连续多轮融资不仅意味着资金支持,更意味着资本对其过去三年技术路线的一次集中认可。
从视频生成到原生全模态,从UiT统一架构到世界模型,再到基础模型与智能体系统结合的产品路径,这家公司试图证明,多模态公司的竞争,最终比拼的不只是模型能力,而是谁能够真正把模型变成产业能力。
未来谁会最终胜出,还有待时间验证,但至少今天,智象未来,已经成为了资本观察世界模型赛道、重新定义AI公司价值标准的一块重要样本。