芯东西(公众号:aichip001)
作者 |  ZeR0
编辑 |  漠影

芯东西7月19日报道,在世界人工智能大会WAIC 2026期间,摩尔线程创始人、董事长兼CEO张建中提出建设三大AI工厂,展示两个AI原生终端、一个MUSA生态,勾勒出一张从AI算力基础设施到智能体应用落地的全景图。

  • 三个AI工厂:模型训练工厂、词元生产工厂、智能体生产工厂,均基于夸娥智算集群。
  • 两个AI原生终端:MTT AICUBE家庭AI中枢和MTT AIBOOK AI算力本。
  • 一个MUSA生态:MusaCoder代码大模型、MUSACODE AI编程智能体、摩尔学院。

值得一提的是,依托夸娥智算集群,摩尔线程成功跑通了“国芯训练国模”技术路径,实现全链路训练闭环。北京大学团队基于摩尔线程MTT S5000和MUSA软件栈训练出的全球首个5D世界模型EvoPhys-World,登顶斯坦福WorldScore世界模型基准测试榜单。

摩尔线程自研MUSA架构实现了在单芯片上同时支持AI计算加速、3D图形渲染、物理仿真和科学计算、超高清视频编解码四大引擎,使摩尔线程全功能GPU具备了国内稀缺的“算、渲、仿”一体化通用算力优势。

在WAIC 2026期间,作为国内唯一同时深耕B端、C端市场的全场景GPU厂商,摩尔线程开启世博展览馆与张江科学会堂双展区联动,全面展示其三大AI工厂、覆盖“云-边-端”的全场景智算能力。

一、三大AI工厂:包揽从大模型训练到智能体落地

进入智能体时代,词元消耗量迅速增长。AI的消耗方式正在从”人调用AI”转向”AI调用AI”,一个用户指令可能触发几十上百个子任务并行执行,每个子任务都在持续消耗词元。

今年3月,我国词元日调用量突破140万亿,两年增长超过1000倍。消耗量的爆发,直接穿透到算力基础设施这一层。算得够不够快、够不够稳、单位词元成本能不能持续下降,影响了AI经济的天花板。

这正是摩尔线程”三大AI工厂”框架所要回答的问题。

  • 模型训练工厂:专注于大模型的高效训练与持续迭代,打造高性能、可扩展的万卡级智算集群。
  • 词元生产工厂:聚焦于推理规模化部署,实现卓越的性价比与吞吐表现,让词元生产更高效、更稳定;
  • 智能体生产工厂:致力于智能体的孵化与端侧承载,推动代码生成、内容创作、流程自动化等任务的高质量完成。

支撑三大“AI工厂”高效运转的,是摩尔线程自研的先进MUSA架构。依托MUSA架构,摩尔线程构建了从芯片、计算卡、服务器、超节点与万卡级集群,到边缘与智能终端的完整硬件矩阵,并以软硬协同推动全场景智算落地。

值得注意的是,摩尔线程此次首次展示了MTT C256超节点。如果说夸娥智算集群回答的是”如何让万卡协同训练”,那么C256回答的是”如何把万卡集群搭得更高效”。

国产GPU训出世界模型,登上国际榜单,首提三大AI工厂

摩尔线程MTT C256超节点首创一层Scale-up网络,实现标准单宽机柜128卡全互联,并柜扩展可达256卡极速互联,攻克传统多层网络的带宽损耗与高延迟痛点,在2U空间内释放极限的单位面积算力。MTT C256采用计算与交换一体化的高密设计,将大幅提高智算中心GPU部署密度,为万卡乃至十万卡级超大规模长稳训推集群打造坚实算力底座。

依托全功能GPU的通用算力平台化优势,摩尔线程通过不同形态的算力载体,实现了全场景智能应用的无缝覆盖

  • 云端:万卡级智算集群,全面支撑大模型高效训练与极致推理,并面向物理AI、具身智能、世界模型等提供高精度物理仿真与系统级算力。
  • 边缘:高性能AI模组,深入工业质检、智能驾驶及低空经济等典型场景,提供高效、低延迟、强可靠的边缘AI算力。
  • 终端:通过家庭AI中枢MTT AICUBE与AI算力本MTT AIBOOK,推动端云算力与智能体深度融合,加速端侧应用创新,让“端侧承载力”真实落地。

二、模型训练工厂:万卡级集群高效训练,支撑全球首个5D世界模型

模型训练的技术壁垒非常高。让成千上万张GPU卡高效协同,是一道极苛刻的工程题。

摩尔线程构建的夸娥智算集群,具备单集群万卡级AI算力(高达10EFLOPS),基于特色训练优化技术,能将Kimi K2 1T大模型的预训练性能实现接近翻倍提升。

其MFU(训练算力利用率)在稠密大模型上达60%、MoE模型上达40%,有效训练时间占比超过90%,训练线性扩展效率达95%,训练精度与国际主流计算卡一致。

国产GPU训出世界模型,登上国际榜单,首提三大AI工厂

夸娥智算集群已实战跑通Wan2.1开源多模态模型的千卡长稳训练。除了大语言模型外,该集群还能支撑具身智能、物理AI以及世界模型等高精度物理仿真与大规模训练需求。

摩尔线程与合作伙伴联合建设的国产万卡GPU集群,已实现从零起步完整训练MoE-236B基础模型。该模型基于25T+高质量训练语料,训练全程由摩尔线程夸娥AI训练套件提供支持,有效训练时长占比超90%,在万卡规模下展现出与国际同类集群相当的系统稳定性与训练效率。

北大EvoPhys团队研发的全球首个5D世界模型EvoPhys-World在斯坦福WorldScore“世界生成”维度位列全球第一,并连续37天蝉联榜首。这款模型的原生训练全程在基于摩尔线程MTT S5000的夸娥智算集群完成,由MUSA软件栈全栈支撑,训练稳定性、扩展性与生成质量均达国际主流水平。

国产GPU训出世界模型,登上国际榜单,首提三大AI工厂

面向具身智能场景,基于FlagOS-Robo框架,依托摩尔线程MTT S5000千卡智算集群,智源成功完成通用具身大脑RoboBrain 2.5的全流程训练,实现“训得稳、训得快”。

对行业主流BEV感知模型BEVFormer的训练实测显示,基于夸娥智算集群及MUSA软件栈,单机与双机训练吞吐均达国际主流训练GPU的1.56–1.67倍

这些成果均在摩尔线程WAIC 2026展台上首次展示,展现出对标国际主流水平的高性能,并验证了国产芯片在超大规模、超长连续稳定训练上的全链路闭环能力。

三、词元生产工厂:PD异构分离大降算力成本,可支撑高精度物理仿真

训练是”把模型做出来”,而推理是”让模型持续用起来”。在词元经济时代,推理成本直接决定AI应用的商业化天花板。

基于旗舰级AI训推一体智算卡MTT S5000与全栈自研MUSA架构,摩尔线程构建了从底层算子库到上层推理框架的完整推理生态。在跑GLM-5.1、DeepSeek-V4-Flash、Hunyuan Video等国产前沿模型时,MTT S5000的推理性能比肩国际水平。

国产GPU训出世界模型,登上国际榜单,首提三大AI工厂

很多企业手里已有大量历史算力资产,通过将不同代际、不同架构、不同品牌的计算卡合理组合,能在维持高质量推理输出的同时大幅摊薄成本。

摩尔线程针对大语言模型推出的PD异构分离方案,通过将高算力需求的Prefill计算池(MTT S5000)与高带宽的Decode生成池(国际主流GPU)异构分离、分池部署,独家支持KV Cache FP8与1M超长上下文,实现高性价比词元生产。

实际测试显示,通过PD异构分离,3台MTT S5000加2台Hxx,效能已经堪比9台Hxx。这一方案将帮助企业以更低成本,用国产卡和现有资产混搭,就能花更少的钱、办更高效的事。

国产GPU训出世界模型,登上国际榜单,首提三大AI工厂

作为一款全功能GPU,MTT S5000除了能跑AI训练与推理外,还支持自研3DGS基础库LiteGS和3D语义理解技术UniSem,甚至支持光线追踪,能加速3D/4DGS场景重建与仿真闭环。

例如在智能驾驶场景,运行极佳视界前馈3DGS闭环仿真模型时,MTT S5000的单卡推理性能可达到国际高端Hxxx的64.3%,8卡性能可达到其68.2%。

四、智能体生产工厂:推动端云算力与智能体融合,32GB内存算力本能跑80B大模型

智能体生产工厂靠近应用侧,要解决的问题是:智能体如何从云端走向本地,如何在算力相对受限的端侧真实运行起来?

摩尔线程依托通用全功能GPU算力,推动“智能体生产工厂”全面运转,在WAIC展台展示了全栈国产化具身智能仿真平台MT Lambda及面向工业场景的MT Lambda for Factory解决方案,以助力生产物理世界的智能体。

在边缘侧,MTT E300 AI模组搭载摩尔线程自研智能SoC芯片“长江”芯片,具备50TOPS异构AI算力,支持混合精度计算,具备低延迟、高可靠的实时响应能力,可应用于工业、能源、教育、交通、医疗等行业。

在终端侧,两款搭载“长江”芯片的AI终端产品MTT AIBOOK和MTT AICUBE均在展区开放体验。

国产GPU训出世界模型,登上国际榜单,首提三大AI工厂

MTT AIBOOK是一款面向AI学习与开发者的AI算力本,可在原生Linux系统(MTT AIOS)下预装OpenClaw智能体,单机支持最多12个智能体高效并行,实现了从开发、调试到部署的完整闭环。该设备还能打通夸娥云端算力,灵活部署各类大模型,通过端云协同为数字员工团队提供AI能力支撑。

该算力本搭载32GB高速统一内存,结合AI加速分区与智能推理软件系统,通过AISSD自适应缓存管理机制,集中调度MoE专家权重、长文本KV缓存与智能体内存数据,无需升级硬件即可在原生32GB内存上流畅运行80B大模型推理与智能体编程。

MTT AICUBE是一款面向未来AI家庭场景的核心中枢,整合“智能体+AI PC+AI NAS”核心能力,内置基于Linux内核的MTT AIOS操作系统及智能体“小麦”,能支撑端侧智能体、超高清视频播放以及3D游戏等家庭应用场景,并在AI NAS模式下配备全闪SSD高速存储,支持免拆机扩容。

摩尔线程自主研发的AI编程智能体MUSACODE能协助开发者通过自然语言指令,快速完成代码生成、调试与重构等任务,让MUSA开发更简单、更高效。

其背后的专用代码大模型引擎MusaCoder,完整后训练流程均在夸娥智算集群上完成,专注MUSA原生Kernel自动生成与优化,在权威评测中性能达行业领先水平,是业内首个基于国产GPU算力底座完成全链路训练与验证的开源代码大模型。

目前,摩尔线程旗下开发者平台“摩尔学院”已汇聚超过45万开发者和学习者,并将前沿技术与产业实践带入全国200多所高校。

结语:建设三个AI工厂,推动词元算力底座自主可控

摩尔线程提出的三个AI工厂,分别对应算力消耗链路的三个关键节点:训练生产模型能力,推理规模化输出词元,智能体承载最终交付。

模型训练工厂验证“国芯训练国模”的可行性,意味着中国大模型训练不再受制于单一算力来源;词元生产工厂把推理成本压进商用区间,意味着国产算力具备了规模化输出智能的经济性;智能体生产工厂打通云边端,意味着算力走进了工厂、家庭和每个人的终端。

进入词元时代,算力底座的自主性愈发紧迫。以摩尔线程为代表的AI芯片企业正挑起大梁,联同生态伙伴一起,推动国产词元生产基础设施的发展与全链路自主可控。