芯东西(公众号:aichip001)
作者 | ZeR0
编辑 | 漠影
芯东西9月8日报道,刚刚,在Arm年度旗舰活动Arm Everywhere China上,Arm推出AI原生移动终端计算子系统CSS for Mobile 2,及其包含的集成SME2的Arm C2 CPU集群、首款AI原生GPU Mali G2-Ultra NX。

如今移动端计算需求持续提升:智能体要持续进行感知、记忆、推理和行动,游戏想把PC级光照、光追和复杂场景塞进手机,智能手机必须在巴掌大的空间里精打细算,这要求从整个计算平台层面进行协同优化。
对此,Arm开始重新安排一台手机里的计算预算。其设计理念的集大成者,便是CSS for Mobile 2。

Arm CSS for Mobile 2主要由以下部分组成:

- C2 CPU集群:融合C2-Ultra CPU、C2-Pro CPU以及第二代Arm可伸缩矩阵扩展(SME2)技术,承担整个异构系统的任务编排,为低延迟、持续运行的端侧智能体提供更快响应。
- Mali G2-Ultra NX GPU:集成专用神经网络加速器、全新执行引擎和第三代光线追踪单元,实现紧密耦合的AI加速,通过3项神经网络技术提升移动图形质量、帧率和能效,助力开发者在移动设备上打造桌面级游戏体验。
- SI L2系统互连:支持LPDDR6,面向缓存一致性、低延迟和新内存类型优化,优化CPU、GPU与内存之间的数据传输路径,提供更快的内存访问,CPU到DRAM的延迟比上一代SI L1减少约45%,具备一致性和服务质量(QoS)能力,帮助管理和优化多个计算资源之间的任务调度与优先级分配。

对比上一代,C2 CPU集群实现单线程性能最高提升15%,集群级多线程性能提升12%,最新AI模型性能最高提升70%;Mali G2-Ultra NX在部分神经图形场景中可将帧率和每帧能效分别提升多达4倍。

与上一代产品相比,搭载全新执行引擎和光追单元RTUv3的Mali G2-Ultra NX还使传统图形渲染提升:基准测试性能最高提升20%,非AI游戏性能提升14%,DRAM流量最多降低13%。

CPU少等一点,GPU少算一点,内存少搬一点,软件少折腾一点,省下来的每一毫秒、每一毫瓦,都为更多的智能、更流畅的画质、更长的续航腾出空间。
一、Arm CSS for Mobile 2:系统级协同,提升性能和响应速度
先来想象两个手机使用场景:
一个是智能体场景。用户把临近日期的结婚纪念日晚餐交给手机智能体。智能体要听懂语音,翻出日历里的日期,从照片和历史记录里寻找两个人的饮食偏好,搜索餐厅,再完成预订、发消息和查看当日菜单。一旦餐厅满了或用户不满意,整套流程还要重新来一遍。
另一个是手游场景。玩家走进洞穴,光会照亮环境、制造阴影,也会直接参与叙事和玩法。过去更常出现在PC和主机上的实时光照、光线追踪与虚幻引擎,被塞进了功耗和散热都极其有限的手机里。
前者考验手机能否根据一句话执行一连串行动,后者考验手机能否在几瓦功耗下实现更复杂的画面。此类任务的性能表现,都与3个维度紧密相关:各任务阶段的执行速度、数据在不同计算引擎间的传输效率、系统对全任务流程的协同调度能力。
这需要一个从系统层面进行设计和优化的计算平台。
Arm交出的答卷是CSS for Mobile 2,通过整合Arm C2 CPU集群、Mali G2-Ultra NX GPU、系统技术、软件与开发工具,从整体工作负载的角度,统筹优化性能、能效和数据传输效率。

面对高频并发的AI交互,抑或是复杂的图形工作负载,整套系统都能在移动设备的功耗、散热限制条件下高效运行,维持灵敏响应。
CSS for Mobile 2还将系统优化延伸至物理实现阶段,使合作伙伴在开展SoC集成之前,便能将功耗、性能和面积(PPA)与架构设计进行协同考量。
Arm合作伙伴可根据产品定位、性能目标和市场需求,既可以单独选用各个组件,又可以将其与自研IP或第三方IP结合,在更广泛的CSS配置中灵活集成,从而打造差异化的系统设计。

二、C2 CPU集群:AI模型性能提升70%,更快完成智能体工作流
在Arm CSS for Mobile 2平台中,Arm C2 CPU集群提供了支撑智能体AI工作流所需的可编程算力与编排能力,负责协调整个系统中的计算活动,决定每个阶段计算任务应该跑在CPU、GPU、AI芯片还是云端。
Arm C2 CPU集群融合C2-Ultra CPU、C2-Pro CPU以及第二代Arm可伸缩矩阵扩展(SME2)技术,不仅提升了日常计算性能,还增强了端侧AI能力,为语音处理、信息检索和模型执行等工作负载提供更强支持。

C2-Ultra提供平台中最高的单线程性能,重点改善应用启动、UI交互、智能体编排和突发负载响应,相比上一代峰值性能提升超过15%,相同性能下功耗降低38%,运行微信、邮箱等任务的平均性能提升12%。与搭载SME2的C1-Ultra相比,C2-Ultra的峰值AI性能提升70%。

C2-Pro面向持续性能,在长时间工作负载中兼顾性能和能效,微架构延续上一代C1-Pro,并可利用N2等先进制程节点提高频率和实现能力。
DSU(DynamIQ共享单元)连接各CPU核心,为集群提供共享L3缓存,并负责核心之间更高效的数据与指令共享。

以2个C2-Ultra和6个C2-Pro的8核旗舰配置为例,C2 CPU集群相较上一代实现:
- 最新AI模型性能最高提升达1.7倍;
- 单线程性能最高提升15%,可降低单次决策和系统响应的延迟;
- 网页浏览速度提升15%,应用启动速度提升12%,进一步缩短了服务访问和任务执行所需的时间;
- 集群级多线程性能提升12%,支持知识检索、模型准备、应用执行等任务并行处理。

合作伙伴可以根据实际需求,对Arm核心进行灵活配置。Arm小核心通常按2-3年节奏更新,因此今年没发新的Nano级小核心。

Arm C2 CPU集群中,实现AI加速的关键是SME2引擎,能在编码阶段计算每字节更多的MAC。相较上一代,SME2的AI算力翻倍,接近6TOPS,非常适合跑对延迟敏感的轻量级端侧AI模型。
支付宝、安卓、OPPO、vivo、三星、网易伏羲、百度飞桨、阿里千问、淘宝、腾讯混元、腾讯多媒体实验室、虚幻引擎、Unity中国等都是SME2生态伙伴。

端侧语言模型的编码阶段以矩阵乘法为主,属于计算密集型工作,SME2可以直接提速;进入逐Token解码,模型权重需要反复从内存读取,瓶颈很快从计算转向带宽。
对此,C2 CPU集群通过私有L2与共享L3缓存减少访问系统级缓存和DRAM的次数,为轻量级工作负载提供更低延迟。

同时,SME2架构中的查找表指令LUTi让2-bit、4-bit等低比特权重一直保持压缩状态,直到进入计算核心时,再批量展开成INT8、FP16或FP32等计算格式,从而能消除查找繁重工作负载的内存访问,减少内存容量需求。

在涵盖语音处理、记忆检索、推理、应用执行和网页浏览等环节的端到端智能体AI工作流测试中,相比上一代配置,搭载SME2的C2-Ultra配置整体性能提升24%。

运行语音转文本模型时,搭载SME2的Arm C2-Ultra相比C1-Ultra可降低40%的延迟,让语音指令响应更快。

在记忆阶段,搭载SME2的C2-Ultra的内存信息检索与搜索性能较上一代提升41%,可助力智能体更快速地访问设备端存储的上下文信息。

在推理阶段,小语言模型能够将用户请求与检索到的上下文结合起来,生成结构化指令并调用相应工具,以执行下一步操作。在跑测试的各类模型中,C2-Ultra平均速度较上一代提升25%。

三、首款AI原生Mali GPU:直接集成神经网络加速器,把PC级游戏体验塞进手机
如何在手机端实现更高清、逼真、精细、稳定的游戏视觉体验?这关系到GPU的进化。
Arm去年通过SME2增强了CPU的AI能力,今年则进一步把AI原生能力扩展到GPU,让AI与传统渲染重新分工,简单内容继续交给传统GPU,复杂光照、超分、降噪和插帧则由神经网络承担。
新发布的Arm Mali G2-Ultra NX是Arm首款AI原生Mali GPU,通过将专用神经网络加速器紧密集成至着色器核心,并结合全新执行引擎和第三代光线追踪单元(RTUv3),为移动图形带来AI原生能力。

更复杂的光照会增加计算和数据移动需求,而神经网络技术有助于控制成本,将更强大的光线追踪硬件与神经网络技术相结合,可在移动渲染限制下,更高效地呈现更丰富的视觉细节。
腾讯游戏已将自身AI创新与Arm的神经图形技术结合,验证神经图形能提升移动设备上的帧率和能效,同时保持出色的画面质量;Unity中国也会把Arm GPU与神经加速能力集成到团结引擎核心层;网易《燕云十六声》游戏计划在今年加入Arm NSS支持。

1、将AI加速能力集成到图形处理管线,兼顾画质提升和功耗控制
Mali G2-Ultra NX把专用神经网络加速器直接嵌入着色器核心,能复用GPU的内存系统、一致性缓存和控制结构,神经网络加速器不工作时还可以通过电源门控关闭,可在约1W功耗范围内呈现惊艳图形。
这有助于减少数据在不同计算单元之间的传输,并提升整个管线的执行效率,让图形、通用计算和神经网络能够并行运行。

通过将传统渲染与神经网络技术相结合,开发者能在保持画面质量的同时,降低GPU和系统工作负载。

以下三项神经图形技术充分展示了这一架构所带来的能力:

(1)神经超级采样(NSS,Neural Super Sampling):通过低分辨率渲染结果,重建更高分辨率图像。例如,系统可以只渲染约1/4的目标像素,其余细节由模型补全,从而降低传统渲染开销。

相比传统渲染,加NSS后可实现几乎翻倍的帧率、减半的外部内存流量。


(2)神经帧率提升(NFRU,Neural Frame Rate Upscaling):通过在两个真实渲染帧之间生成一个中间帧来提高帧率,实现更流畅的游戏体验。

在《光影新生》游戏中,它使MegaLights可使用超过1000个光源,这在过去的移动设备上并不可行。
基于NFRU,Mali G2-Ultra NX可支持120fps的游戏稳定运行,并将内存流量减少33%。

(3)神经超级采样与降噪(NSSD,Neural Super Sampling and Denoising):结合基于神经网络的超分辨率重建与降噪技术,让系统在减少每像素光线数量之后,仍能恢复较为干净的画面,从而在具有复杂光照和阴影的高负载光线追踪场景中提升图像质量。

Arm使用的是卷积神经网络,从游戏真实渲染数据中训练,再结合颜色、深度、运动向量和历史帧完成超分、插值与降噪。
相关模型已上传至Hugging Face和GitHub。开发者可针对不同游戏内容、艺术风格和质量目标重新训练或微调模型,让模型适应独特的美术风格。
在Arm展示的三帧序列里,第一帧和第三帧各自只渲染1/4像素,剩余部分由NSS或NSSD重建。中间一帧完全由NFRU生成。三帧合计只有1/8像素由传统方式实际渲染,其余7/8由AI重建或生成。

与传统渲染相比,NFRU+ NSSD神经图形可带来以下收益:每秒帧数最高提升至4倍,DRAM带宽占用最多降低至原来的3/10,每帧动态能耗最多降低至原来的1/4。

由Arm与Sumo Digital基于虚幻引擎联合打造的《光影新生》游戏,引入NFRU和NSSD技术后,与上一代传统渲染相比,可实现最高4倍的性能提升,并将外部内存流量最多降低70%,并在约2W GPU功耗预算下持续运行60fps。

Arm提供的开发者工具栈包含NSS和NFRU,以及面向Vulkan的机器学习扩展和包括虚幻引擎在内的主流游戏引擎插件。软件开发套件支持与自定义引擎集成,性能分析、图形优化、训练和模型优化工具可帮助开发者评估并微调神经图形工作负载。

2、全新执行引擎:提高寄存器数量和分配灵活性
Mali G2-Ultra NX搭载的全新执行引擎,是Arm Mali过去7代产品中规模最大的指令集架构升级,可支持每个线程束的寄存器数量是上一代的2倍。

它采用动态寄存器分配机制,有助于在着色程序规模扩大、复杂度增加的情况下,减少寄存器的溢出。
3、第三代硬件光追:降低光追成本,缓解内存压力
Arm第三代硬件光线追踪技术使移动设备能支持更复杂的光照、阴影、反射和几何效果。全新光线追踪架构在主流光线追踪基准测试中,可将DRAM流量最多降低13%,有助于缓解内存压力。

新架构采用了更小巧、更高效的光线-三角形数据结构,以降低光线追踪工作负载的成本;对不透明度微贴图(OMM,Opacity Micromaps)提供了硬件级支持,从而能够更高效地处理复杂的透明几何体。

这使得移动设备能呈现更丰富的植被、更精细的织物纹理、多层材质表面及其他复杂场景元素。
在Arm的一项演示中,使用OMM可将帧率提升30%,同时将光线追踪工作负载最多降低70%。

迄今Arm Mali GPU出货量已超过140亿颗,这一庞大基础使Arm能够将神经网络技术带入全球移动生态系统。
四、开箱即用的软件生态,加速端侧AI开发与创新
Arm CSS for Mobile 2拥有完善的软件生态支持。依托Arm数十年的软件投入及全球超过2200万的Arm开发者社区,开发者可通过熟悉的框架和开发环境轻松调用其平台能力,打造更智能的端侧AI体验。
会上,Arm专程讲解了KleidiAI及Arm AI Portal共同打通的从硬件到软件的开发链路。
KleidiAI与主流AI框架的深度集成,为Arm CPU提供了优化的软件执行路径,包括能够充分利用SME2特性的AI工作负载,让软件在支持SME2的设备上自动加速。
Arm列举了多项模型与生态合作,包括谷歌Gemma、腾讯混元、阿里千问,相关工作涉及SME2加速、2-bit量化、模型压缩、文本转语音等。在近期的一次黑客松中,开发者把SME2集成到健身、游戏和助眠等多种应用。
Arm AI Portal为开发者和智能体提供了一个开发入口,在统一平台汇聚经过优化和验证的模型、性能与准确性数据、代码示例以及部署资源,帮助开发者充分调动CPU端SME2、GPU端神经网络加速器等能力,将经优化的AI模型与高端移动设备的性能优势紧密结合。

入口既可以通过网页前端使用,也可以通过MCP服务器、Skill或插件接入开发环境。开发者可安装Arm MCP服务器,将AI Portal的能力直接接入Codex、Claude Code等智能体工作环境。
其模型库支持按照设备类型、架构、运行时、数据类型和模型格式进行筛选,以缩短从选型到部署的路径。
对于拥有自有模型的开发者,Arm还提供早期访问版模型优化工具,帮助其针对目标设备进行优化和适配。
基于上述工具,开发者能够为特定工作负载选择合适的模型,了解其在Arm平台上的性能表现,并加快从评估到部署的整个开发流程。
结语:为更高效、更智能的移动AI体验奠定坚实基础
移动AI的下一个阶段,将不再限于芯片峰值算力或单一跑分成绩,而是取决于整个系统将用户意图转化为实际行动的综合能力。
随着智能体AI持续演进并融入日常交互,底层平台将成为决定这些体验能否高效、大规模落地的关键因素。
Arm CSS for Mobile 2正是为这一转变而打造,围绕响应速度、能效与持续执行能力,对计算资源、系统IP、物理实现和软件生态进行一体化协同优化,把CPU变成智能体的编排层,把GPU变成图形与神经计算的混合引擎,再用系统互连和软件工具把不同计算资源串起来。
在进一步减少无效等待、重复计算和数据搬运的基础上,Arm既为芯片合作伙伴提供了可灵活配置的基础平台,也为开发者搭建了从平台能力到应用落地的更直接路径,让从芯片设计到开发都变得更加高效。