芯东西(公众号:aichip001)
作者 | ZeR0
编辑 | 漠影
芯东西9月21日报道,今日,Imagination Technologies公布了其E系列GPU IP的首批性能数据和演示结果,并推出全新的Neural Super Resolution(NSR,神经超分辨率)AI加速超分辨率解决方案。首批基于E系列的芯片,预计将于今年晚些时候完成流片。
E系列具备通用计算能力,采用熟悉的GPU编程模型并支持行业标准API,使开发者能在设备全生命周期内实现新算子,并通过GPU内高度集成的Matrix Accelerator(矩阵加速器)加速,同时支持BF16、FP4和MX等高精度与低精度数据格式。
(1)AI:与上一代D系列相比,E系列在典型边缘语言模型上的预填充性能提升了4.7倍。以Qwen 3.5 4B为例,在典型工作负载下,一款1.5GHz的四核E系列GPU可实现0.2秒的首次Token生成时间,以及每秒150个Token的解码吞吐量。
(2)基础计算:E系列在AI、计算机视觉、信号处理和通用计算中广泛使用的基础计算操作方面提升了性能。例如,与D系列同类产品相比,E系列运行Conv2D内核的速度快4.4倍,运行GEMM内核的速度快4.8倍。在矩阵乘法工作负载下,GPU利用率可达89%。

(3)神经渲染:在1GHz单核E系列GPU上,典型的540p到1080p超分辨率操作延迟低至2.3毫秒。
(4)游戏:与上一代同类产品相比,E系列性能提升高达54%,其四核配置在部分AAA级桌面游戏中可实现超过60fps的帧率,每瓦性能提升最高达39%;新增支持DirectX 12 FL11_0。

这些最新进展进一步体现了Imagination的GPU-first(GPU优先)战略:通过一套架构和一套软件栈,让芯片设计厂商能够运行图形、计算和AI等不同类型的工作负载。
Imagination从事GPU架构研发超过30年,在图形处理之外,也持续扩展神经渲染及AI和通用计算能力。该公司已积累约4000项专利,全球授权客户超过50家,其中约18家来自中国。
Imagination Technologies的CEO Markus Mosen、首席营收官Jake Kochnowicz、执行副总裁兼中国区总经理William Xie近日与芯东西等媒体进行深入交流,分享E系列的架构创新及在中国市场的最新落地进展。据透露,Imagination已拿下一家新的重要战略客户。
此前D系列提供通用GPU计算库和SDK,并进入自动驾驶和机器人等客户项目。E系列进一步把更强的AI能力带进GPU核心,提高矩阵、卷积和低精度计算性能,是Imagination融合图形与AI路线的第一步。未来F系列及后续产品将继续实现更大的GPU配置、更低精度的数据格式,更高的效率。
一、计算架构走向融合,GPU将是共享“计算中心”
现在的SoC通常由CPU、GPU、DSP、NPU等多个计算模块构成。不同单元之间通过外部内存交换数据,会产生三类成本:
- 数据在外部内存来回搬运造成能耗。
- 数据通信带来时延。
- 开发投入的年工程和人力成本。
在Imagination看来,新增针对不同工作负载的专用加速模块、软件栈与数据通路,这种碎片化不仅加重系统集成负担,还可能使部分固定功能硬件在需求变化后闲置。
同时,在AI快速发展的驱动下,各种计算模块之间的界限正在逐渐模糊,CPU增加向量和矩阵扩展,NPU支持更多数据格式,GPU也在吸收AI计算和神经渲染。
Imagination认为,未来SoC需要一个共享、可编程的“计算中心”,而GPU最有可能承担这一角色。

“计算的重心正在往GPU转移,图形和AI靠得更近,需要统一内存、统一调度、统一软件栈。这一切归根到底就是两个字——效率。”Imagination Technologies CEO Markus Mosen说,“要最好地解决效率,方向就是GPU。”
GPU具备几个基础条件。它兼具并行计算能力、成熟软件生态、通用灵活性与图形处理能力,既能做图形处理,又能做AI计算和通用计算。
由于AI模型和软件的变化速度通常快于硬件换代速度,可编程GPU也能为尚未出现的新负载保留适应空间。
随着超分辨率、帧生成、智能助手和生产力工具进入终端设备,把更多AI能力放进GPU,可以复用已有硬件和软件资源。
E系列正是为此而生。
二、让AI和图形处理共享GPU资源,减少数据搬运,提高GPU利用率
E系列GPU IP于去年发布,提供多种配置,可覆盖从智能手机到高性能系统的不同应用。
目前已有多家领先合作伙伴获得该技术授权。
从架构来看,E系列将矩阵乘法直接嵌入GPU核心,放在图形单元旁边。这意味着AI计算能复用GPU已有资源,共享寄存器、控制、缓存、固件、驱动、开发工具及生态。

该GPU集成了Imagination自研的高性能RISC-V固件处理器,在GPU架构上将图形和计算工作并行调度,底层最多支持4核、16台虚拟机,提供高质量服务、工作负载优先级和内存隔离,这些能力可以用于云游戏、云桌面、汽车多域系统以及需要多个安全隔离环境的边缘平台。

E系列可从单核扩展到四核,支持40位地址空间,可寻址内存可达1TB,峰值内存带宽为768GB/s,并可通过AXI连接HBM、LPDDR、GDDR或统一内存。

凭借一颗处理器、一套软件栈,该GPU IP既可独立运行,也可与CPU及其他加速器协同,支持生成式AI、神经渲染与游戏等多种工作负载。
三、支持多精度AI计算,跑大模型推理算力飙4倍
AI模型没有一种数据格式能够适合所有应用。据Imagination Technologies首席营收官Jake Kochnowicz分享,E系列首次将BF16、MXFP8、MXFP4等数据格式引入嵌入式领域。
在1GHz下,单核可提供约2TFLOPS FP32性能,启用矩阵计算后可提供16TFLOPS FP16/BF16性能,以及32TOPS INT8/FP8算力和低精度AI算力。

四核高性能配置可提供超过100TFLOPS的FP16/BF16性能,以及超过200TFLOPS的INT8/FP8算力——比上一代D系列高出4倍以上。
大语言模型推理可以分为Prefill(预填充)和Decode(解码)两个阶段。
Prefill需要一次性处理用户输入和上下文,计算量较大,主要影响Time to First Token,也就是TTFT。E系列的Prefill计算性能相比上一代最高提升4.7倍,能让本地AI应用更快响应。
Decode逐个生成后续Token,其速度通常用每秒生成Token衡量,并更易受内存容量和带宽影响。单纯增加TOPS不能解决所有问题。Imagination正在通过软件工具、低比特量化和模型优化减少权重与数据传输,同时尽量保持模型精度。
Imagination展示了一些本地大模型用例:车机旅行规划的TTFT约为0.2秒、150tokens/s;视障用户代智能眼镜描述周围环境描述TTFT约为0.25秒、153tokens/s;邮件解读和摘要TTFT约为0.86秒、126tokens/s。
这些结果说明,在内存受限的系统中,本地模型有可能实现不到1秒的首Token响应和超过100token/s的生成速率。
四、神经渲染:专有NSR技术,将AI引入图形处理
E系列GPU IP将可编程AI加速高效集成进GPU渲染管线。
神经超分有几种做法。常见的一种是图形与AI分开,GPU先以较低分辨率完成渲染,把图像写入DDR,独立NPU再从DDR读取图像、执行AI超分并写回结果。这个过程需要多次访问外部内存。
另一类方案把AI加速器放到GPU旁,但还没完全耦合,图形和AI仍使用不同的编程方式,数据依然要在缓存和片上各处搬。
Imagination的选择是将矩阵能力直接嵌入GPU算术单元内部,让数据留在矩阵加速器旁边,使图形与AI计算共享更多GPU资源。

与一些桌面端GPU渲染整帧再超分的做法不同,Imagination GPU为内存资源有限的端边设备设计,采用分块延迟渲染(TBDR),把屏幕切成成千上万个小块,一次处理一个块,在单个tile上同时干完图形和AI,所以效率极高。
这意味着图形开发者只要写一套shader(Vulkan或OpenCL),在同一套编程范式下就能跑图形渲染和AI,不用再把数据引出到DDR。
为此,Imagination开发了专有的神经超分辨率(NSR)技术。
该技术利用行业标准扩展,将E系列的矩阵加速技术应用于图形处理管线。
其时序超分辨率方案针对Imagination GPU进行了深度优化,并采用单次处理方式,结合Imagination专有的网络自压缩技术,可移除神经网络中约65%的冗余权重,模型更省电。
与原生渲染相比,NSR不仅将帧率显著提升,还将内存带宽消耗减半,同时呈现出与真实图像视觉效果极为接近的画质。
在单核E系列上,将540p画面提升至1080p仅需2.3毫秒;从1080p提升至4K时,带宽消耗最高可降低54%帧率提升至2.5倍。
NSR将作为库功能集成于PowerVR SDK中,并通过与Unreal Engine和Godot的集成提供支持。
Godot引擎公司W4 Games的技术总监Clay John认为,开发者通常需要在视觉质量和性能之间进行权衡,针对硬件优化的超分辨率解决方案则可以改变这种平衡,让开发者在保持相同甚至更高性能水平的同时,有更多空间提升视觉质量。
五、统一软件栈降低开发门槛,让GPU IP更易集成与优化
E系列GPU IP采用统一的软件架构和软件栈。客户可以在不同核心数量和性能配置之间扩展,同时延续已有的软件开发投入。
Imagination GPU支持行业标准API,并提供计算库、编译器、性能分析器和开发工具,帮助开发者完成应用开发、优化和部署。
为简化向Imagination GPU的移植,Imagination正在将经过优化的Llama.cpp后端贡献至上游开源项目,后续还将提供原生PyTorch和ONNX Runtime支持。
E系列提供硬件邮箱、低延迟任务交接和共享内存机制,用于同SoC中的CPU、NPU及其他处理器协同,以便客户按需选择E系列图形、AI和其他计算能力的组合。
客户可以把Imagination的软件栈接入自己的SDK,在合适的时间把任务分配到合适的处理器。
结语:追求真实场景性能,让客户按需集成GPU更省事
Imagination希望把GPU从图形处理器升级为边缘和端侧SoC中的可编程计算中心,把开发者需要的算力给足,并将设计功耗、性能、面积和灵活性的取舍选择权交给开发者。
“通过将图形、计算和AI功能整合到一个可编程架构中,我们为芯片设计厂商提供了一款值得长期构建和演进的平台型处理器。”Markus Mosen说。
对中国芯片设计企业而言,E系列的竞争力主要在于负载融合、数据移动、软件复用和未来适应性。
象帝先计算技术有限公司总经理张珩称,Imagination之所以能成为象帝先多代产品的合作伙伴,得益于其前瞻性的GPU路线图,以及在GPU设计中优先追求真实场景性能、提升用户体验而非单纯峰值TOPS和FLOPS的务实理念。
作为独立GPU IP,E系列可支持RISC-V、Arm或x86等不同CPU组合,同时图形和计算共享更多硬件资源,降低异构数据搬运及多套软件栈的维护成本,在算法快速变化时保留更强的可编程性。