芯东西(公众号:aichip001)
编译 | 崔嫄伟
编辑 | 陈骏达
芯东西9月1日消息,在2026年全球顶级半导体架构行业研讨会Hot Chips上,英特尔正式揭晓面向企业数据中心的AI推理专用GPU——Crescent Island的软硬件全栈技术细节。
作为标准PCIe形态的加速卡,Crescent Island整卡典型功耗为350W,采用风冷散热设计,可直接部署于传统服务器机房;官方标配160GB LPDDR5X显存,同时开放给ODM厂商客制化设计,显存容量最高可拓展至480GB,支持FP4、MXFP4到FP64全档位数据精度,覆盖AI推理到高性能计算的多元场景。
英特尔企业AI系统首席架构师Sumit Mohan与英特尔院士姜洪(Hong Jiang)对芯片架构进行深度拆解,其设计核心围绕三大方向:每瓦Token输出能效(tokens-per-watt)、超大容量显存、开放兼容软件栈,匹配Agentic AI兴起带来的推理负载新需求。
一、硬件架构:全链路能效优化的Xe3P架构
在英特尔的AI加速器产品矩阵中,Crescent Island的定位是数据中心级推理旗舰产品,向下覆盖本地Agent终端、AI工作站,向上联动SambaNova SN50 RDU等专用算力,形成覆盖端、边、云的完整AI算力布局。
该芯片基于Xe3P架构打造,核心计算单元由3个Xe通用核心与256个第三代XMX(Xe矩阵扩展)引擎组成。其中第三代XMX引擎升级为三路扩展Xe矩阵架构,支持FP4精度指令三路并发执行,大幅提升硬件单元利用率;同时完整兼容FP64双精度运算,可兼顾科学计算类工作负载。

XMX引擎采用16深度脉动阵列设计,数据在流水线内逐级流转复用,减少对外部显存的频繁访问,从运算引擎底层实现能效优化。

整体片上架构设计上,该芯片围绕“减少访存、提升并发”的思路构建层级化存储体系,32个Xe核心共享32MB统一二级缓存(L2),配合每个Xe核心内置的1MB GRF寄存器与512KB一级缓存(L1),将高频访问数据尽量留在片内,降低访存功耗。

该芯片同时集成包含4路解码器、4路编码器的媒体引擎,可承载多模态推理负载;内置硬件级KV缓存加速能力,支持超长上下文、多会话并发的压缩推理,适配Agentic AI长会话场景。对外互联方面,整卡采用PCIe5.0x16标准接口,配合开放交换架构支持多卡横向扩展,可灵活搭建不同规模的推理集群。
功耗管控是Crescent Island的核心设计重点之一。该芯片支持分级待机功耗:G0活跃空闲状态功耗≤50W,G8深度低功耗空闲状态功耗约10W。其实现路径包括可配置分布式功耗管理、搭载激进时钟门控的NoC数据包路由、模块独立供电轨设计,确保图形计算单元(GT)与媒体引擎DVFS各自独立,按需分配功耗,避免无效能耗。
作为面向数据中心的企业级产品,可靠性、可用性与可维护性(RAS)与吞吐性能同等重要。Crescent Island为关键存储单元配备ECC纠错与奇偶校验机制;片上IP互联的每一跳链路均设置错误检测;支持动态页面下线、封装后硬件修复、PCIe高级错误报告(AER)等企业级特性,可有效降低静默数据损坏风险,提升长时运行稳定性。

二、软件栈:开放生态与软硬协同优化
软件生态是AI加速卡落地的核心门槛,Crescent Island采用全栈开放策略,从上层推理框架到底层工具链完成全面适配,同时结合硬件特性做场景化优化。
在上层应用层面,Crescent Island原生支持vLLM、SGLang、llm-d、NVIDIA Dynamo等业界主流推理框架,企业已有的Agentic AI业务可直接运行在包含英特尔算力的异构基础设施上,无需大规模修改业务代码,大幅降低迁移成本。
向下延伸到底层开发工具链,Crescent Island搭载了完整的开发与部署工具组件,包括Triton推理服务器、SYCL-TLA、oneCCL集合通信库、oneDNN深度神经网络库、SYCL编程标准、Level-Zero底层接口,搭配OpenCL计算运行时,可完整继承英特尔Xe生态的软件资产,帮助开发者快速适配与调优。
英特尔称,目前已有数百家独立软件厂商完成适配,产品首发即提供成熟的驱动、固件与参考系统,可无缝接入企业现有AI技术栈。
针对Agentic AI推理的场景特性,Crescent Island还通过软硬件深度结合的方式,实现能效与吞吐的双重提升。一方面,超大容量LPDDR5X显存可在单卡内同时存放FP8模型权重与KV缓存,无需跨卡调度即可承载更大参数模型与更长上下文会话。
随着大模型从Llama2-70B向Kimi K2-1T等万亿参数模型演进,模型权重体积增长约7倍,但每Token读取字节数降至原来的 1/4,显存容量与带宽的需求逐步解耦,这正是LPDDR5X大显存密度+PCIe5.0交换扩展架构的优势场景。

另一方面,针对大模型解码阶段的算力闲置问题,Crescent Island支持推测解码(Speculative Decoding)技术:在8Token草稿树架构(draft tree)下,每次校验可输出2.9~4.9个有效Token,充分挖掘自回归解码过程中的空闲算力,在不额外提升功耗的前提下提升推理吞吐。

结语:差异化路线切入推理市场,实际表现仍待验证
Crescent Island是英特尔面向数据中心AI推理市场推出的一款硬件方案。当前行业主流AI加速卡普遍采用HBM高带宽显存,而该芯片选择LPDDR5X显存方案,在显存带宽与显存容量之间做出取舍:不追求峰值算力堆叠,而是以350W风冷的低部署门槛、160~480GB的超大显存、开放兼容的软件栈,瞄准Agentic AI推理、存量机房升级等细分场景。
配合SambaNova RDU等专用算力,英特尔正在构建“CPU调度+GPU推理+专用NPU解码”的分布式解耦推理(Disaggregated Serving)方案,Crescent Island正是其中侧重预填充阶段的核心算力载体。
这款350W风冷PCIe加速卡能否在数据中心市场抢占份额,最终将取决于软件生态的成熟度,以及真实业务场景下的每瓦Token能效实测表现,具体性能仍需等待硬件量产后的第三方测试验证。
来源:ServeTheHome(STH)