芯东西(公众号:aichip001)
编译 | 崔嫄伟
编辑 | 陈骏达
芯东西9月3日消息,据ServeTheHome报道,8月25日,在全球顶级半导体架构研讨会Hot Chips 2026上,三星披露了LPDDR5X-PIM的技术架构、规格参数、测试数据等技术细节。LPDDR5X-PIM是全球首款基于LPDDR DRAM的存内计算(PIM)产品化方案,面向AI推理场景。
在搭载三星边缘AI加速器SoC的测试验证中,运行Llama-3.1-8B模型时,LPDDR5X-PIM将推理耗时从12.3秒降至5.4秒,输出吞吐从27.0 token/s提升至81.3 token/s,分别实现2.28倍和3.01倍的性能增益。
三星推出该方案的核心逻辑在于AI芯片中内存成本的持续攀升。三星公布的数据显示,HBM在AI芯片物料成本中的占比已从2024年第一季度的52%升至2025年第四季度的63%,且当前可能更高。尽管HBM提供了AI推理所需的带宽,但其功耗高、封装复杂,三星认为降低成本的方向在于以LP-PIM这一新内存形态作为替代路径。
一、架构特点:PIM算力内嵌DRAM内存
LPDDR5X-PIM在DRAM Bank内部署了16个PIM计算块,MAC(乘累加)树并行运行,ALU同时支持浮点和整数数据类型计算。

该芯片封装采用JEDEC标准561-ball规格,单rank集成4颗die、总容量16GB,目标应用覆盖服务器、移动和客户端设备。
在x64位宽、9600Mbps速率下,PIM计算带宽达到614GB/s,是传统DRAM侧76.8GB/s的8倍。

该产品还是首款支持多精度数据类型的LP-PIM方案,通过配置寄存器中的MAC精度字段可选择15种精度组合,在SINT4权重配置下单封装算力达2.4TOPS,FP8精度下约为1.2TFLOPS。

为实现即插即用,三星设计了地址对齐模式(AAM),在DRAM地址与MAC指令之间建立映射,使LPDDR5X-PIM可直接配合传统DRAM控制器工作,无需开发专用控制器。

模式切换方面,该方案支持单Bank和多Bank两种PIM工作模式,通过预定义行和PIM寄存器完成切换,三星称这一方式比上一代HBM-PIM更快、更可靠。

在具体运算流程上,该方案通过激活值写入(WRPB)、权重矩阵加载(PIMX_RD)、向量存储(PIMX_WR)和向量读取四个阶段完成完整MAC运算,其中读写比可灵活调整,不局限于1:1。
二、研发进展:性能提升3倍,生态标准并行落地
三星在自研边缘AI加速器SoC上完成了验证,对比测试分别搭载传统LPDDR5X和LPDDR5X-PIM。测试模型为Llama-3.1-8B,上下文长度320 token,数据类型配置为激活值SINT8、权重SINT4、输出SINT32。

测试结果显示,LPDDR5X-PIM完成推理耗时5.4秒,传统LPDDR5X为12.3秒,提速2.28倍;输出吞吐从27.0 token/s提升至81.3 token/s,增益3.01倍。

三星同时注明,PIM相关的性能优化仍在持续进行中。软件配套方面,LPDDR5X-PIM的模拟器和数据手册可按需获取,模拟器已纳入SDK工具包并提供参考实现指引。
在下一代产品方面,LPDDR6-PIM的JEDEC首版完整规范已接近定稿,针对移动和客户端场景,下一版JEDEC规范也在酝酿之中。

结语:PIM商业化迈出关键一步,大规模落地仍待头部客户验证
作为全球首款基于LPDDR的PIM方案,LPDDR5X-PIM以JEDEC标准封装、兼容传统DRAM控制器的设计大幅降低了下游厂商的采用门槛。
但该方案的广泛落地仍取决于是否有大型客户率先采用并验证其系统级价值。PIM方案赋予内存厂商同时掌控内存与计算的能力,可能改变其与客户之间的议价格局,因此行业至少需要通过标准化实现多源供应,才能降低对单一供应商的依赖。
来源:ServeTheHome