芯东西(公众号:aichip001)
作者 |  ZeR0
编辑 |  漠影

芯东西7月27日报道,7月25日,天津端侧智能计算GPU芯片及解决方案供应商速显微电子发布国内首款面向物理AI及具身智能场景的GPGPU处理器“天衡1100”(TH1100),以及面向下一代AI与异构计算的雷神统一计算架构TUCA

速显微电子由中国科大团队创立于2015年,专注于嵌入式GPU芯片及相关系统解决方案的研发,并创新地将数字存算设计与GPU IP结合,同时开展大模型参数硬化在GPU芯片的技术研发。

“天衡1100”支持最高128GB板载高速内存配置,内存带宽85.3GB/s,支持FP32、FP16、FP8、INT8、INT4、FP4等多种精度计算,通过混合精度算力配置覆盖从高精度计算到低功耗推理的多类需求,在AI推理常用的FP4混合精度计算方面可提供50TOPS算力,在支持稀疏计算的场景下,FP4稀疏算力可达100TOPS

该芯片内置24个Tensor Core(TC),可高效执行矩阵运算;Tensor Memory Accelerator(TMA)支持多维张量数据搬运,可减少数据搬运与计算执行之间的等待开销。TC与TMA协同,有助于提升AI算子的执行效率,使系统在处理复杂模型和高吞吐推理任务时具备更好的性能表现。

这些设计使得“天衡1100”可应对边缘AI推理、多路视频处理、大模型推理和复杂数据处理任务,并能在机器人、工业视觉和自动驾驶等场景中支持更大的模型、更复杂的中间特征缓存和更多路传感器数据处理。

从整体芯片架构来看,“天衡1100”采用一体化异构SoC架构,通过CPU和GPU协同设计及软硬件联合调度,实现计算任务合理分配,提升能效与吞吐能力,增强多场景泛化能力。

它集成了高性能GPU计算簇、通用CPU簇、多媒体处理子系统和丰富的系统接口,经高速互联总线形成统一片上系统,可显著降低数据交互延迟,提高传输效率,面向边缘AI推理场景构建国产可控方案。

其中,高性能多媒体子系统可向多路摄像头输入、高清视频处理、图像增强、视频分析和AI感知任务提供支撑,通过双路ISP、多媒体处理单元和丰富外设接口,能够为机器人、工业检测、自动驾驶和智慧医疗等应用提供更强的环境感知和数据处理能力。

“天衡1100”具有双路ISP设计以及丰富的外设接口匹配等特性,可连接摄像头、显示设备、存储设备、网络模块、工业控制接口和多类传感器,用于视觉感知、AI推理、路径规划、任务决策和控制反馈,以及缺陷检测、质量分析和实时图像处理。

TUCA架构是速显微电子自主研发、面向下一代AI与异构计算场景的软硬件协同计算架构,可结合速显微电子自研GPGPU、AI加速芯片及异构计算硬件,覆盖从应用开发、算子编译、运行时调度到硬件执行的关键计算链路,构建统一、高效、可扩展的异构计算软件底座,有助于提升效率和实现平滑生态迁移。

近年来,速显微电子相关产品聚焦云端或车规级高端市场,以及面向消费级物联网的低功耗、低成本解决方案,相关产品已广泛应用于汽车智能座舱、工业控制、国防军工等领域。

其研发的GC系列是全球第一款集成GPU的MCU芯片,2019年量产的GC9003是国内第一款能跑3D图形的车规MCU。

目前,GC90系列芯片已形成完整产品矩阵:GC9003芯片通过AEC-Q100车规级认证并累计出货超百万颗;GC9002芯片获评“玄铁优选芯片”;GC9005芯片可同时处理1080P渲染和语音人脸识别。

今年,速显微电子在“天衡”GPGPU为代表的IP内核产品上实现了图形处理与AI增强计算的深度融合。

速显微电子创始人兼董事长项天博士宣布,速显微电子将以天津总部为新立足点,加码布局全国市场,并将与南开大学、天津大学等高校结成产学研合作机构,为具身智能产业提供自主可控、生态友好、高效节能的算力GPU产品。

速显微电子联合创始人兼总经理王攀博士谈道,速显微坚持自研GPU全栈技术,正在数字存算一体以及将大模型参数硬化在GPU芯片上的“模型即芯片”等先进技术领域进行攻关。