芯东西(公众号:aichip001)
作者 | 陈骏达
编辑 | 漠影
中国AI芯片的军备竞赛,正在提速。9月22日,2026杭州云栖大会开幕当天,平头哥发布了新一代训推一体AI芯片真武V900,性能达到上一代真武M890的3倍,成为目前性能最强的中国自研AI芯片之一,计划于2027年第一季度量产。

但一个现实的挑战也随即出现:芯片造出来了,生态能不能跟上,才是它能否真正进入生产环境的关键。
就在大会第二天,平头哥公布了开源AI软件栈T-Head SAIL(以下简称“SAIL”)的最新进展,并宣布进一步扩大在框架适配、加速库、工具链、通信库等领域的开源力度。

平头哥正在做的,是把此前在真实生产环境中打磨的软件能力,进一步向全球开发者开放。过去主要服务于头部客户的能力,开始进入更开放的开发者生态。
一、AI芯片,为什么越来越离不开软件栈?
如果把AI芯片比作发动机,软件栈就是变速箱、传动系统和驾驶系统。发动机再强,如果没有一整套传动和控制系统把动力有效传到车轮上,车是跑不起来的。
芯片提供的是原始算力,而开发者写的是PyTorch、TensorFlow这些上层框架,芯片与上层应用之间,必须有一整套软件栈来完成“翻译”和优化的工作,将其转换为芯片能听懂、能高效执行的指令。
所以真正决定开发体验和芯片最终效果的,不只是峰值算力,还有软件栈的成熟度,模型迁移难不难、主流框架支持全不全、算子性能强不强等等维度。
而这恰恰是中国自研AI芯片的一个集体痛点。全球AI开发者生态长期围绕海外主流生态建立,过去十几年,大量代码、模型、调优经验和开发者习惯都沉淀在这套体系里。
中国AI芯片作为后来者,硬件性能可以快步追赶,软件生态的积累却无法一蹴而就。自家的软件栈更年轻,适配过的模型、框架、算子更少,而开发者手里既有的资产和经验,大多难以直接派上用场,遇到问题只能排队等厂商响应,迁移一个项目动辄数周。
这道难题面前,行业里大致有两种思路。一种是厂商自己搞:一点点补齐模型、框架和算子适配,靠自家研发力量把生态建起来。
这条路并非走不通,但随着AI技术迭代越来越快、应用场景越来越分散,单靠一家公司的研发力量,想要全部覆盖正变得越来越吃力。
另一种思路是开放:把底层能力交出来,让开发者、科研机构和产业伙伴一起把生态“长”出来。
平头哥选择的是后者。平头哥半导体软件生态资深总监陆生华介绍,真武系列硬件的用户量已经较大,生态本身对开源开放也有了迫切需要,以进行二次开发。SAIL相关的的开源代码已公开到GitHub上,未来,基于GitHub的开发分支将会作为研发的主线。
开源后,开发者可以直接读源码,看懂芯片底层运行逻辑,遇到bug能直接定位甚至修复。企业还能根据自己的细分业务场景做深度定制优化,这是过去平头哥很难涉足的领域。这些优化经验也会反哺社区,最终激发出开发者生态的活力。
二、从驱动到工具链,把真武”整套软件底座”打开
T-Head SAIL是平头哥面向真武AI芯片打造的底层软件栈,拥有自主知识产权,全面兼容主流AI生态。它覆盖从OS层、SDK层到接口层的完整链路,向下释放真武硬件算力,向上承接上层应用需求。
这套软件栈由五层技术栈组成,环环相扣。最底层是Driver与Runtime:PPU Driver分为内核态的KMD与用户态的UMD,配合PPU Runtime提供统一的设备管理和内存管理接口,让操作系统真正理解这颗芯片。
在此之上,编程语言层完整支持C/C++与Python,开发者无需学习新的语言或编程范式,现有代码资产可以平滑迁移。
再往上是编译器层,Compiler与Debugger两大组件构成完整的开发闭环,把上层框架的代码翻译并优化成芯片指令。

高性能库层则起到了把硬件算力“封装”成现成性能的作用。SAIL提供了六大核心数学库为大模型训练与推理提供支撑,也有四个编解码库用户满足多模态数据处理的高吞吐需求,还有专为多卡、多机分布式训练而设计的集合通信库,此外acext扩展库与HGML机器学习库则进一步拓展了功能边界。
而在最贴近日常开发的工具层,SAIL也提供了多种工具。Asight Compute支持算子级精细性能分析,帮助定位微观瓶颈;Asight Systems面向系统级全栈Profiling,提供宏观视角;PPU-SMI实现设备实时监控与管理;PPU-DCGM支撑集群级别的资源智能调度。
除了SDK的开放,截止今年9月,平头哥目前已开源39个和真武硬件低精度特性对齐的量化模型,累计下载超34.8万次。

从单卡调试到千卡运维,五层结构看下来,SAIL的三个特点其实是一脉相承的。

首先是兼容性。SAIL已全面适配PyTorch、TensorFlow、vLLM、SGLang等260余个主流训练与推理框架,主流模型即开即用,算子库完整对标。开发者过去积累的经验、代码、调优技巧都能直接复用,业务迁移仅需极少量代码适配——无需重写代码,让既有资产无缝延续。
其次是更新速度。AI技术迭代日新月异,平头哥自研推理引擎提供开箱即用的生产级性能,同时SAIL已建立与主流社区同频的响应机制。目前面向主流AI推理框架,SAIL平均适配时间小于7天,开发者无需额外适配和调优,就能用上前沿最新的算子、特性与优化手段。
最后是开放性。SAIL支持按需灵活选用工具链,不绑定任何特定技术路线,保障技术选型的自主与开放。这一点对照行业现状尤显珍贵,当一些芯片厂商试图把开发者锁在自己的框架里,开放本身就是一种竞争力。

三、不是“实验室代码”,已经历生产环境验证
值得注意的是,SAIL不是先开源、再慢慢打磨的实验室代码,而是一个先有生产环境验证、再向社区开放的软件栈。
目前,平头哥已推出真武系列AI芯片、倚天系列服务器CPU、磐脉系列智能网卡、镇岳系列存储主控芯片、ICN Switch互联芯片等数据中心核心芯片,实现算力、网力和存力的全栈自研。
其中,真武AI芯片已服务20多个行业、650多家客户,真武AI芯片及SAIL软件栈已在阿里云及多个行业企业的真实生产环境中历经深度打磨,扛过大规模流量、复杂场景以及严苛SLA的多重考验。

陆生华认为,一般经过这类顶级业务的验证以后,外部的场景基本也实现了覆盖。换言之,这次开放给开发者的,是被真实业务“拷打”过多年的成熟底座。
客户的实践最能说明问题。在大模型场景,蚂蚁集团推理服务团队基于T-Head SAIL,在真武810E和M890上完成主流开源大模型的推理适配与持续优化,关键技术包括量化、Prefill/Decode分离、专家并行(EP)负载均衡,以及稀疏注意力机制的高效接入等。
小红书的玩法则更体现出开源生态的活力。基于T-Head SAIL开源代码,小红书面向真武芯片架构开发了模型迁移与算子优化AI Agent,实现自动化性能优化,效果达到专家手动深度优化水平的80%以上。在兼顾模型性能的同时,它有效缩短了迁移与优化周期,让生成式推荐模型更快在真武芯片上部署上线。
小鹏汽车则印证了这套软件栈在兼容性上的优势。得益于SAIL对主流AI生态的高度兼容,小鹏顺利实现业务模型从GPU到真武的平滑迁移,并基于真武集群开展模型训练;同时借助SAIL工具链进行训练性能分析,围绕算子、框架等层面做针对性优化,智能驾驶模型的训练效率与迭代速度显著提升。
SAIL的开源生态还在持续扩展。陆生华透露,本月底到10月初,SAIL将开源第二批软件代码,包括对TensorFlow、JAX等框架的适配,FLA、acext等加速库的开源,ppu-gdb、ppu-dcgm等调试与集群运维能力的工具和更多通信库也会同步上线。
未来,SAIL将走向全面开源,未来除了架构层面信息以及用户不需要感知的信息之外,都会陆续开放。
诚然,开源之后,代码维护成本确实会大幅上升。原本打包发布的软件会被拆分成驱动、SDK、框架、上层应用等多个层次,分别集成和发布,带来代码签署、测试等方面的巨大资源挑战,目前平头哥的生态团队也正在争取更多资源支持这一开发模式切换。
陆生华称,开源并不等于失控,可以通过制定开源开放治理规范,把规则立好,让大家在规则下做事。他认为,对企业而言,长期与上游分叉会导致发布和维护成本极高,因此任何公司若想让软件迭代更敏捷、更前沿,就有动力持续贡献上游、共享成果,而不是只维护私有分支。
剩下的工作,就需要生态的共同参与。陆生华解释道,SAIL的全称是Seed of AI Library,平头哥将每一行开源代码视作一颗种子,希望通过开发者、科研机构和产业伙伴的共同参与,让国内AI软件生态从一套软件栈开始,逐渐蔚然成林。

结语:AI芯片,下一张牌是软件生态
当硬件性能逐渐跟上后,如何让更多开发者愿意用、能够用、用得好,才是未来中国AI芯片真正要解决的问题。
从真武V900到开源SAIL,平头哥在云栖大会上打出的其实是一套组合拳:一边把硬件的峰值算力推向新高,一边把决定算力能否落地的软件底座,向全球开发者打开。后者,也是中国AI算力从能用走向好用的关键一步。