芯东西(公众号:aichip001)
编译 | 程茜
编辑 | Panken
芯东西8月7日消息,今日,AMD宣布达成收购加拿大AI推理芯片创企Taalas的协议。
Taalas的技术将作为补充,完善AMD全栈AI平台,包括AMD Helios机架级解决方案、AMD Instinct GPU、AMD EPYC CPU、AMD ROCm软件以及AI生态系统。未来,AMD计划将其技术融入加速器路线图规划中,并利用AMD Instinct GPU开发出系统级解决方案。
Taalas成立于2023年,其技术路线特立独行:无需软件而是将模型结构、参数与权重深度直接固化于硬件之中。
今年2月这家神秘创企才浮出水面,彼时该公司宣布总融资额已超2亿美元(约合人民币14亿元)、推出首款可为任意模型定制芯片的平台HC1,首款产品由24人团队打造,共花费3000万美元(约合人民币2.1亿元)。

HC1推出后一夜之间便刷屏硅谷,社交平台网友纷纷开启实测,并称其性能惊人、将给英伟达GPU带来巨大挑战。但也有不少用户吐槽:Taalas的产品确实快,但错误率过高。芯东西此前在尝试时提问了“9.9和9.11比大小”以及经典的鸡兔同笼题目,该模型分别在0.001秒、0.017秒内给出了错误答案。

▲社交平台X上网友评论(左、中),芯东西实际体验截图(右)
Taalas创始人兼CEO柳比萨·巴吉克(Ljubisa Bajic)曾任职AMD集成电路设计与架构总监、英伟达高级架构师。他2016年创立AI芯片公司Tenstorrent,2023年将其交接给Jim Keller(吉姆·凯勒)后,又创办了Taalas。
Taalas的另外两位创始人是巴吉克的妻子、曾在AMD担任系统工程高级经理的莱拉·巴吉克(Lejla Bajic)以及曾在AMD担任高级设计工程师、在Tenstorrent担任工程师的德拉贡·伊格(Drago Ignjatovic)。
HC1采用台积电6nm制程,芯片面积与英伟达H100芯片相当,为815平方毫米。HC1芯片可以将整个8B版本的Llama 3.1模型集成到单个芯片上。
其官方博客提到,Taalas还模拟了DeepSeek R1-671B的多芯片解决方案,其存储整个671B模型采用了大约30个定制芯片,模拟结果表明,DeepSeek R1-671B每用户每秒可生成约12000个token;Llama 3.1单个用户的生成速度可达17000 token/秒,速度接近Cerebras推理平台的10倍,英伟达H200的73倍、B200的48倍,构建成本为Cerebras现有方案的1/20、功耗仅为1/10。

根据Taalas发布的成本与延迟对比数据,基于Taalas的芯片方案,Llama 3.1 8B的推理查询成本为每百万token 0.75美分(约合人民币0.052元),DeepSeek R1的成本为每百万token 7.6美分(约合人民币0.53元)。
相比之下,Llama 3.1 8B在GPU吞吐量优化方案上的成本为每百万token 3.79美分(约合人民币0.26元),DeepSeek R1为20.2美分(约合人民币1.4元),延迟优化方案中,Llama 3.1 8B的成本为28.61美分(约合人民币2元),DeepSeek R1为49美分(约合人民币3.37元)。

巴吉克称,Taalas的极端方案可能很适合某些特定应用,本质是找到追求经济效益和速度而牺牲灵活性的方法。
Taalas在发布HC1时还透露了下一步计划,他们将基于HC1为第二款中等规模的推理模型打造芯片,该模型预计于今年春季在实验室完成流片,并很快集成至其推理服务中;随后,该公司将基于第二代芯片平台HC2推出新大语言模型,HC2将提供更高的算力密度与更快的执行速度,计划在今年冬季正式部署。
结语:从外部合作到重金并购,AMD正在下一盘大棋
Taalas并不是AMD唯一一家支持的互补性加速器厂商,今年7月,AMD还宣布与Cerebras建立合作伙伴关系,计划在今年晚些时候将Cerebras的AI芯片集成到自己的系统中。
此外,AMD还一直在积极收购相关公司,以补充构建其Helios机架式服务器所需的一些组件和技术。2024年,该公司以6.65亿美元(约合人民币44.87亿元)收购了AI模型开发公司Silo AI;AMD还以49亿美元(约合人民币330.61亿元)收购了机架式产品提供商ZT Systems。去年,AMD还收购了几家较小的AI公司,例如推理软件开发商MK1。
来源:AMD、Taalas