智东西(公众号:zhidxcom)
作者 | 王涵
编辑 | 云鹏

智东西8月7日报道,今天,英国《金融时报》援引知情人士报道,字节跳动正在训练一个参数量高达10万亿的AI模型。而这一数字,在昨日晚间的晚点 LatePost独家报道中还是“超5万亿”

即使是5万亿,这一模型的规模也已经超过目前中国已发布的最大模型Kimi K3,接近Anthropic的Fable 5;如果是10万亿,那字节的新模型规模将超越约有8万亿参数的Mythos 5

截至文章发表前,字节跳动未对此发表回应。

曝字节训10万亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声

▲英国《金融时报》报道

据外媒报道,其中一位知情人士透露,字节的这一模型还处于早期阶段,目前正在进行为期3到6个月的预训练,如果一切顺利,之后会进行微调并发布,具体的模型尺寸将在后期阶段才能确定。

另据晚点 LatePost报道,字节的新模型将由Seed Foundation负责人项亮主导,与大语言模型预训练数据负责人沈科合作。

字节这一“巨无霸”大模型的爆料,引起了不少外网网友的关注。

有网友化用了漫威电影《蜘蛛侠》中的经典台词“With great power comes great responsibility.(能力越大责任越大)”,说“能力越大,竞争越大。(AI)走到这一步并不让人意外,如果他们的模型能像Kimi K3那样持续进化,那就会逼着所有人都得加速追赶,否则只能出局。”

曝字节训10万亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声

▲网友评论(来源:X)

还有网友认为:“10万亿参数(的模型)还没正式推出,就已经改写了推理的算账逻辑。”

曝字节训10万亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声

▲网友评论(来源:X)

此前,字节跳动将飞书团队一分为二,产品团队并入豆包,销售线划归火山引擎。对这一拆分决定,晚点 LatePost报道,字节跳动创始人张一鸣在与Seed负责人吴永辉共同召开的Seed全员会上解释称,把火山引擎、飞书和豆包的资源整合到一起,是为了构筑在算力和数据上的优势

曝字节训10万亿参数大模型,或超Mythos 5,张一鸣、梁汝波先后发声

▲字节跳动创始人张一鸣(来源:36氪)

在会上,张一鸣认可了编程(Coding)的关键地位。这一点,字节跳动CEO梁汝波在8月6日召开的字节年度全员会“All-Hands”上再次强调,据财新报道,他坦承豆包大模型在AI Coding方面并不算突出,还用Anthropic的Claude Code举例。

但张一鸣也提醒称,编程只是眼下的热点之一,要着眼其他领域。

同时,张一鸣反对模型蒸馏,蒸馏能在短期内改善模型表现但本质上仍是在复制已有的能力。沿着这条路走,模型能力最多只能不断逼近对方,很难真正实现超越。张一鸣表态,即使不蒸馏意味着字节在技术上会短暂落后国内竞争对手,但也不想走捷径

模型蒸馏(Model distillation)是将一个大型、复杂的AI模型压缩为更小、更快模型的过程,即通过训练小型模型复制大型教师模型的知识和输出。

张一鸣还透露,过去几年,字节已经在AI方向投入了很多,未来还会投入更多

结语:国内大模型迎来窗口期,字节跳动“双线”进攻

Anthropic的Mythos 5因安全顾虑被暂时禁用,目前仅对经批准的组织开放;Fable 5此前也因安全问题被美国政府勒令”停服”。近期,OpenAI的模型同样频繁爆出不受控的安全问题。

大洋彼岸的接连“暴雷”,给国内大模型的发展“撕”开了一个难得的窗口期。

过去几周,月之暗面的Kimi K3和阿里巴巴的Qwen 3.8 Max在基准测试中表现抢眼,仅在某些领域落后于Anthropic的Fable 5,国内外开发者的反馈也相当积极。

跑分之外,更值得关注的是下一阶段的动作。英国《金融时报》报道,业内人士透露,多家中国实验室正在训练Fable 5规模的模型,而字节跳动几乎是在这条赛道上押注最激进的一家。

与阿里、腾讯等同行不同,字节跳动的AI大模型大多为闭源,但其最新的SeeDance模型在视频生成领域已跻身全球最先进之列,面向消费者的AI应用豆包月活已达3.24亿,是国内最受欢迎的AI应用。与飞书合并后,豆包也开始向B端市场冲刺。

一边是产品端的B端加速,一边是训练端的激进规模与对Coding的强调,字节跳动开始“双线进攻”。

来源:英国《金融时报》、晚点 LatePost、财新