智东西(公众号:zhidxcom)
作者 | 江宇
编辑 | 心缘
智东西9月30日报道,9月25日,美团LongCat团队上线了新一代预览版模型LongCat-2.5-Preview,并在OpenCode开放了为期两周的限时免费体验。

具体能力如何?我们将LongCat-2.5-Preview接入Claude Code,连续测试了三个Coding任务:复刻Meta Muse App、制作SpaceX星舰升空动画,以及开发一款3D赛车游戏。从整体体验来看,一句话概括:能用、够省,但还不够快。

该模型总参数达到1.6万亿,每次推理激活约480亿参数,支持100万Token上下文窗口和原生多模态能力,主要面向长周期任务,可操作终端、浏览器、GUI、电子表格和设计工具等。值得一提的是,上一代LongCat-2.0是在国产算力集群上完成大规模训练的,并实现万亿参数MoE模型的稳定训练与推理。
回到模型价格,LongCat API开放平台新用户完成实名认证后,可免费领取1000万Token。目前LongCat平台还提供5000万Token新手资源包,售价9.9元,均可用于LongCat-2.0和LongCat-2.5-Preview。
LongCat-2.5-Preview API也在进行限时折扣:缓存未命中的输入价格由5元/百万Token降至2元,缓存命中输入由0.1元降至0.04元,输出由20元降至8元。
我们最初在OpenCode体验时,由于用户较多,模型一度无法及时响应。OpenCode评论区中也已经出现首批开发者“省流”测试案例,比如让模型制作“鹈鹕骑自行车”的动画,成品存在一些动作与姿势的细节问题。

因此,我们随后改用API,将LongCat-2.5-Preview接入Claude Code继续测试。面对连续、多步骤的Coding任务,它的实际表现究竟如何?下面直接看实测。
一、复刻现象级App Muse,核心交互基本跑通
首先,我们复刻了一款近期走红的App——Meta Muse。Muse上线后仅10天便登顶美国App Store免费应用总榜,一度超过ChatGPT。

▲Muse实机界面(图源:APP Store)
其产品设计同样有辨识度:整个界面保持极简聊天形态,Agent执行浏览网页、填写文件、付款审批等任务时,相关结果会直接以卡片形式嵌入聊天流中。
我们因此要求LongCat参考Muse界面,复刻其主要视觉和交互逻辑,包括Chat、Ideas、Goals、Connectors等页面,以及Browser Card、File Card、Approval Card等组件,并完整跑通一次电影票预订流程。
从最终效果看,Muse实机画面中的主要设计元素基本得到保留。

顶部是居中的Agent头像,左侧为菜单按钮;聊天区域采用灰色AI气泡和浅蓝色用户气泡;Browser Card、文件卡片和支付确认卡片均直接嵌入对话中,底部则保留极简输入框。不仅视觉结构较为接近,几个主要页面也可以实际切换。
在电影票实验,用户确定场次后,聊天流会出现选座Browser Card,随后进入支付确认步骤;点击Allow后,Agent继续返回订票结果。

整个流程都在同一聊天界面内完成,与Muse的主要交互逻辑基本一致。不过,这项任务的思考时间较长。其中一次连续思考时间达到约10分钟,整个项目最终完成耗时也超过30分钟。

二、代码模拟星舰升空,主要动态效果均有实现
第二个任务,选择了刚刚发生的事件。近日,SpaceX第14次星舰试飞从美国得州Starbase基地点火升空。
我们要求LongCat使用前端代码制作一个实时运行的星舰发射动画,不调用MP4、GIF或预渲染视频,主要通过Three.js、WebGL、Shader和粒子系统完成火箭、喷流、烟雾、动态光照和镜头运动。
最终项目中,LongCat用程序化几何体搭建了Starship和Super Heavy,并加入发射塔、发射台和地面设施。

发动机部分使用多个喷流源模拟发动机集群,同时加入火焰;烟雾则分成白色蒸汽、灰色烟雾和贴近地面的尘土三层。项目还实现了动态光照、Camera Shake、镜头上仰、冲击波以及发射状态UI等效果。
火箭先在发射台保持静止,随后点火、产生烟雾并缓慢离开发射台,之后逐渐加速,镜头同步向上抬升。
从最终画面来看,火箭、发射塔、尾焰、烟雾和镜头跟随等核心元素都已经具备,能够完整实现一次星舰点火升空过程。不过与我预期的视觉效果相比,最终成品在场景丰富度、烟雾层次和3D材质细节上仍有提升空间。
三、搭建3D赛车Demo,竞速玩法完整落地
第三个任务,我们让LongCat制作一款可以实际游玩的3D赛车游戏Demo。
提示词要求项目具备3圈比赛、3辆AI赛车、WASD控制、漂移、氮气、碰撞反馈和Checkpoint机制,同时加入排名、速度、圈数、计时器等游戏UI。最终Demo已经可以实际运行。
玩家可以控制赛车完成加速、刹车和转向,AI车辆也能够沿赛道参与比赛;漂移、氮气、圈数、排名以及计时等基础机制均有实现。

主观体验上,这一任务中LongCat-2.5-Preview的速度与完成度低于我们此前体验的DeepSeek-V4.1-Flash,高于MiMo-V2.6。
试玩过程中,我们发现了一个控制问题:按D键时,赛车实际向左转。LongCat随后检查代码,将问题定位到Three.js坐标系与车辆朝向之间的关系,并耗时3分钟修改了`steer`的符号逻辑。

除此以外,赛道本身也相对简单。实际体验中,弯道较多,直道、坡道等路况的区分并不明显。
结语:国模牌桌再添一员,LongCat存在感上来了
三项测试中,LongCat-2.5-Preview都完成了可实际运行的项目。当天共使用798.56万Token,由于缓存命中不计入资源包消耗,实际扣除约78.98万Token。按照当前1000万Token免费用的新手礼包,价格优势比较明显。速度方面,三个任务耗时均超过30分钟。
相比国内头部模型,LongCat此前的市场声量并不算高。但这次预览版不仅保留了原生多模态能力,在Coding和长任务执行上也已经展现出较完整的能力。
国产模型的竞争正在从参数、榜单延伸到Coding、Agent、多模态和真实任务执行。LongCat-2.5-Preview已经给出了一次阶段性答卷,接下来可以关注正式版在速度、稳定性和复杂任务能力上的进一步表现。