昨天美团发布万亿参数大模型LongCat-2.0。宣传是业界首个在五万卡国产算力集群完成全流程训练+推理的万亿参数MoE模型。就是训练都是用的国产芯片。
训练以华为昇腾为主、寒武纪为辅,全程零英伟达/NVIDIA参与。在中美AI竞赛大趋势下,这尤为重要。
根据评测数据SWE-bench Pro得分59.5,超过Gemini 3.1 Pro、GPT-5.5、Claude Opus 4.6;SWE-bench Multilingual得分77.3,与Claude Opus 4.6持平。

在 Claude 对中国用户的大力针对下,中国用户多么希望有一个能打模型。
评测数据是很不错,那就来个真实的测试。
继续拿我之前的那个例子来测试:
帮写一个Html页面,模拟太阳系8大行星绕太阳转。要有轨道,以及行星运转动画,地球轨道加上月亮
用了深度思考模式,先思考理解需求。代码以Html方式实现。
效果还可以,但也犯大多数模型的错误,将轨道做成圆形。

然后给提示修正:

改完以后就出问题,椭圆不像椭圆,而且运动轨迹又掉飘。
效果就成为这样的了。

简单测试下来,它给我的感觉和 Doubao Seed 2.1 Pro 差不多,还没有到“国内最强编程模型”的程度。
价格方面目前很诱惑力,API 目前有限时折扣,输入-缓存未命中 2 元/百万 Tokens,输入-缓存命中 0.04 元/百万 Tokens,输出 8 元/百万 Tokens。资源包 9.9 元可以买到 5000 万 Tokens,399 元是 10 亿 Tokens,新用户还可以免费领 1000 万 Tokens。
我也赶紧花了 9.9 元,买了 5000 万 tokens,准备后面继续多测几个任务。
当然,这只是一个非常小的测试,不能用它给 LongCat-2.0 下最终结论。
分享一个X看到用户评价,大意是:
现在中国每家公司好像都有自己的大语言模型了。一家中国外卖公司刚刚推出了自己的大模型,而且它确实能和全球最顶尖模型竞争。
这句话听起来有点疯狂,但仔细想想,也许这就是正在发生的现实。
中国的大模型竞争,已经不再是几家公司之间的技术比赛,而是整个产业系统的集体下场。
阿里要把 AI 接进电商和本地服务,腾讯要把 AI 接进微信和办公场景,字节要把 AI 接进内容和用户入口,美团则可能把 AI 接进真实世界的本地生活网络。
这才是 LongCat-2.0 更值得看的地方。
它不只是一个模型发布,而是一个信号:大模型正在从少数 AI 公司的技术产品,变成各个产业平台的基础设施。
所以我对 LongCat-2.0 的态度是:评测数据值得关注,国产算力训练值得肯定,但真实能力还需要更多场景验证。
它是不是最强,现在不好说。
但它的出现本身,已经说明一件事:国产大模型的牌桌上,又多了一个不能忽视的玩家。
而接下来真正的竞争,不是谁在发布会上说自己超过了谁,而是谁能在真实任务里,一次又一次把事情做成。