美团用一个匿名马甲,赢了一场它本不用参与的考试
? 文 观察者网心智观察所
2026-07-26 22:27:30 颁布
起源::爱站网
作者::施婉菁
浏览::9298次
? 文 观察者网心智观察所
三月底之前,若是你在OpenRouter上搜索一个叫Owl Alpha的模型,或许率不会有人通知你它是谁做的。。。
它没有官网,没有颁布会,甚至连一句正式的自告奋勇都没有。。。它唯一的身份线索,是一份跑分表格里靠前的名字,以及开发者社区里偷偷流传的一句话::这玩意儿接进Claude Code出格好用。。。
比及美团把LongCat-2.0的技术汇报正式挂出来,好多人才后知后觉地拼上了那块拼图::Owl Alpha,就是LongCat-2.0戴着面具跑的那一路。。。它在Hermes榜单月挪用量全球第一,在Claude Code的挪用生态里排第二,在OpenClaw里排第三。。。
这是一次被动曝光的成功,先被开发者用出了口碑,才被揭穿是谁做的。。。放在整个国产大模型的叙事里,这个挨次其实很少见。。。绝大无数模型的出场方式,是先颁布、、先讲故事、、再等市场验证;;LongCat-2.0走的是反过来的路,先被验证,再讲故事。。。
这件事自身,比参数量更值得斟酌。。。
从硬指标来看,LongCat-2.0是一个自研MoE混合专家架构模型,总参数1.6万亿,每次推理现实激活约480亿,原生支持100万token的高低文窗口。。。它被官方称为全球首个训练和推理全流程都跑在国产芯片上的万亿参数模型,用美团自己的说法是"英伟达含量为0"。。。
这句话听起来像一句公关金句,但对应的其实是一个此前业内没人真正跑通过的工程闭环::从预训练第一天起头,全数推算都压在国产卡集群上,而不是像从前那样,训练在英伟达平台上实现,只把推理这一步挪到国产芯片上做单点验证。。。
这个区别很关键。。。从前几年,国产算力跑推理这件事,行业里已经有过不少案例,一些大模型的线上服务的确切现了在国产平台上不变对外提供服务。。。训练侧也有零散突破,百亿甚至千亿参数级此外训练流程被陆续跑通过。。。
但仔细看这些成就,性质上都是某个环节的能力证明,训练归训练,推理归推理,谁也没有把两端串成一条齐全的产线,更没有人在万亿参数这个量级上做到过。。。LongCat-2.0第一次把这条产线重新到尾焊死在国产芯片上,这才是它被称为“首个”的真正寓意,而不是单一地又多了一个大参数模型。。。
这件事有多难呢,先看看国产芯片和英伟达平台之间那道并不小的天堑。。。单卡显存更小,意味着1.6万亿参数没法塞进少数几张卡,只能拆到成千上万张卡上协同推算;;跨节点通讯带宽又不如NVLink丰裕,一旦推算和通讯没对齐,训练吞吐就会被硬生生拖慢。。。硬件差距之外,软件生态的坑更荫蔽。。。英伟达平台上那些被打磨了多年的算子库、、调试工具、、确定性推算能力,换到国产芯片上根基要重新写一遍。。。
技术汇报里提到一个具体的例子::FlashAttention的反向梯度算子,国产平台原有简直定性实现只能单核串走运行,速度比英伟达平台慢20到70倍,这种速度底子没法用在真实的出产训练里。。;;痪浠八,美团团队不是在一个成熟地基上盖楼,而是先要把地基自己浇一遍。。。
这也是为什么美团要专门搭一整套自动化的故障处置系统。。。5万张卡规模的集群,险些每天城市有硬件出问题,从异常检测、、链路切换到自动复原,全数必要自动化实现,不然光是人为排查故障就能拖垮训练进度。。。据披露,这套系统不仅把日均故障率压了下去,还支持训练工作从两千多张卡一路扩容到五万多张卡,中央没有由于架构撑不住而推倒重来。。。这种细节刚好是“万亿参数训推闭环”背后最硬核的部门。。。不要看算法自身有多聪明,要看系统工程有没有踩过所有该踩的坑。。。
架构层面,LongCat-2.0也不是单一地把参数堆大。。。针对Agent场景下长高低文带来确把稳力推算压力,团队设计了一套叫LongCat稀少把稳力(LSA)的规划。。。这里有一个值得对比的布景::DeepSeek此前提出的稀少把稳力规划DSA,思路是让模型只关注关键token来省算力,但现实跑起来会遇到一个反直觉的问题::掌管筛选关键token的索引器自身造成了新的机能瓶颈,序列越长,索引推算越慢,显存接见越碎,效能反而掉得更显著。。。
LSA就是从这个瓶颈切入的,做了三项相对独立、、能够按需组合的优化::把零散的访存要求整顿成陆续读取,让相邻层共享索引了局,再用两阶段筛选进一步压缩推算量。。。三项叠加的成效,是让100万token高低文的处置速度显著提升,同时模型质量根基没有损失。。。
另一个设计思路更反学问一些,叫N-gram Embedding,是从LongCat-Flash-Lite继承并强化而来的。。。行业里大部门MoE模型提升能力的蹊径,是不休堆专家网络的数量和规模;;LongCat团队反其道而行之,把一部门参数从后面的专家层“前移”到了Embedding层,让模型在读到输入的第一步,就能鉴别出高频词组和常见说话模式,而不是要等模型往后跑几十层才反映过来。。。
这个扭转带来的益处有两层::一是在代码理解、、指令追随这类工作上正确率会提升,由于模型不必要绕远路去“想领略”一些本该一眼看穿的模式;;二是削减了专家网络之间频仍通讯带来的额外开销,这在超大规模MoE架构里是个实打实的成本项。。。加上ScMoE快捷衔接、、零推算专家等设计,这套架构其实都在服务统一个指标::让每一份算力都花在真正必要推算的处所,而不是浪费在冗余蹊径上。。。
这套架构优化叠加国产芯片自身的成本优势,直接体此刻了一个很朴素的指标上::钱。。。测试者用统一段提醒词,让LongCat-2.0和GPT-5.5、、Opus 4.6、、Opus 4.8天生统一套物理仿真代码,四家输出成效在肉眼可见的层面上相差不大,但LongCat-2.0的token亏损量显著最低,只用了9004个token,按美团官方的计费方式算下来,成本不到一毛钱。。。这背后当然有产品定价战术的成分,好比缓存射中不计费、、Token Plan不计入亏损,但省钱这件事自身,的确是LongCat-2.0在这轮测试里阐发得最扎实的一项能力,不是靠营销话术堆出来的印象分。。。
把这些测试放在一路看会更明显一点。。。有人专门自己拼了一份几万字、、中英混合、、跨多个行业研报和论文的长文档,去测LongCat-2.0是不是真的把100万token的高低文读进去了,了局发现藏在文档锹轿的信息、、被专门拆分的齐全统计数据,它都能正确定位,速度也不慢。。。也有人把一个GitHub上13k星标的开源2048游戏项目丢给它,要求同时实现视觉风格刷新和棋盘规定扭转这两类齐全分歧性质的工作,LongCat-2.0自己拆出了一个七步打算,跑了12分钟后独立交付,没有让人中途染指调整。。。再往后,还有人让它把整个项目从原生JavaScript迁徙到React,游戏阐发不变,但底层代码全数重写。。。
这些测试凑在一路,指向的其实不是某一项具体能力有多惊艳,而是一种相对综合、、相对不变的工程可用性。。。这刚好是Agent场景里最被开发者看重、、却最难在跑分榜单上量化的器材。。。
LongCat-2.0与竞品 benchmark对比
这也是为什么Owl Alpha的匿名走红,值得单独拿出来说一说。。。跑分能够刷,宣传能够造,但一个模型若是连自己是谁都不说,还能被开发者持续、、大量地选用,这种信赖是买不来的。。。某种意思上,这是一种比公开榜单更硬的验证机制,姑且能够称之为影子验证——没有品牌光环、、没有话术加持,纯正靠好不好用被市场挑出来。。。
LongCat-2.0用两个月功夫证明的,其实不只是纸面上的技术指标能打,更是国产芯片训出来的万亿参数模型,放到一个齐全中立、、去标签化的环境里,全球开发者依然会用真实的挪用量投票。。。
当然,把这次交卷单一等同于“国产算力已经追上英伟达”,也是一种过度解读。。。美团这三年走的路,性质上是一条更慢、、更贵的路。。。2023岁首,美团成立LongCat基座团队,第一件事不是训模型,而是先搭国产算力集群;;同年跑通千亿参数训练流程;;2024年在国产卡上验证MoE架构可行;;2025年推出5600亿参数的LongCat-Flash;;2026年才落地1.6万亿参数的LongCat-2.0。。。
这条功夫线拉出来看,每一步都是踩着坑往前挪的,期间大量的功夫和成本,都花在了把英伟达平台上现成的器材在国产芯片上重新造一遍,要把算子重写、、调试工具重建、、确定性推算能力补齐,这些工作自身不产生任何直接的模型能力提升,只是让后面的训练变得可能。。。用美团自己的话说,这是一种"功夫换空间"的选择::短期内接受适配阵痛,换来持久不被单一供给链卡住脖子的自动权。。。这笔账划不划算,取决于你站在多长的功夫维度上看它。。。
也正由于这条路更慢更贵,LongCat-2.0这次交出的答卷,与其说是一次技术上的全面超车,不如说是一次可行性的证明::证了然国产算力具备支持先进大模型持续训练、、持续部署、、持续迭代的能力,而不是只能实现一次性的、、尝试室级此外单点验证。。。这个证明自身的价值,可能比模型在某几项评测上的具体分数更重要,由于它决定的是后来者要不要走这条同样艰巨的路,以及走这条路时内心有没有底。。。
站在美团的业务逻辑上再看这件事,会更容易理解它为什么愿意投入这三年。。。今年3月,美团主题本地贸易CEO王莆中在内部谈到AI时提过一个说法,叫建设物理世界AI底座,并暗示公司会持续投入基础模型,方向是做有特色、、低推理成本、、同时能力紧跟SOTA的模型。。。
这句话放在美团的业务盘子里其实很好理解,美团要做的不是一个通用谈天助手意思上的超等大模型公司,它的主题资产是外卖、、到店、、配送这些高频、、强履约、、对成本极端敏感的物理世界场景。。。一个模型若是推理成本降不下来,在这些场景里底子没法大规模落地;;一个模型若是能力跟不上SOTA,又没法支持更复杂的Agent化工作,好比自动规划配送蹊径、、自动处置商家纠纷、、自动天生到店场景的服务规划。。。
LongCat-2.0全程基于国产算力、、又把成本压到了很低的水平,刚好踩在这两个诉求的交叉点上。。;;痪浠八,这不是一次单纯为了秀技术肌肉的军备较量,更像是美团在为自己将来要搭的理解层和行动层,先把地基浇扎实。。。
当然,这里也必要留一个问号。。。一次匿名测试的走红,证明的是模型在编程和Agent这类特定场景下的实用性,但它离“综合能力全面对齐一线模型”还有距离,公开汇报里给出的评测数据目前也重要来自美团自己,第三方独立评测的样本还不够多,这些都必要更长功夫的市场使用去补齐。。。国产芯片路线自身的可持续性也是个必要持续观察的变量,
这一次的五万卡集群能撑住万亿参数,不代表下一次参数量再翻倍时,同样的工程规划还能不能扛住,硬件迭代的速度能不能跟上模型规模扩张的速度,都是未知数。。。而放在更大的产业布景下,“英伟达含量为0”这个说法自身,也很难齐全脱离当下全球芯片供给链博弈的语境去被单纯解读为一次技术叙事,它同时也是一次面向产业链高低游、、面向潜在客户的信号开释,这一层意味也值得注意。。。
回到最起头那个问题::Owl Alpha靠匿名走红,靠的不是营销,是被开发者用真实挪用量投出来的信赖。。。这种信赖一旦被市场记住,下一次新模型上线,可能就不必要再靠面具赢一次了。。。但反过来想,若是这条路真的走得通,下一个披着马甲、、偷偷挤进全球开发者工具链的国产模型,或许率也不会是最后一个。。。
起源|心智观察所
不容转载
2025年6月,王某、、阚某、、汪某被抓获归案。。。同年9月,宗某自动向公安机关投案。。。经检察机关提起公诉,同年11月12日,法院认定4人均为从犯,判处王某有期徒刑八个月,判处其他3人有期徒刑七个月。。。一审判决后,4人均认罪服判,未提出上诉。。。
责任编纂::郭湘儒 校对::赖宗翰