Evidence-led Research
把“5 万卡国产训练”拆成可验证的工程事实
结论严格分为官方确认、高概率推断和尚无公开证据。核心判断:若训练主平台为昇腾,Atlas A2 / 910B 最可能是主力;950PR 并非训练定位,950DT 又尚未上市。
Full Report
完整研究报告
包含硬件判断、训练时间线、同行对比、算力储备与商业化。
美团 LongCat-2.0 国产算力与商业化深度研究
生成日期:2026-07-17
结论先行
LongCat-2.0 的真正价值,不只是“用国产卡把一个 1.6T MoE 模型训出来”,而是美团证明了自己已经拥有一套从算子、通信、调度、容错、数值正确性到大规模推理的国产 AI 基础设施。公开证据可以确认:模型从零预训练,预训练数据超过 30T tokens(模型卡称超过 35T),训练和大规模部署均在国产 AI ASIC 超级集群上完成;国产算力工程始于 2023 年,2024 年进入万卡阶段,最终峰值训练规模超过 5 万卡,稳态吞吐超过 1T tokens/day。
最敏感的芯片型号并未被美团公开。综合时间线、华为产品路线和美团开源的 NPU 推理代码,最合理的判断是:如果核心训练平台是华为昇腾,主力更可能是 Atlas A2 / Ascend 910B 家族,后期可能兼容或引入 910C;950PR 不应被写成训练主卡,因为华为官方将其定位为 Prefill 和推荐,真正面向训练的 950DT 要到 2026 年第四季度才上市。现有公开证据不足以证明“5 万卡全部是华为”,也不足以证明训练任务中存在 910B 与 910C 混跑。
“5 万卡”更接近一个逻辑统一训练集群上的单作业峰值,而不是把多期采购、多地库存简单累加。官方使用单数“在五万卡集群上完成”,项目报道进一步称“峰值训练规模超过 5 万张、迄今国产平台规模最大的训练任务”。物理层面很可能由多个 SuperPod、机房单元或网络域组成,但它们被统一编排为同一个训练环境。
美团对摩尔线程、沐曦等国产芯片企业的投资,并不等于 LongCat-2.0 的预训练采用了这些公司的卡。可证实的是:LongCat-2.0 开源后,摩尔线程用 MTT S5000 + MUSA/SGLang 完成推理适配,沐曦用曦云 C 系列 + MXMACA 完成 Day-0 推理适配。公开材料没有显示二者参与 5 万卡预训练。这体现出“资本布局用于保留供应链选项,核心生产选型仍服从规模、稳定性和软件生态”的现实落差。
关键问题判断表
| 问题 | 判断 | 置信度 | 公开证据边界 |
|---|---|---|---|
| 训练卡是否为 950PR | 基本可排除其作为主训练卡 | 高 | 950PR 官方定位 Prefill/推荐;950DT 才面向训练且 2026Q4 才上市 |
| 是否为昇腾 910B | 若为华为,910B/A2 是最可能主力 | 中高 | 开源 NPU 栈明确支持 Atlas A2、依赖 910b-ops;但美团未点名训练厂商 |
| 是否混合 910B + 910C | 公司算力池可能异构,单次同步训练作业内混跑概率低 | 中 | 代码兼容 910B/910C;未披露实际训练拓扑 |
| 5 万卡是单集群还是累加 | 更像单个逻辑集群、单作业峰值 | 高 | 官方称“五万卡集群”;项目报道称“峰值训练规模超过5万” |
| 摩尔线程、沐曦是否参与预训练 | 未发现公开证据;已确认推理适配 | 高 | 两家公司公告均描述开源后的 Day-0 推理适配 |
| 后训练是否用国产算力 | 是,官方称 MOPD 在国产算力集群上融合 | 高 | 但未披露是否使用与预训练完全相同的卡池和规模 |
| 线上推理是否国产 | 核心大规模部署是国产 ASIC;开源部署同时支持 GPU/NPU | 高 | 具体线上流量在各类卡之间的比例未披露 |
| 内外部 Token 分配 | 没有公开绝对量和比例 | 高 | 只有 OpenRouter 调用排名、外部配额和价格 |
1. 训练硬件:能确认什么,不能确认什么
1.1 官方刻意不披露具体芯片厂商
美团官方技术博客只使用“五万卡国产算力集群”和“AI ASIC superpods”等表述,没有披露厂商和卡型。CNA/AFP 的报道也明确写道,美团没有披露训练采用哪家中国芯片厂商。这意味着任何把 5 万卡直接写成“全是 910B”“全是 950PR”或“华为、摩尔线程、沐曦混合”的说法,都超出了公开证据。
1.2 为什么 950PR 不是合理答案
华为 2025 年 9 月公布的产品路线非常关键:Ascend 950PR 面向 Prefill 和推荐,2026 年一季度上市;Ascend 950DT 面向 Decode 和训练,计划 2026 年四季度上市。LongCat-2.0 在 2026 年 6 月已经完成超过 35T tokens 的训练并发布,因此不可能依赖尚未上市的 950DT 完成核心预训练。950PR 虽然可以承担部分推理 Prefill 或推荐任务,但不应被当成 LongCat-2.0 的主训练卡。
1.3 为什么 910B / Atlas A2 是最强候选
美团开源的 SGLang-FluentLLM NPU 分支明确给出 LongCat-2.0 在“昇腾 Atlas A2 Pod”上的部署样例,规模为 192 卡,单机 16 卡,并要求安装 CANN 的 910b-ops。仓库中的多个自定义算子也以 ascend910b 为目标 SoC;启动脚本同时识别 910B 和 910C。这直接证明美团为 LongCat-2.0 做了较深的昇腾 910B/A2 推理工程,而不是仅做一层框架兼容。
时间线也支持 910B:美团在 2023 年 7 月正式启动国产算力适配,2024 年 7 月获得超过 16,000 卡的国产集群。彼时 910B/A2 是最成熟、最可能达到万卡交付规模的国产 AI ASIC 平台;910C/A3 更可能承担后期扩容、兼容或推理任务。由于美团未点名,报告将“910B/A2 为主力”列为中高置信度推断,而不是官方事实。
1.4 混合部署应区分两个层面
公司级算力池出现异构几乎是必然的:不同批次可能有 910B、910C、其他国产 GPU 以及历史存量海外 GPU,分别承担训练、评测、后训练、推理、推荐和内部业务。但单次大规模同步训练作业通常更偏好同代、同规格、同软件版本和同拓扑的卡,因为异构混跑会被最慢设备拖住 step time,并放大显存、算子、通信和容错复杂度。
因此更合理的形态是“分阶段、分作业、分资源池异构”,而不是在同一个 5 万卡训练 job 里任意混合 910B、910C、摩尔线程和沐曦。
2. 5 万卡到底代表什么
官方称“最终在五万卡集群上完成万亿参数模型的全流程训练与推理”,项目亲历者报道则称“峰值训练规模超过 5 万张国产算力卡,是迄今国产平台规模最大的训练任务”。这两种表述共同支持:5 万卡是训练任务达到的并发峰值,而不是多年累计采购量。
“单集群”在这里应理解为逻辑统一的训练集群。物理上,它可能由多个 SuperPod、机柜组、网络域甚至多个机房单元构成,通过统一调度、通信和 checkpoint 系统形成一个作业。公开资料没有披露是否跨地域、是否跨数据中心,也没有证据支持把“5–6 万卡”解释成多个互不协同的小集群简单相加。
从官方的“超过 35T tokens”和“稳态超过 1T tokens/day”做量级校验,完整预训练仅在稳态阶段就至少需要约 35 天;模型卡又称训练跨越“数百万 accelerator-days”,除以约 5 万卡,对应至少数十天的全量运行。因此实际 full run 更可能是 1–2 个月量级,而“三年”指的是国产平台从适配、验证到规模化的工程周期,并非一个训练作业连续跑了三年。
3. 国产训练的三年爬坡路径
公开采访给出了一条相当清晰的工程时间线:
| 时间 | 阶段 | 关键结果 |
|---|---|---|
| 2023 年上半年 | 内部论证 | 判断大模型核心算子相对有限,国产训练原理上可行 |
| 2023 年 7 月 | 正式启动 | 与算力厂商建立周会和高频技术交流机制 |
| 2023 年 9 月 | 成建制适配 | 从单算子验证推进到端到端训练 |
| 2024 年春节前后 | 首次闭环 | 跑出首个 Loss,数值与主流芯片接近 |
| 2024 年 7 月 | 万卡交付 | 超过 16,000 卡集群交付,一周左右跑通端到端作业 |
| 2024–2025 | 体系重构 | 重写算子、通信、调度、工具链,建设确定性和自动恢复 |
| 2026 年上半年 | 5 万卡 full run | 完成 1.6T MoE、35T+ tokens 的全流程训练与大规模部署 |
核心难点不是单卡算力,而是系统工程:
- 稳定性:任何一张卡、链路或进程故障都可能挂掉同步作业。团队建设了卡间通信异常处理、弹性扩缩卡、自动重调度和自动恢复,将月均日故障率降低 70% 以上,项目报道给出的训练稳定性超过 92%。
- 正确性:万卡阶段暴露出随机比特翻转、数值不一致和难以复现的问题。团队建设确定性算子、Bitwise 一致性验证和参数检测,并优化关键模块计算精度与 Reduce 逻辑。
- 算子生态:早期国产平台开发一个算子可能需要一个月以上。确定性 FlashAttention 反向算子一度比非确定性版本慢 20–70 倍,美团自研后把性能损失压到约 5%;Scatter 类算子也通过新并行算法提升数十倍。
- 通信与调度:万卡首次启动时,调度系统甚至因为作业内存统计超过整数上限而无法正常展示;MoE 的 All-to-All、流水线并行和超节点拓扑需要重新设计。
- 显存与带宽:1.6T 总参数、1M context、MoE 专家路由使 HBM 容量、访存带宽和片间互联成为比峰值 FLOPS 更现实的约束。
结果层面,美团披露训练 MFU 提升 1.5 倍、稳态吞吐超过 1T tokens/day,模型卡称完整训练没有回滚或不可恢复的 Loss spike。需要注意,“没有回滚”不等于“没有硬件故障或作业重启”,而是指容错和恢复没有造成不可逆训练损失。
4. 芯片供应商支持与技术反馈
公开信息无法量化华为投入了多少工程师、是否驻场、是否提供专门版本或 SLA,但可以确认供应商参与程度很深:美团从 2023 年 7 月就建立厂商周会和高频技术交流;开源仓库要求从“华为生态工程师”获取部分 CANN/Community SDK,并基于 CANN 官方 ops-transformer 的具体分支、提交和合并请求制作 910B 自定义算子补丁。
美团向供应商反馈的问题很可能覆盖以下几类:
- 确定性 FlashAttention、Scatter、Reduce 等算子的性能与正确性;
- HCCL/集合通信异常、MoE All-to-All 延迟、超节点内外通信一致性;
- HBM 容量、长上下文 KV-cache、权重预取和访存瓶颈;
- 驱动、编译器、调试器和错误定位工具的可用性;
- 随机比特翻转、卡间性能离散、故障检测和自动隔离。
这些反馈显然推动了软件栈和算子层迭代,但公开材料不足以证明它们直接改变了某一代芯片的硅设计、驱动版本或硬件规格。可以安全表述为“形成了模型—Infra—芯片的持续协同优化闭环”,不宜具体声称“美团推动华为从某版本升级到某版本”。
5. 后训练与推理是否仍在国产集群
美团开源文章明确写道,后训练阶段采用多教师在线蒸馏,将 Agent、Reasoning、Interaction 三类专家通过 MOPD 在国产算力集群上无缝融合。因此后训练不是转回海外 GPU 的公开案例。没有披露的是:后训练是否使用与预训练同一批卡、是否达到 5 万卡规模,以及不同 SFT/RL/蒸馏任务如何切分资源。
推理侧的证据更强。模型卡称完整训练和大规模部署均建立在 AI ASIC superpods 上;官方还公开了针对国产卡的模型、芯片适配与部署协同优化,包括:
- Attention absorb、Indexer 与 MLA prolog 并行;
- KVP 切分 KV-cache,缓解 1M context 的 I/O 和显存压力;
- ScMoE 利用控核能力并行 Dense 与 MoE 分支;
- Super Kernel 减少 kernel launch 开销;
- Weight Prefetch 隐藏 I/O 延迟;
- PD 分离、Expert Parallel、序列并行和异步负载均衡。
开源 NPU 样例在 Atlas A2 192 卡上采用 64 卡 Prefill + 128 卡 Decode。摩尔线程和沐曦也已完成推理适配。这说明未来推理可以比训练更异构:训练强调同质性和全局同步,推理可以按 Prefill、Decode、上下文长度、精度和成本把流量拆到不同硬件池。
6. 投资版图与实际训练选型的落差
CNA/AFP 报道称美团投资了摩尔线程和 MetaX(沐曦)。摩尔线程上市时,美团旗下三快科技已出现在股东体系中,并通过深圳三快网络参与战略配售。沐曦也被报道为美团投资的国产芯片公司。
但 LongCat-2.0 的公开协同只证明了两家公司在开源后完成推理适配:
- 摩尔线程:MTT S5000 + MUSA 软件栈 + SGLang-MUSA,完成模型加载、推理引擎、关键算子、部署和精度验证;
- 沐曦:曦云 C 系列 + MXMACA,完成 Day-0 推理适配,强调长上下文、多卡协同和 SGLang/vLLM 兼容。
没有证据表明二者进入 5 万卡预训练主集群。原因并不矛盾:战略投资的目标是获得供应链可选项、生态关系和潜在财务回报;生产训练选型则要求一次性交付规模、长期稳定性、工具链成熟度、网络拓扑、运维体系和单位有效算力成本。投资组合可以多元,核心训练平台往往只能集中。
7. 美团算力储备与未来采购
美团没有公开“总共有多少 AI 卡、各型号多少、未来采购多少”的清单。5 万卡只能证明一次训练任务可调度到的峰值规模,不能等同于公司全部算力储备,也不能证明这些卡全部自有;其中可能包含自建、云租赁、合作集群或长期容量合同。
财报可以提供外围尺度:2025 年研发费用为 259.98 亿元,同比增长 23.5%,公司称主要由 AI 等公司级投入增加推动;电子设备新增账面投入为 102.42 亿元,高于 2024 年的 64.72 亿元;年末已承诺但尚未发生的物业、厂房与设备资本开支为 51.33 亿元;现金及现金等价物与短期理财合计约 1,668 亿元。电子设备并不等于 AI 加速卡,但这些数字说明美团有持续扩张计算基础设施的财务能力。
最可能的采购策略不是只押一家,而是“训练主平台集中 + 推理多平台扩展”:保持一套经过验证的主训练集群,同时让 910C/950 系列、摩尔线程、沐曦等在推理、评测、特定工作负载和下一代集群招标中竞争。
8. 出口管制升级后能否支撑下一代模型
现有国产集群足以证明美团可以完成 LongCat-2.0 这一代模型的完整训练,但“能完成一次”不等于“拥有充裕算力”。下一代模型的瓶颈更可能出现在有效算力和研发迭代速度,而非模型是否能启动。
如果下一代模型把激活参数、训练 tokens 或长上下文训练比例提高一倍,训练计算量可能上升 2–4 倍。沿用 5 万张 910B 级别卡,理论上仍可通过延长训练周期完成,但会显著压缩并行实验、消融、后训练和线上推理资源。真正制约前沿能力的将是:
- HBM 容量与带宽,尤其是更大 MoE、优化器状态和百万上下文;
- 超节点 scale-up 互联和跨节点 All-to-All;
- 大规模故障率、备件供应、芯片良率和运维效率;
- 电力、液冷、机柜密度和网络建设周期;
- CANN/MUSA/MXMACA 等软件版本的成熟度;
- 是否有足够资源同时跑主训练、多个实验和大规模在线服务。
华为 950DT 和 Atlas 950 SuperPoD 的训练能力要到 2026 年四季度才进入市场,可能成为美团下一代训练平台的候选,但量产、软件成熟和实际交付节奏仍是变量。结论是:现有平台具备“保底完成下一代”的基础,但若模型规模和研发节奏同步上升,仅靠现有 5 万卡存量很难保持国际前沿实验密度。
9. 与 DeepSeek V4、智谱 GLM 的工程与战略差异
公开资料对 DeepSeek V4 和智谱 GLM-5/5.1 的核心表述是国产芯片推理适配。DeepSeek V4 官方模型材料没有宣称完整预训练在国产芯片完成;智谱官方则明确写“国产芯片支持线上推理集群”,并列出华为昇腾、摩尔线程、寒武纪、昆仑芯、沐曦、燧原和海光等平台。二者都体现出部署层的多芯片兼容,但不应自动等同于原生国产预训练。
两类工程的差别如下:
| 维度 | 国产推理适配 | LongCat 原生国产训练 |
|---|---|---|
| 起点 | 模型权重和架构基本确定后移植 | 从基座设计、预训练开始围绕硬件共设计 |
| 主要工作 | 权重加载、量化、推理算子、KV-cache、调度、精度验证 | 前反向算子、优化器、集合通信、并行策略、checkpoint、确定性、长期容错 |
| 时间尺度 | Day-0 到数周/数月 | 多年平台建设 + 数十天 full run |
| 硬件要求 | 可以多厂商并行适配 | 主训练 job 更依赖同质硬件和统一软件栈 |
| 战略意义 | 扩大部署选择、降低推理成本 | 证明前沿模型研发不再依赖受管制训练 GPU |
LongCat 并非完全没有参考 DeepSeek。其官方 README 明确写道,LongCat Sparse Attention 是为解决 DeepSeek Sparse Attention 中 Lightning Indexer 的输出不连续和平方级打分瓶颈而设计,说明模型架构层吸收了 DeepSeek 的公开研究。但美团国产训练 Infra 在 2023 年已经启动,早于 DeepSeek V4;目前没有证据表明其训练集群、调度、容错和算子体系直接复制了 DeepSeek 的国产适配方案。更准确的说法是“模型架构借鉴公开研究,国产训练平台长期独立建设”。
10. 开源范围与商业化
10.1 开源动机
美团官方把开源定义为“技术路径的公开”和“生态邀约”,希望盘活存量国产算力。更深层的商业逻辑包括:
- 用开放权重扩大开发者和 Agent 工具生态,形成事实标准;
- 用公开的国产推理栈降低企业采用门槛,反向扩大 API 和私有部署需求;
- 把一次巨额训练投入摊薄到外部生态和品牌影响力;
- 展示国产训练能力,为下一轮芯片采购和产业合作增加议价权;
- 为美团内部本地生活 AI、编码、运营和商家工具积累外部反馈。
10.2 实际开源了什么
已开放的内容包括:
- BF16、FP8、INT8 等多精度模型权重,MIT License,允许免费商用;
- Hugging Face、GitHub、ModelScope 模型卡和部署说明;
- GPU 侧 SGLang 部署 recipe;
- NPU 侧 SGLang-FluentLLM、Atlas A2 部署样例和大量 910B 定制推理算子;
- 模型架构、评测和核心推理优化文档。
未发现开源的内容包括:
- 预训练数据及清洗配方;
- 完整预训练框架、5 万卡调度系统和自动恢复平台;
- 训练用的全部前反向算子、通信实现和生产配置;
- SFT/RL/MOPD 的完整后训练代码、数据和奖励系统;
- 真实训练拓扑、卡型分布、故障日志和供应商版本信息。
因此“全栈开源”更准确地理解为“权重 + 多平台推理栈基本开放”,不是把训练 Infra 全部交付社区。
10.3 Token 用量、计费与商业化节奏
公开信息没有给出 LongCat 内部和外部的绝对 Token 用量,也没有披露内部结算规则。官方只披露 LongCat-2.0 预览版曾进入 OpenRouter 全球调用量前三,并在 Hermes、Claude Code、OpenClaw 等场景排名靠前。这里更接近调用次数或平台排名,不等于 Token 总量。
外部商业化已经从免费测试转为“资源包 + 按量计费”:LongCat-2.0 限时价格为未命中缓存输入 2 元/百万 tokens、命中缓存输入 0.04 元/百万 tokens、输出 8 元/百万 tokens;资源包中缓存命中免费,资源包限量、分时段发售,30 天有效。2026 年 4 月预览测试初始额度为每日 500 万 tokens,提交反馈后单日最高可刷新到 1.2 亿 tokens。
这些机制释放了三个信号:第一,美团以低价和缓存优惠争夺 Agent Coding 的长上下文流量;第二,限量资源包和分时抢购说明服务仍受容量约束,需要主动整形需求;第三,当前线上发票规则以个人电子发票为主,表明公开 API 商业化仍在早期,企业级合同、私有部署和内部业务价值可能比短期 API 收入更重要。
内部结算没有公开资料。参考大型互联网公司的常见做法,更可能按 GPU/NPU 时、预留容量、Token、服务优先级和峰值保障进行内部成本分摊,而不是直接照搬外部零售价。该判断属于同行类比,不是美团确认信息。
11. 可以安全对外复述的口径
- 美团公开确认的是“五万卡国产算力集群”和“AI ASIC superpods”,没有公开芯片厂商和型号。
- 950PR 是 Prefill/推荐芯片,不是华为路线图里的主训练芯片;950DT 才面向训练,但在 LongCat-2.0 发布时尚未上市。
- 开源 NPU 代码明确支持 Atlas A2/910B,因此“910B/A2 为主”是目前最强的技术推断,但仍不是官方确认。
- 5 万卡是逻辑统一训练集群的峰值任务规模,不应理解成多年采购累加;物理上可能由多个 SuperPod 组成。
- 摩尔线程和沐曦已完成推理适配,尚无公开证据证明参与 5 万卡预训练。
- 后训练在国产算力集群完成;训练、后训练、推理是否完全使用同一批卡,没有披露。
- LongCat 借鉴了 DeepSeek DSA 的公开架构思路,但国产训练 Infra 从 2023 年起独立建设。
- 权重与推理栈开放较完整,训练数据、训练框架和 5 万卡生产 Infra 没有开源。
- 内外部 Token 量和内部结算未披露;外部 API 已开始低价计费,商业化重点明显偏向开发者生态和 Agent Coding。
12. 尚待内部人士确认的问题清单
如果能够接触 LongCat Infra、采购或芯片适配工程师,最有信息增量的问题是:
- 2024 年 7 月交付的 16,000 卡集群具体是什么型号?最终 5 万卡是否来自同一代产品?
- 5 万卡 full run 的 world size 峰值、平均有效卡数和稳定运行天数分别是多少?
- 物理上跨了多少 SuperPod、机房或网络域,是否跨园区?
- 预训练、长上下文中训、SFT、RL、MOPD 分别使用什么卡型和规模?
- 单次作业内是否允许 910B/910C 异构,还是通过资源池隔离?
- 与供应商周会中最频繁的前三类问题是什么?哪些进入了 CANN、驱动或固件版本?
- 摩尔线程、沐曦是否在开源前参与过内部精度或性能 POC?是否获得过训练订单?
- 5 万卡是自有资产、云上长期容量还是联合建设?折旧和电力成本如何归集?
- LongCat 内部 Token 日均量、外部 API 日均量、峰值并发和成本回收率是多少?
- 下一代模型计划主要依赖 910C、950DT、其他国产 GPU,还是继续扩大 A2 存量集群?
参考来源
- 美团:LongCat-2.0 发布公告
- 美团技术团队:LongCat-2.0 全流程国产训推
- 美团技术团队:正式开源及国产卡推理代码
- LongCat-2.0 Hugging Face 模型卡
- LongCat-2.0 GitHub
- SGLang-FluentLLM NPU / Atlas A2 部署样例
- 华为:Ascend 950 芯片与 SuperPoD 路线图
- 智东西:5 万卡项目亲历者与工程时间线
- 财新:华为昇腾、摩尔线程、沐曦完成推理适配
- 沐曦:曦云 C 系列 Day-0 适配 LongCat-2.0
- IT之家:摩尔线程 MTT S5000 推理适配
- LongCat API 定价
- LongCat Token 资源包规则
- LongCat API 更新日志
- 美团 2025 年年报
- DeepSeek-V4 官方模型说明
- DeepSeek-V4 官方发布说明
- 智谱 GLM-5 官方发布说明
- 智谱 GLM-5 技术报告与国产推理适配
- CNA/AFP:美团未披露芯片厂商及国产芯片投资
口径说明:本报告严格区分官方确认、媒体采访和技术推断。涉及具体芯片型号、卡型分布、内部 Token、采购计划及供应商人力投入的部分,如无公开一手材料,均不作为确定事实。仅供研究,非投资建议。
没有匹配的内容。