搜索历史
热门标签

国产GPU的战事,进入“十万卡集群”

光锥智能
2026-09-12 18:32

回头望去,“轻舟已过万重山”。

文|刘俊宏

编|王一粟

2025年,国产GPU跟着DeepSeek一体机一起出道。那是国产GPU第一次被普通人看见的时刻。

在那一年,大家普遍以为国产GPU的定位在端侧、在推理、在帮企业摊薄成本。能用了,这是当时的全部结论,也是当时的天花板。

但现在,国产GPU的生态位已经彻底变了。

202699日,在2026京东全球科技探索者大会上,京东云宣布拟建设十万卡全功能GPU集群,打造超大规模国产智算基础设施。该集群以摩尔线程全功能GPU为算力底座,聚焦大模型训练、推理及具身智能等关键领域,向全行业开放算力。

这标志着国产GPU首次进入头部AI云企业十万卡级核心智算集群,国产智算从可用走向规模化商用

过去,国产GPU的合作往往打着试点或适配的旗号。而这一次,十万卡级别的核心集群,说明京东把未来算力底座的关键一席,交给了摩尔线程。

从一体机到十万卡,国产GPU仅仅用了不到两年的时间。这背后,是行业玩家共同走过的一段极不平凡的旅途。

曾经,为了落地这一目标,行业玩家可以说是想尽了办法:一体机、强调单点参数、推理侧应用、集成交付……

这些方式大多针对特定需求、拼成本做差异化,走的是与国际主流计算卡曲线竞争的路子。从某种角度上说,过去的国产GPU可能从未真正进入AI大模型应用的正面战场。

但这一次,摩尔线程与京东的合作,正在改变所有人对国产GPU的印象。

能应用于训练,说明国产GPU摆脱了推理侧降本的定位,开始支撑AI大模型的智能上限;成为互联网科技巨头公司算力底座,说明国产GPU的买家结构正在变化,产品和ROI开始经得起资本测算。此外,还有一点同样重要——摩尔线程将支撑京东的具身智能战略,这意味着国产GPU有能力进入比大语言模型更广阔的物理AI领域,那是一片更大的市场。

或许,摩尔线程这次的合作,标志着国产GPU的一个新起点。

京东为什么选择摩尔线程?

2026年,算力是全球最紧俏的硬通货

全球头部科技公司把加速卡和数据中心写成资本开支,已经是每个财报季的固定动作。为了争抢有限的计算卡,有的公司已经开始用大规模融资去扩机房、抢交付窗口。

虽然科技公司们求卡若渴,但买算力这件事,科技公司没有什么情怀可言。

既然买卡是资本开支,买单的逻辑就非常明确。科技公司最关心的无非就是三件事:稳不稳定,能不能接入现有IT体系,投资回报能不能向投资者讲清楚。

其中,互联网厂商由于采购规模大、应用场景丰富、对产品性能和软件生态要求更高的特征,是行业公认最具代表性的客户群体。

这次跟摩尔线程合作的京东,恰好就是这种买方里的极端样本。

从公司业务层面看,京东有零售、物流、仓储的现成业务,算力需要支撑模型回到仓库和运配里干活;使用AI的战略主线是多元的物理AI,而不是单一的大语言模型。另一边,京东的投入逻辑也很清晰,走的是基础设施路线——先建算力底座,再谈模型与场景,是典型的长期且大量的资源投入计划。

更关键的是,京东还很懂国产算力。

过去一年,京东已与摩尔线程等厂商合作打造了国产万卡集群;今年7WAIC期间,京东集团技术委员会主席、京东云总裁曹鹏还曾公开表示,京东云正携手摩尔线程推进JoyAI大模型联合攻坚,让国产算力不仅能跑好模型,更能跑好业务’”。所以这次的十万卡合作,不是一次性的豪赌,而是把已经验证过的路线再往上推一档。

从互联网科技公司的特性看,如果一家算力卡厂商能进入大规模采购环节,更大的意义在于尽调,而不是某种试点性质的站台。

所以判断国产GPU走到了哪一步,与其看谁又发布了一张推理卡,不如看谁进了头部云的核心集群。

京东为什么会选择摩尔线程?回到本次合作来看,内容分为三层。

在训练侧,将围绕芯片、云平台到模型训练进行全栈协同,联合打造JoyAI全系大模型。这代表着国芯训国模已经进入大规模产业化阶段。

在推理侧,双方将深度优化夸娥智算集群与xLLM推理平台,为企业提供极致性价比的推理服务。这代表着国产GPU即将体现出ROI优势。

在具身智能侧,是以全功能GPU赋能京东全链路具身服务,加速模型训练、仿真与高质量数据生成,构建数据训练仿真部署的完整闭环。这代表着摩尔线程已打通了具身智能从合成数据生成、大模型训练、仿真验证到端侧硬件部署的完整链路。

对于这次合作,曹鹏总结说:我们正全面推进物理AI战略落地,高性能、高可靠的国产算力是核心支撑。选择与摩尔线程深度合作,正是看重其在国产训练级GPU上的稀缺能力和大规模集群的成熟交付经验。此次合作,是京东云AI战略布局的重要一步,也是我们拥抱国产智算生态的重要起点。

当然,从官宣到真正落地还需要时间验证,但京东的信任已经给出。接下来,要看摩尔线程如何证明自己值得这份托付。

摩尔线程的万卡集群 如何闯京东的“五道关”?

从公司画像看到,京东的需求非常明确。

分别是要训练级能力,不只是推理;要全功能,因为AI负载要能支持物理世界的业务;要十万卡级可交付;要长期稳定;还要迁得进现有IT体系。

这五个要求里,训练是最难的一道。

如果只是用于推理应用,那相对容易许多。因为推理负载相对独立,单卡不够可以用数量去补。但训练不行,它要求成千上万张卡在同一张网络里同构运转,高速互联,精度收敛一致,任何一环掉链子,损失的是整个集群的时间。

所以,在训练领域被刷掉的卡从来不是跑分不够的,而是中途退场的。这个领域真正的考验方式是看有效训练时长,就是刨去故障和中断,时间还剩多少真的花在了训练上。

对于这部分需求,摩尔线程早就证明了自己。

据了解,摩尔线程的夸娥万卡级智算集群已成功部署并上线服务,多项关键指标达到国际主流水平。具体参数层面,浮点运算能力达10 Exa-Flops,训练算力利用率(MFU)在Dense大模型上达60%MoE大模型上达40%,有效训练时长占比超90%,训练线性扩展效率达95%。而且,集群支持断点续训,训练精度与国际主流计算卡持平,训练损失曲线高度一致。简单来说,就是集群不仅强,而且可靠。

值得一提的是,作为集群底座的MTT S5000,是摩尔线程第四代MUSA架构平湖打造的训推一体智算卡,支持当下AI大模型训练的FP8FP64全精度。目前,这款卡已经实现持续规模化量产,也首批拿到了国家《安全可靠测评》。这意味着,无论是从数据指标、量产能力、AI支持能力还是国家背书层面,摩尔线程基本上已经把该拿的奖拿满了

数据指标之外,更有说服力的是经验。据公司披露,基于MTT S5000构建的集群已实现规模化销售,在北京、无锡、杭州等多地完成部署与交付。

如果说,技术和经验只能证明实力,那么供应稳定需要公司能保证产品落地的可持续性。

因为十万卡集群的建设周期通常以年计。采购方必须要能确认供应商在三五年内不仅能持续供货,而且还要能稳坐行业牌桌

在这一层面,摩尔线程做的相当扎实。

首先是技术研发层面,成立近六年,摩尔线程量产了五颗芯片,推出苏堤、春晓、曲院、平湖、花港五代GPU架构,约一年一代。这种迭代速度,显示出摩尔线程对研发从不吝啬。据统计,公司自2022年以来累计研发投入近59亿元。

这种研发投入水平,会不会是摩尔线程只重视研发而不重视商业化?

在今年上半年业绩说明会上,就有投资者问过这个问题。摩尔线程联合创始人、职工董事周苑解释说,底层架构研发的长期投入和短期商业化交付从来不是“”二选一的问题。因为只有把底座做得足够扎实、可复用、可扩展,研发投入才能沉淀为更短交付周期、更低边际成本和更高客户粘性的长期复利。

翻译过来,就是摩尔线程选择把MUSA统一架构和软件栈这套底座做扎实,后续产品都能基于同一底座快速长出来。这样客户和开发者的软件资产也能跨代复用、平滑迁移,攒下来的长期复利自然越来越厚,公司只会越跑越快。

经营业绩,是这一观点最好的佐证。

财务数据显示,摩尔线程当下正处于高速增长期。2026年上半年,摩尔线程营收17.36亿元,同比增长147.42%,已超过2025年全年;毛利总额9.89亿元,同比增长103.78%;归母净亏损同比收窄95.73%。摩尔线程在保持高速增长的同时,可能即将抵达盈利临界点。

针对接下来的营收预期,可以从订单层面验证。在今年3月,摩尔线程曾披露过一笔总价款6.6亿元的夸娥智算集群合同。根据行业人士分析,这一项目规模极有可能为万卡级别。

单靠经营业绩高增长,可能证明不了十万卡一定能建成,但万卡交付能持续形成订单,这能直接说明摩尔线程的规模化能力。

而这种能力,能做到的厂商不多。据公司业绩说明会口径,国内目前实现万卡级大模型训练集群落地、并完成超大参数模型完整训练验证的厂商只有两家,摩尔线程是其中之一——另一家是华为。

最后,迁移是京东提出的最后一道关卡,看似最不起眼,却往往决定成败。

任何一家科技公司已有的模型和工作负载,都不可能为一张新卡重写一遍。迁移成本很大程度上影响客户战略落地的进度。

今年7WAIC期间,摩尔线程创始人、董事长兼首席执行官张建中曾谈到过一个行业心结:我经常听到国内的模型公司担心,用国产的训练平台会不会耽误时间,会不会影响追赶世界先进水平?他给出的回答是,摩尔线程随时可以给用户提供本地化服务,这肯定比国外公司做得更好

底气从何而来?在MUSA软件栈。

摩尔线程的MUSA软件栈采取的是自主发展兼容国际主流双线并行的策略。具体来说是100%核心数学库兼容,全量3000多个PyTorch算子兼容,覆盖55类核心AI算子。简单来说就对,开发者迁移的学习成本被压到了最低。在AI模型层面,摩尔线程还获得vLLMSGLang两大推理框架官方支持,主流模型可实现Day-0支持。在生态建设层面,目前开发者数量已突破80万,这显示出生态也初步成型。

到这里,京东给摩尔线程提出的五道关里的四道都有了答案。但还有一个问题悬着。

京东的负载长在仓库和机器人身上,它为什么需要一张全功能GPU,而不是一张更便宜、更专精的训练卡?

做全功能GPU摩尔线程的物理AI时代

事实上,选通用芯片还是专用芯片是AI行业老生常谈的争执了。只是从结果上来说,专用路线一直比通用路线矮一头

为什么会这样?明明专用芯片有相当多的优势,例如便宜、效率高、能原生适配模型,还能按需求强化设计。

这是因为,上述这些优点建立在一个共同前提之上——模型的形态已经成熟定型。而现在的AI大模型,还远远没有摸到上限。

以语言模型跟物理AI所需的模型为例。语言模型处理的本质是词元序列,计算相对可控。但要实现物理AI,模型要处理的是空间、接触、视觉、动作和物理约束。需求宽了不止一个维度,连带着算力的形态就得跟着变。

在模型仍在高速进化的阶段,什么都能做,恰恰是通用GPU最大的优势。

这对应着物理AI领域,开发者们一个真实的痛点。物理仿真用专用物理引擎,图形渲染用图形显卡,AI训练用专用AI芯片,三者相互割裂,开发者不得不在三个异构平台之间反复切换,研发效率极低。想用国产算力解决,但大多数厂商走的是强调专业化的路线,例如一些玩家强调做AI计算,在单一环节做出差异化。

诚然,走这条路线可以在自己的赛道里很强,但终究托不住物理AI的完整问题。

语言模型时代,一张擅长矩阵运算的卡可以走很远。但是在物理AI时代,云上训练、仿真验证、端侧部署必须同一套架构语言。所以摩尔线程选了那条更难、但上限更高的路——全功能GPU

据了解,摩尔线程全功能GPU基于自主研发的MUSA架构,率先实现了单芯片同时支持AI计算加速、图形渲染、物理仿真和科学计算、超高清视频编解码的技术突破,是国内稀缺的算、渲、仿一体化通用算力底座,也是极少数原生支持从FP8FP64全计算精度的国产GPU厂商。

BPoWCGK3MXp3tAp5NyREm0ZTbErJ3Vf4Z8j0687AgqSb8vQSJ1hMOaqIK3Hys%2F640%3Fwx_fmt%3Dpng%26from%3Dappmsg%26tp%3Dwxpic%26wxfrom%3D5%26wx_lazy%3D1%23imgIndex%3D4" title="双击查看原图" />

这条路线值不值?可能暂时还不好说。但选择这条路线,是公司层面的一次差异化表达。

摩尔线程联合创始人、董事、副总经理张钰勃说:在物理AI与具身智能领域,摩尔线程是目前国内唯一依托全功能GPU,打通合成数据生成大模型训练仿真验证端侧硬件部署完整链路的算力厂商。具身智能需要AI计算、物理仿真、图形渲染和端侧推理协同,体现了全功能GPU的差异化优势。

同时,为了让物理AI能在硬件上跑起来,摩尔线程还给出了一套软件栈。

例如全栈具身智能仿真平台MT Lambda,能让渲染、物理、AI三类负载在同一颗GPU内完成,数据零拷贝MT Lambda for Factory能面向工业领域应用。在仿真环节,摩尔线程开源了具身智能领域首个基于MUSA架构的GPU加速物理仿真后端MuJoCo Warp MUSA,并完成四足机器狗与两足人形机器人的Sim2Real真机验证。同时,摩尔线程还在无锡设立工业具身智能创新中心,与首批16家生态伙伴共建。可以说,在物理AI应用的不少环节,摩尔线程都有对应的产品或平台在跑。

结合摩尔线程与京东的合作,也能再一次确认全功能GPU的价值。双方合作的三条产线里,推理侧的性价比优化和具身侧的闭环构建,都直接调用图形与仿真能力。这种需求,一张只能做AI训练的卡可接不住。

也只有选择全功能GPU,京东才能真正展开自己在物理AI领域的战略。今年4月,京东发布了行业首个覆盖采、存、标、训、评、仿、测全链路的具身智能数据基础设施,发动最多60万人、计划两年积累1000万小时人类真实场景视频数据。

两边合作,一个有场景和数据,一个有全功能算力,双方的合作是各自长板的对接。

放眼本次合作之外,摩尔线程还在将全功能GPU的道路从云端往外铺到边缘和端侧。

在云端,有智算卡S5000与训推一体机SGX5000,以及面向更高密度部署的超节点架构——公司已与中国移动研究院、之江实验室等伙伴发布OISA高密超节点参考设计;边缘侧有搭载自研智能SoC“长江MTT E300;终端有AI算力本AIBOOK和家庭AI中枢AICUBE;甚至还做着消费级与专业图形——国内首款支持Windows操作系统及DirectX 11/12的游戏显卡MTT S80/S70就出自这家公司。

张建中在WAIC 2026上把这套布局概括为三大“AI工厂”——模型训练工厂、词元生产工厂、智能体生产工厂。这些布局,背后每一层都是一片正在打开的市场。

结语

摩尔线程的这次合作,一定程度上改写了国产GPU的坐标。

对摩尔线程,这是国产GPU首次进入头部AI云企业十万卡级核心智算集群,技术与交付被一家独立买方验算。但对行业来说,摩尔线程打开了一道门。

过去中国AI的故事里,强的是模型,弱的是底座。但这次,全球的AI竞争中,国产GPU也有了固定座位。

光锥智能
光锥智能
文章 403 
浏览 84308 

相关资讯

更多 »