
摩尔线程为什么提出「三大AI工厂」?|WAIC 2026
Quick Answer
Moore Threads' CEO Zhang Jianzhong introduced the concept of 'Three AI Factories' at WAIC 2026, focusing on model training, token production, and agent manufacturing, emphasizing the need for a unified infrastructure to support continuous AI development.
Quick Take
The approach aims to enhance AI capabilities and reduce costs, with significant implications for the industry as it transitions from model training to practical applications.
Key Points
- Three AI Factories: model training, token production, and agent manufacturing.
- Moore Threads' GPU cluster effectively trained a 236B MoE model with over 90% efficiency.
- Token production aims to reduce costs as AI usage shifts from humans to agents.
- Unified GPU architecture supports all three factories, enhancing adaptability to future AI models.
- requires higher computational power for real-world understanding compared to language models.
📖 Reader Mode
~3 min read进入Agent时代,产业竞争正在出现新的变化:AI不再只是一个需要被训练的模型,而正在变成一种需要被持续生产、调用和部署的智能能力。
在2026世界人工智能大会(WAIC)期间,摩尔线程创始人、董事长兼CEO张建中提出“三大AI工厂”的概念——模型训练工厂、词元(Token)生产工厂和智能体生产工厂。

摩尔线程创始人、董事长兼CEO张建中
在摩尔线程的定义中,三大工厂分别对应模型训练、Token生成和智能体生产,覆盖从基础模型研发到产业应用、从云端基础设施到终端设备的完整链路。

中国工程院院士、清华大学教授郑纬民在演讲中指出,算力基建的关键在于将每一份算力转化为高质量词元,三大“AI工厂”是算力基础设施的必然演进。在国家信息中心大数据发展部副主任魏颖看来,算力基础设施是词元生产的物理底座,作为算力核心的GPU决定了生产效率与成本。
但这三个“工厂”并不是三个割裂的业务方向。摩尔线程高级副总裁董龙飞表示,三个工厂代表的是不同市场,并不存在简单的优先级关系。但从产业竞争角度看,模型训练仍然是整个体系的基础。
“产业人工智能的竞争最重要的就在于这个模型是不是聪明。”董龙飞表示,模型能力依靠预训练和后训练获得,而不是推理阶段。
如果把AI比作一个企业,模型就像企业里的员工,首先需要具备足够高的认知能力,之后才谈得上执行任务。
这也成为摩尔线程布局三大工厂背后的核心逻辑:未来AI竞争不只是制造模型,而是建立一套持续生产智能的基础设施。
模型训练工厂,决定AI能力上限
过去,大模型主要围绕语言能力展开;如今行业中的模型已经呈现高度多样化趋势,包括混合专家模型、多模态模型、机器人具身大脑模型以及世界模型等。
训练这些模型,并不是简单的矩阵计算,而需要更复杂的软件、仿真和计算能力。
这也是摩尔线程强调国产“全功能GPU”的原因。在训练场景中,GPU需要同时满足算力、显存、带宽、可靠性、软件生态以及训练结果一致性等要求。
其中,训练结果一致性是国产GPU进入大规模训练场景的重要门槛。
董龙飞解释,所谓训练中的“高精度”,并不是单纯指计算精度,而是不同GPU平台之间训练结果的对齐能力。对于已经投入大量资源完成模型训练的用户来说,迁移到新的GPU平台后,能否获得稳定、可比的训练结果,是平台能否被采用的重要因素。

围绕模型训练工厂,摩尔线程展示了多项国产算力实践。

万卡规模MoE-236B基础模型训练是此次展示的重点,该项目依托国产万卡GPU集群完成从零开始的完整训练,在万卡规模下有效训练时长占比超过90%,模型精度和训练损失曲线与国际主流计算卡高度一致。
与此同时,北京大学EvoPhys团队的5D世界模型EvoPhys-World,也基于摩尔线程MTT S5000夸娥智算集群完成全栈原生训练,并在WorldScore“世界生成”维度连续37天排名第一。

京东云总裁曹鹏在摩尔线程举办的“词元时代 万物智能论坛”论坛上表示,当前AI基础设施正在发生变化,全国产算力、国产模型和国产推理引擎组成的体系正在逐渐建立。京东正在基于摩尔线程国产算力进行模型训练、适配和调优。
对于摩尔线程而言,模型训练工厂不仅意味着训练更大的模型,也意味着国产算力开始进入AI原创能力生产环节。
词元生产工厂,让模型能力规模化释放
如果模型训练工厂解决的是“如何制造更聪明的模型”,那么词元生产工厂解决的是“如何让更多人低成本使用智能”。
随着Agent兴起,AI使用方式正在改变。过去,人向模型提出问题;未来,大量Agent会主动调用模型完成任务。
张建中认为,Token消耗快速增长的根本原因,是未来不是人在使用AI,而是Agent在使用大模型。
因此,AI基础设施竞争正在从单纯关注训练性能,转向如何降低每一个Token背后的成本。
在这一方向,摩尔线程强调模型快速适配、推理优化以及异构算力协同能力。

目前,摩尔线程推理套件已经适配DeepSeek、MiniMax、GLM、Kimi、Qwen等主流模型,并推出基于MTT S5000的PD分离异构推理方案。
产业伙伴也正在验证Token生产工厂的商业价值。
趋境科技创始人兼CEO艾智远表示,目前趋境科技每天能够供应万亿级高品质Token,并与摩尔线程合作,通过国产GPU与国际主流GPU异构协同,提高Token生产能力。

Token工厂覆盖的是最大规模的用户市场。
过去,一个模型推理可能只需要一张卡或者一台服务器,但未来Token生产将成为复杂系统工程,需要考虑模型规模、缓存管理、调度效率以及成本控制。
这也是摩尔线程布局推理产品和方案的重要原因。
董龙飞表示,训练和推理都很重要。训练更强调通用性和综合能力,而推理更强调极致性价比,需要针对不同任务设计不同产品和解决方案。
智能体生产工厂,AI开始进入现实世界
如果说Token工厂让AI具备输出能力,那么智能体生产工厂则让AI进一步具备行动能力。
张建中认为,Agentic AI之后的重要方向是物理AI,未来AI需要从数字世界走向现实世界。
摩尔线程认为,Token工厂解决的是“会说”,智能体工厂解决的是“会做”。
董龙飞表示,Token生成之后,还需要让AI调用工具。在电脑中,这意味着Agent能够操作软件和系统;在机器人领域,则意味着智能

但相比语言模型,物理智能对算力提出了更高要求。
摩尔线程生态副总裁兼生态科研部总经理吕其恒表示,大语言模型处理的是符号,而具身智能需要理解真实世界中的物理规律,因此需要同时处理视觉、渲染、仿真等任务。这也是世界模型成为具身智能关键方向的原因。
极佳视界合伙人兼副总裁毛继明表示,物理AGI面临的重要挑战之一,是如何提升数据使用效率。数字AGI主要依赖语言数据,而物理AGI需要处理真实世界数据,因此需要更高效的数据和算力体系。
基于这一方向,极佳视界与摩尔线程联合开展驾驶模型、具身模型等物理AI模型训练优化,探索国产芯片训练国产模型的完整链路。
三大AI工厂背后,是一套统一算力体系
从模型训练,到Token生产,再到智能体应用,三大工厂覆盖了AI产业从基础能力到应用落地的完整过程。
但三座工厂并不是三套技术体系。董龙飞表示,摩尔线程三个工厂共享统一的GPU架构和MUSA软件体系,并不是针对不同市场分别开发不同技术。
这也是国产全功能GPU的核心竞争力。

在AI快速变化阶段,最大的挑战并不是某一个固定模型的性能,而是未来模型形态的不确定性。
今天行业关注大语言模型,未来可能是世界模型、机器人模型、更多垂直领域模型。如果GPU过于专用,就很难适应产业变化。
董龙飞认为,GPU首先需要具备通用性,因为未来模型路线仍然会持续变化。
因此,摩尔线程提出“三大工厂”,并不是简单扩展业务边界,而是在回答一个更大的问题:当AI从模型时代进入智能生产时代,下一代基础设施应该是什么?雷峰网(公众号:雷峰网)
雷峰网原创文章,未经授权禁止转载。详情见转载须知。
— Originally published at leiphone.com
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from 雷峰网芯片
See more →隼瞻创始人曾轶:AI推倒芯片设计壁垒,我们要做半导体行业的「Copilot」
Zeng Yi, founder of Sunzhan, emphasizes that AI is reshaping chip architecture, enabling RISC-V's rise as companies like Qualcomm and Google adopt customizable AI processors. He believes RISC-V's flexibility and open-source nature will drive its adoption in the semiconductor industry, particularly in AI applications.

