WAIC 2026 | 面壁智能首个具身智能成果 MiniCPM-Robot 系列模型正式发布!
Quick Answer
On July 19, Mianbi Intelligence unveiled the MiniCPM-Robot series, including the MiniCPM-RobotManip and MiniCPM-RobotTrack models, at WAIC 2026.
Quick Take
The former boasts 1.5B parameters with superior context memory and performance, while the latter is the first local deployment tracking model, achieving 5+ Hz response rates without internet connectivity.
Key Points
- MiniCPM-RobotManip achieves top-tier VLA performance with 1.5B parameters.
- MiniCPM-RobotTrack supports local deployment with 5+ Hz tracking rates.
- Both models are open-sourced, available on GitHub and Hugging Face.
- MiniCPM-RobotManip reduces inference costs significantly while maintaining context memory.
- PhyAI framework enhances inference speed, achieving up to 36.77 Hz on NVIDIA H20.
📖 Reader Mode
~3 min read
7 月 19 日上午,面壁智能主办的「智在终端 惠及千行」分论坛在世界人工智能大会上圆满举行。论坛上,面壁智能联合 OpenBMB 正式发布并开源了其首个具身智能技术成果 MiniCPM-Robot 系列模型,「小钢炮」正式进军机器人领域!
本次发布的 MiniCPM-Robot 系列成果包括两个具身智能模型:通用 VLA 模型 MiniCPM-RobotManip,与面向移动机器人跟踪导航的 MiniCPM-RobotTrack。
MiniCPM-RobotManip 基于面壁智能最新多模态端侧模型 MiniCPM-V 4.6 训练完成,延续了 MiniCPM-V 4.6 「小尺寸、高性能」与视觉 Token 极致压缩的技术优势,以仅 1.5B 的参数规模实现 比肩体量更大的3-4B模型的性能、但流式实时推理计算成本减半,模型支持 1 分钟的具身原生记忆,从而能够高效完成考验上下文记忆的操作任务。
MiniCPM-RobotTrack 由面壁智能和南京大学合作研发,是 业内首个支持真实本地断网部署的跟踪(Tracking)模型,首次实现纯视觉的本地自主指令追踪。模型原生适配宇树 Go2 Edu ,仅依靠原装摄像头和本地算力即可完成单目标、动态多目标及模糊目标跟踪,稳定达到 5+ Hz,端到端响应时延约 180 毫秒,并构建了自进化数据管线、能够持续提升复杂动态环境下的跟踪能力。
目前,MiniCPM-Robot 系列模型均已开源,欢迎开发者与具身智能从业者下载部署并试用:
➤ Github
? https://github.com/OpenBMB/MiniCPM-Robot
➤ Hugging Face
? https://huggingface.co/openbmb/MiniCPM-RobotManip
? https://huggingface.co/openbmb/MiniCPM-RobotTrack

通用 VLA
MiniCPM-RobotManip
MiniCPM-RobotManip 是一款面向机器人操作的 1.5B 通用 VLA 模型,保留了面壁智能多模态基础模型 MiniCPM-V 4.6 的通用理解能力,并基于多任务进行统一训练,让同一模型学习处理不同指令和操作任务。
根据主流 VLA 基准测试,MiniCPM-RobotManip 的综合性能位列 VLA 模型的第一梯队,与 Qwen-VLA、π0.5 等主流模型的性能相近、甚至有更出色的表现。

尤其是在考验 VLA 模型上下文记忆的 RMBench 上,MiniCPM-RobotManip 更是明显超越多个主流模型——MiniCPM-RobotManip 得分 53,而主流的π0.5只有10分,接近随机的水平。如下图,模型可以先盖住不同颜色方块后 ,以红绿蓝顺序揭开,体现其原生上下文能力,当前主流基于单帧反应式的VLA是做不到的。
MiniCPM-RobotManip 将 MiniCPM-V 4.6 的视觉 Token 高效压缩优势进一步应用于机器人场景,大幅降低了机器人的视觉输入计算量与推理时延,使机器人在保留1分钟上下文记忆后的推理成本与传统单帧反应式的推理成本相当——换言之,模型性能更优、部署成本却更低。
根据测试,在包含 60 帧历史观测 的机器人操作任务中,传统重新计算方式每个决策步需要 125 TFLOPs,采用流式推理后仅需 3.3 TFLOPs,低于 π0.5 在无历史帧输入下的 5.0 TFLOPs。在 H100、BF16 精度下,MiniCPM-RobotManip 单决策步推理时延为 120ms,相比 π0.5 的 234ms 降低近一半,实现了上下文记忆与响应效率的兼顾。



首个本地断网部署跟踪模型
MiniCPM-RobotTrack
MiniCPM-RobotTrack 是一款 0.9B 端到端视觉指令跟踪模型,具有以下三个技术优势:
01 三项跟踪任务领跑开源 SOTA
我们从单目标跟踪(STT)、动态多目标跟踪(DT)和模糊目标跟踪(AT)三类典型场景维度对 MiniCPM-RobotTrack 进行了评测。
在仅有 0.9B 参数且未进行下游强化学习优化的情况下,MiniCPM-RobotTrack 在三项任务中的追踪率分别达到 89.8、73.4 和 80.4,取得开源方案最优结果,相比 OmTrackVLA 分别提升 7.0、14.6 和 6.5 个百分点。
在相同的单视角、纯 SFT(监督微调训练)设定下,与其他闭源模型 TrackVLA++ 相比,MiniCPM-RobotTrack 在单目标跟踪和模糊目标跟踪任务上的追踪率分别提升 8.8 和 17.0 个百分点,模糊目标跟踪任务的成功率达到 58.0%。这表明,通过高质量数据和端到端训练,轻量级模型无需依赖多视角输入或下游 RL,也能获得具有竞争力的真实场景指令追踪能力。

02 自进化数据管线,让模型在实践中越用越强
针对真机数据采集成本高、长尾场景覆盖有限等问题,MiniCPM-RobotTrack 构建了自进化数据管线,先通过自动检测与人工复核清洗异常轨迹、错误动作等低质量数据,再引入面向具身追踪的 DAgger 策略,让模型在仿真与真机交互中主动暴露薄弱环节,针对快速转向、短时遮挡、多人交叉等复杂场景持续补充高价值样本,在数据闭环中提升跟踪与泛化能力。
03 真机实测 5+ Hz,断网也能自主跟踪
经过对宇树 Unitree Go2 完整运行链路的系统性优化,MiniCPM-RobotTrack 模型在机器狗原生本地算力下稳定达到 5+ Hz,端到端响应时延约 180 毫秒。
在真机 Demo 中,即使现场拔掉网卡,机器狗仍能依靠本地视觉画面与文本指令持续完成目标识别、跟踪与运动控制。该能力可应用于楼宇巡检、人员陪护和园区安防,未来有望拓展至灾害救援、特种作业等弱网、断网或强干扰场景。
本次开源还将提供完整部署流程与一键启动脚本,覆盖模型加载、摄像头接入、文本指令输入和机器人控制接口,真正实现纯本地部署、开箱即用。

具身智能推理框架
PhyAI
此次发布的两款模型均获得了 PhyAI 的推理支持。
PhyAI 是一款面向 Physical AI 的开源推理框架,专为端侧极速推理与云端 RL 大规模 Rollout 场景设计。与模型官方仓库相比,PhyAI 在 NVIDIA GeForce RTX 5090 上运行 π0、π0.5 和 GR00T 时,分别实现了约 2.85 倍、1.82 倍和 2.28 倍加速;GR00T 在 NVIDIA Thor 和 A40 上也分别实现约 1.40 倍和 4.31 倍加速。面对 VLA、WAM 等模型结构快速演进、架构差异显著的现状,PhyAI 将易用性与灵活性置于首位,致力于降低模型从研究原型走向高效推理的适配成本。
通过简洁的 API,PhyAI 在发布首日即完成了对 MiniCPMRobot 的适配支持,并使用 CUDA Graph 进行加速,推理帧率从 10.12 Hz 提升至 33.28 Hz,同时还采取了算子融合的方法,使用triton编写了RMSNorm+SiLU gate、conv1d+SiLU+QKV split等为 MiniCPMRobot 定制的融合算子,减少中间变量的搬运次数,将其在 NVIDIA H20 上的推理帧率进一步提升至 36.77 Hz。

让端侧 AI 走进千行万业
在推进开源技术的同时,我们也在与产业伙伴共同探索真实场景应用。
目前,面壁智能已经与乐聚机器人合作推出展厅导览和园区巡检 Agent 解决方案,并与吉利汽车围绕 VLA 模型、生产仓储应用等方向展开合作,推动具身智能技术在实际环境中持续验证和迭代。
对面壁智能而言,探索物理 AGI 与长期追寻的 AGI 目标一脉相承。随着机器人逐步进入家庭、办公和工厂,本地感知、推理与决策将成为保障实时性、稳定性和数据隐私的重要方向。
未来,我们将继续投入具身领域,坚持通过开源与产业合作推动模型在真实场景中持续验证,让物理智能更加可靠、安全地走进现实世界。
➤ 欢迎加入 OpenBMB 社区:

— Originally published at m.leiphone.com
Want this in your inbox every morning?
Daily brief at your local 8am — bilingual EN/中文, free.
More from WebSearch (Tavily)
See more →全球AI芯片峰会,9月上海见!
The 2026 Global AI Chip Summit will take place in Shanghai on September 22-23, focusing on the evolving AI chip landscape, including the shift from training to inference, the rise of diverse chip technologies, and the restructuring of industry competition. Notable speakers include experts from leading universities and companies, discussing advancements in AI chip architecture and applications.