ABB202607
关注中国自动化产业发展的先行者!
人工智能+制造融合创新研讨会
2026中国自动化产业年会
2025工业安全大会
OICT公益讲堂
当前位置:首页 >> 资讯 >> 行业资讯

资讯频道

WAIC 2026 | 面壁智能首个具身智能成果 MiniCPM-Robot 系列模型正式发布!
  • 点击数:388     发布时间:2026-07-20 21:11:09
7 月 19 日上午,面壁智能主办的「智在终端 惠及千行」分论坛在世界人工智能大会上圆满举行。论坛上,面壁智能联合 OpenBMB 正式发布并开源了其首个具身智能技术成果 MiniCPM-Robot 系列模型,「小钢炮」正式进军机器人领域!
关键词:

7 月 19 日上午,面壁智能主办的「智在终端 惠及千行」分论坛在世界人工智能大会上圆满举行。论坛上,面壁智能联合 OpenBMB 正式发布并开源了其首个具身智能技术成果 MiniCPM-Robot 系列模型,「小钢炮」正式进军机器人领域!

本次发布的 MiniCPM-Robot 系列成果包括两个具身智能模型:通用 VLA 模型 MiniCPM-RobotManip,与面向移动机器人跟踪导航的 MiniCPM-RobotTrack

MiniCPM-RobotManip 基于面壁智能最新多模态端侧模型 MiniCPM-V 4.6 训练完成,延续了 MiniCPM-V 4.6 「小尺寸、高性能」与视觉 Token 极致压缩的技术优势,以仅 1.5B 的参数规模实现 比肩体量更大的3-4B模型的性能、但流式实时推理计算成本减半,模型支持 1 分钟的具身原生记忆,从而能够高效完成考验上下文记忆的操作任务。

MiniCPM-RobotTrack 由面壁智能和南京大学合作研发,是 业内首个支持真实本地断网部署的跟踪(Tracking)模型,首次实现纯视觉的本地自主指令追踪。模型原生适配宇树 Go2 Edu ,仅依靠原装摄像头和本地算力即可完成单目标、动态多目标及模糊目标跟踪,稳定达到 5+ Hz,端到端响应时延约 180 毫秒,并构建了自进化数据管线、能够持续提升复杂动态环境下的跟踪能力。


通用 VLA

MiniCPM-RobotManip

MiniCPM-RobotManip 是一款面向机器人操作的 1.5B 通用 VLA 模型保留了面壁智能多模态基础模型 MiniCPM-V 4.6 的通用理解能力,并基于多任务进行统一训练,让同一模型学习处理不同指令和操作任务。

根据主流 VLA 基准测试,MiniCPM-RobotManip 的综合性能位列 VLA 模型的第一梯队,与 Qwen-VLA、π0.5 等主流模型的性能相近、甚至有更出色的表现。

尤其是在考验 VLA 模型上下文记忆的 RMBench 上,MiniCPM-RobotManip 更是明显超越多个主流模型——MiniCPM-RobotManip 得分 53,而主流的π0.5只有10分,接近随机的水平。如下图,模型可以先盖住不同颜色方块后 ,以红绿蓝顺序揭开,体现其原生上下文能力,当前主流基于单帧反应式的VLA是做不到的。

MiniCPM-RobotManip 将 MiniCPM-V 4.6 的视觉 Token 高效压缩优势进一步应用于机器人场景,大幅降低了机器人的视觉输入计算量与推理时延,使机器人在保留1分钟上下文记忆后的推理成本与传统单帧反应式的推理成本相当——换言之,模型性能更优、部署成本却更低

根据测试,在包含 60 帧历史观测 的机器人操作任务中,传统重新计算方式每个决策步需要 125 TFLOPs采用流式推理后仅需 3.3 TFLOPs,低于 π0.5 在无历史帧输入下的 5.0 TFLOPs。在 H100、BF16 精度下,MiniCPM-RobotManip 单决策步推理时延为 120ms相比 π0.5 的 234ms 降低近一半,实现了上下文记忆与响应效率的兼顾。

首个本地断网部署跟踪模型

MiniCPM-RobotTrack

MiniCPM-RobotTrack 是一款 0.9B 端到端视觉指令跟踪模型,具有以下三个技术优势:

 01  三项跟踪任务领跑开源 SOTA 

我们从单目标跟踪(STT)、动态多目标跟踪(DT)和模糊目标跟踪(AT)三类典型场景维度对 MiniCPM-RobotTrack 进行了评测。

在仅有 0.9B 参数且未进行下游强化学习优化的情况下,MiniCPM-RobotTrack 在三项任务中的追踪率分别达到 89.8、73.4 和 80.4,取得开源方案最优结果,相比 OmTrackVLA 分别提升 7.0、14.6 和 6.5 个百分点

在相同的单视角、纯 SFT(监督微调训练)设定下,与其他闭源模型 TrackVLA++ 相比,MiniCPM-RobotTrack 在单目标跟踪和模糊目标跟踪任务上的追踪率分别提升 8.8 和 17.0 个百分点,模糊目标跟踪任务的成功率达到 58.0%。这表明,通过高质量数据和端到端训练,轻量级模型无需依赖多视角输入或下游 RL,也能获得具有竞争力的真实场景指令追踪能力

 02  自进化数据管线,让模型在实践中越用越强 

针对真机数据采集成本高、长尾场景覆盖有限等问题,MiniCPM-RobotTrack 构建了自进化数据管线,先通过自动检测与人工复核清洗异常轨迹、错误动作等低质量数据,再引入面向具身追踪的 DAgger 策略,让模型在仿真与真机交互中主动暴露薄弱环节,针对快速转向、短时遮挡、多人交叉等复杂场景持续补充高价值样本,在数据闭环中提升跟踪与泛化能力。

 03  真机实测 5+ Hz,断网也能自主跟踪 

经过对宇树 Unitree Go2 完整运行链路的系统性优化,MiniCPM-RobotTrack 模型在机器狗原生本地算力下稳定达到 5+ Hz,端到端响应时延约 180 毫秒

在真机 Demo 中,即使现场拔掉网卡,机器狗仍能依靠本地视觉画面与文本指令持续完成目标识别、跟踪与运动控制。该能力可应用于楼宇巡检、人员陪护和园区安防,未来有望拓展至灾害救援、特种作业等弱网、断网或强干扰场景。

本次开源还将提供完整部署流程与一键启动脚本,覆盖模型加载、摄像头接入、文本指令输入和机器人控制接口,真正实现纯本地部署、开箱即用。

具身智能推理框架

PhyAI

此次发布的两款模型均获得了 PhyAI 的推理支持。

PhyAI 是一款面向 Physical AI 的开源推理框架,专为端侧极速推理与云端 RL 大规模 Rollout 场景设计。与模型官方仓库相比,PhyAI 在 NVIDIA GeForce RTX 5090 上运行 π0、π0.5 和 GR00T 时,分别实现了约 2.85 倍、1.82 倍和 2.28 倍加速;GR00T 在 NVIDIA Thor 和 A40 上也分别实现约 1.40 倍和 4.31 倍加速。面对 VLA、WAM 等模型结构快速演进、架构差异显著的现状,PhyAI 将易用性与灵活性置于首位,致力于降低模型从研究原型走向高效推理的适配成本。

通过简洁的 API,PhyAI 在发布首日即完成了对 MiniCPMRobot 的适配支持,并使用 CUDA Graph 进行加速,推理帧率从 10.12 Hz 提升至 33.28 Hz,同时还采取了算子融合的方法,使用triton编写了RMSNorm+SiLU gate、conv1d+SiLU+QKV split等为 MiniCPMRobot 定制的融合算子,减少中间变量的搬运次数,将其在 NVIDIA H20 上的推理帧率进一步提升至 36.77 Hz。

让端侧 AI 走进千行万业

在推进开源技术的同时,我们也在与产业伙伴共同探索真实场景应用。

目前,面壁智能已经与乐聚机器人合作推出展厅导览和园区巡检 Agent 解决方案,并与吉利汽车围绕 VLA 模型、生产仓储应用等方向展开合作,推动具身智能技术在实际环境中持续验证和迭代。

对面壁智能而言,探索物理 AGI 与长期追寻的 AGI 目标一脉相承。随着机器人逐步进入家庭、办公和工厂,本地感知、推理与决策将成为保障实时性、稳定性和数据隐私的重要方向。

未来,我们将继续投入具身领域,坚持通过开源与产业合作推动模型在真实场景中持续验证,让物理智能更加可靠、安全地走进现实世界。




热点新闻

推荐产品

x
  • 在线反馈
1.我有以下需求:



2.详细的需求:
姓名:
单位:
电话:
邮件: