中国具身智能正在加速迈向真实世界:更完备的供应链、更成熟的制造能力,以及不断开放的产业场景,让机器人拥有了更强的“身体”。但当硬件逐渐趋同、部署能力不断成熟,真正拉开企业差距的,已不只是机器人能否完成一次漂亮的演示,而是它能否在多变环境中持续学习、稳定进化。
决定这一能力上限的,正是其背后可训练、可验证、可复用的高价值数据。
数字智能的突破,背后依赖的是互联网长期积累的数据底座:文本、图像和代码可以低成本复制、规模化汇聚,再通过逐渐成熟的训练范式持续转化为模型能力。
而具身智能面对的却是物理世界。数据与本体、任务和场景紧密耦合;更重要的是,模型架构、训练方法和评测体系仍在快速探索。此时,采集量不等于有效训练量,真正决定能力的,是采什么、留什么、怎样组合、如何训练和验证——也就是数据配方。
在云栖大会上,阿里巴巴携手清华大学、上海交通大学发布 RoboFlywheel。项目围绕数据生产、处理、验证与复用,建设具身智能开放数据基础设施,让更多实践能够被比较、复现和继续迭代。
四项基础能力,让数据从一次投入变成持续积累。
具身智能最终要进入物理世界,仿真则提供了进入真机前的数字试验场:规模化构造长尾和高风险场景,更早验证能力边界、发现问题。RoboFlywheel-Sim 建设生成式资产底座,首批覆盖 52 万刚体资产、40 万铰链资产和 10 万柔性资产,为系统性验证提供丰富的物理资产。
围绕统一资产格式、跨引擎资产编译、自然语言场景构建与声明式评测 Harness,同一套资产、场景和任务可以在不同引擎中复现,支撑规模化压力测试、失败诊断和版本回归。仿真不替代最终的真机检验,而是让更多问题在进入物理世界之前被更早发现。
RoboFlywheel-Bench 既评模型,也评模型之外决定具身系统能否落地的关键能力。首发的 WholeBodyBench 聚焦模型能力,从基础单元、单元组合到高层组合逐级提升任务复杂度,同时考察组合泛化、场景泛化,以及成功与安全。
在模型评测之外,系列评测还将覆盖真机与仿真的数据采集效率、机器人构型能力边界等方向。评测不只是排榜,也要把模型、数据与本体暴露出的能力缺口,重新反馈给数据生产与配方设计。
具身数据真正昂贵的,不只是采集。哪些数据该留下、怎样去重和混配、在哪个训练阶段使用,往往散落在一次性脚本和人工经验里。能跑通一次,却难以复现;得到一个结果,也很难追溯究竟是哪一步起了作用。
RoboFlywheel-Recipe 不是一个配方目录,而是一套 Episode-native 的高性能具身数据框架。它由 Recipe/Harness、Operator/Skill 和 Distributed Engine 三层组成,把数据选择、质量检测、时空对齐、语义标注、增强与训练优化编排成可追踪、可复现、可规模化执行的数据配方。
首批 20+ 官方算子覆盖数据接入与转换、质量检测与清洗、时空对齐与动作提取、语义标注、数据增强和训练数据优化。底层支持分布式执行、IO 优化、断点续跑、算子融合与高效重配方缓存,让配方不仅能写下来,也能在大规模数据上高效跑起来。
每一份配方都可以完整记录“数据—处理—训练—权重—评测”链路,并替换数据、算子或模型开展对照实验。首批配方探索将以可复现的结果回答:什么样的数据,才能真正转化为模型能力。
已有开源框架与数据集持续涌现,下一步是让不同来源的数据能够进入同一套处理与验证链路。RoboFlywheel-Dataset 首批接入 40+ 数据集,覆盖多构型真机、无本体与仿真数据。
通过统一 Schema 和接入规范,平台补齐格式转换、基础质量检测与元数据,并记录数据来源、许可、处理算子、质量报告和版本变化。社区不仅可以贡献数据集,也可以提交算子、配方和评测任务,让一次成果成为下一轮探索的起点。
具身智能仍在寻找自己的 scaling 路径。这个阶段需要的不只是各自扩大数据规模,更要让不同方法能够被验证、比较和复用,在真实反馈中加快技术路线收敛。
RoboFlywheel 期待与机器人企业、高校、研究机构和开发者共同建设:贡献数据与资产,复现并改进数据配方,用统一评测检验能力边界,再把结果带回下一轮数据建设。
RoboFlywheel,为具身智能建一张开放的数据底座。
欢迎访问 RoboFlywheel 主页,加入开放共建。
来源:阿里数据








资讯频道