一个具身模型到底好不好,好在哪里、短板又卡在何处?最直接的回答,是把它装上真实机器人跑一跑。但一台合格的具身设备价格不菲,真机测试的人力、场地和时间成本同样高昂,并非每支团队都负担得起高频迭代。

于是,越来越多开发者转向仿真环境。在数字世界里搭场景、跑模型、看成功率,听起来既高效又经济。然而,仿真评测这条路并不好走——它自身的痛点,恰恰是当下具身智能行业“模型爆发、标尺缺位”的缩影。

仿真评测之困:为什么开发者总是不放心?

当前主流的具身仿真评测平台,普遍面临几重难以回避的困境。

首当其冲的是Sim2Real鸿沟。模型在仿真里拿到漂亮的成功率,一旦部署到真机,光照、材质、相机噪声、物体接触及机器人初始位姿的细微变化,都可能让性能大幅跳水。此前,许多评测基准都没有做详细的真机和仿真实验的对比,更多只是强调在仿真内部评测,而非证明仿真结果与真机表现的接近程度。这道缝隙,让开发者很难对评测结果建立真正的信任。

其次是评测体系的僵化。具身模型迭代极快,但不少基准一旦推出便不再更新,后果是“过了一段时间,大家分数都比较接近,没有办法去反映不同模型之间的差异”。一把不再生长的尺子,终究量不出持续进化的模型。

再就是使用门槛高。传统Benchmark往往要求开发者自行下载代码、部署算力、反复调整环境,才能跑通一次评测,这对算力紧张的高校团队和初创公司而言是沉重的前置成本。

最后是评测维度粗糙与公正性隐忧。许多平台用一个综合成功率概括全部表现,模型短板无从归因;训练集与测试集边界模糊、轨迹回放“刷榜”、单次评测波动大等问题,也在削弱榜单公信力。

正是在这样的背景下,一个由多方联合共建的具身仿真评测平台RoboColiseum正式上线,试图以“高保真仿真+多维评测+自动化工具”的组合回应上述痛点。

RoboColiseum:一把对齐真实世界的评测标尺

RoboColiseum定位清晰:一个7×24小时面向全球高校、科研机构和模型企业开放的常态化仿真评测平台。自内测以来,已有海内外近100支队伍在平台上开展模型训练与评测。

在仿真保真度上,RoboColiseum交出了一组业内少见的量化数据。经实测验证,仿真评测与实机部署的相关性达到89.5%,相同模型在仿真与真实世界中的单任务成功率差异小于10%。这意味着仿真结论可以作为真机表现的可靠参考,帮助开发者在进入成本更高的真机测试前,快速完成模型筛选与问题定位。

这一一致性源于两条技术路线的协同。其一是基于视觉的三维重建:平台采用前馈生成网络,只需拍摄真实环境的图片,便可在几分钟内高保真还原3D世界,同时借助激光雷达校准空间几何尺度,使视觉渲染与真实场景高度对齐。其二是物理参数的精细化校准:团队对物体的质量、重心、摩擦力、转动惯量,以及机器人的相机内外参、刚度阻尼、末端控制等参数,都做了大量实验与优化,力求让仿真中的每一次接触都贴近真实。

这条验证链路还是双向的——真机数据训练的模型可直接提交仿真评测,仿真数据训练的模型也能通过真实机器人验证迁移效果,可以直接拿这一套仿真数据训练出的模型,直接部署到真机上面,相关实验结论已在Tech Report中公开。

在评测体系上,RoboColiseum拒绝用单一分数盖棺定论。平台目前推出指令跟随、空间理解、扰动适应、通用操作四大能力子榜,共78个高保真仿真评测任务,覆盖超过3000个泛化case。四个维度的设计逻辑,源于对机器人完成真实任务所需能力的拆解:先听懂指令,再理解物体的空间位置与关系,继而抵抗光照、时延、物体位移等扰动,最终组合抓取、放置、拖拽等原子技能完成操作。每项任务还被拆解为多个子步骤,平台不仅判断最终是否成功,也记录模型完成了哪些步骤、在哪一步失败,让开发者精准定位短板。

在使用体验上,RoboColiseum把门槛压到了极低。平台不仅全部开源——代码、训练数据和评测框架均开放——还提供基于AI Skills的产品化使用方式,开发者只需通过自然语言对话,即可完成数据下载、模型训练、本地验证和评测提交。从注册到提交最快仅需5分钟,一键部署后最快30分钟便可拿到分项成绩、任务步骤结果及模型推演视频。模型代码和权重无需上传,只需本地部署推理服务并接入标准接口。

此外,平台已提供ACoT-VLA、π0、π0.5、GR00T等国际具身基座模型的基线成绩及训练代码,开发者可在四个维度上与主流模型逐项比较,也可自行复现核验。

在公正性上,RoboColiseum搭建了三重防线:实时反馈与严格审核(分数实时更新、平台不参与修改、队伍注册经审核);任务设计防Hack(训练集与评测集完全隔离、任务充分泛化、对输出轨迹做一致性校验);评测链路稳定化(每个任务多次评测取平均,避免相同模型每次提交结果波动过大)。

标尺:生长不止

尽管RoboColiseum在多个维度上做出了显著改进,但仍需生长。

首先是仿真与真机的一致性。89.5%的相关性在业内已属领先,但还是有提升空间,环境渲染、机器人控制与真机的对齐、物理参数交互等方面都会持续更新。目前铰链物体和刚体任务的一致性已较高,但流体、柔性物体的仿真仍是行业共性难题,平台正在投入资源攻克,计划不久后公开相关实验结果与Tech Report,同步更新柔性物体和流体的评测任务。

其次是评测维度的扩展。当前四大维度已能覆盖大部分模型的基础能力,但许多模型在精细操作上表现尚不理想,往往需要后训练或强化学习才能完成泛化度不强的精细操作,因此平台正与多个算法团队紧密交流、共同设计相关任务。长程任务评测也被列为后续补充方向——泛化性目前已分布在各个子榜单中,但更系统的长程精细操作评测仍待完善。

最后是行业标准的共建。具身智能领域至今尚未出现像大模型领域那样被普遍认可的统一评测基准,根源既在于模型与技术路径迭代过快,也在于真机评测成本高昂、仿真与真实鸿沟难填。RoboColiseum的长期目标,是将真实世界中的复杂任务转化为标准化、可复现、可持续更新的评测体系,这需要更多开发者开放模型、参与共建,也需要平台在治理机制上持续进化。

Coliseum原指古罗马圆形竞技场——一个公开、中立、谁都可以登台的竞技场。RoboColiseum既是模型同场比较的“竞技场”,也是开发者反复测试、定位短板和持续迭代的“训练场”。当越来越多的模型在同一把尺子下被比较和改进,具身智能的发展也将从精心挑选的成功演示,走向更加可靠、透明和可验证的真实进步。

Logo

葡萄城是专业的软件开发技术和低代码平台提供商,聚焦软件开发技术,以“赋能开发者”为使命,致力于通过表格控件、低代码和BI等各类软件开发工具和服务,一站式满足开发者需求,帮助企业提升开发效率并创新开发模式。

更多推荐