Skip to main content

WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models

视频质量评测​

共 6 个维度:

评测维度英文名称指标说明
视觉质量Visual QualityImage Quality:MUSIQ 无参考图像清晰度;
Aesthetic Quality:LAION 美学打分;
JEPA Similarity:V-JEPA 特征的 MMD 距离,衡量与真实视频特征分布的相似度。
运动质量Motion QualityDynamic Degree:通过光流统计关键区域的运动强度;
Flow Score:全局光流的运动幅度;
Motion Smoothness:利用帧插值模型评估运动的时序平滑性与惯性一致性。
内容一致性Content ConsistencySubject Consistency:DINO 特征衡量物体跨帧一致性;
Background Consistency:CLIP 衡量背景场景稳定性;
Photometric Consistency:光流 AEPE 衡量像素与纹理稳定性。
物理合规Physics AdherenceInteraction Quality:Qwen3-VL 判断机器人—物体交互的物理合理性;
Trajectory Accuracy:SAM3 提取机械臂轨迹,NDTW 衡量其与真值的对齐程度。
3D 几何精度3D AccuracyDepth Accuracy:单目深度估计后,尺度归一化评估深度几何;
Perspectivity:VLM 判断透视、遮挡、尺度与光照的 3D 合理性。
可控性ControllabilityInstruction Following:VLM 判断是否执行指令;
Semantic Alignment:VLM 生成视频描述,再由 CLIP 比对语义;
Action Following:比较不同指令生成视频的特征差异,检验模型是否能区分不同动作指令。

具身任务功能评测​

具身数据引擎 Embodied Data Engine​

作为仿真环境 生成动作-观测配对数据 用于训练算法

大部分模型合成数据能带来小幅收益,但显著弱于真实数据;仅少数模型(RoboMaster、WoW)个别任务超过真实数据效果。当前世界模型还不能可靠产出高质量训练数据

具身策略评估器 Embodied Policy Evaluator​

不同能力等级的机器人策略与世界模型交互 rollout 生成观测视频;VLM 自动判断任务是否成功。将世界模型给出的成功率,和 RoboTwin 物理仿真器结果做皮尔逊相关

普遍高估成功率现象

具身动作规划器 Embodied Action Planner​

世界模型接收初始画面 + 文本指令预测未来状态,逆动力学模型解码输出动作序列;把动作送入 RoboTwin 仿真器执行,统计任务成功率。

可以拿到非零成功率,但远低于专门的 VLA 策略,长序列闭环任务执行能力不足,仍有巨大提升空间

但这里不知道是 世界模型 的问题,还是 逆动力学模型 输出动作不准确?

人类评估​

招募 70 名标注者,评测 3500 条视频,分两种评测模式:

  1. 打分模式:1‑5 分,评估整体视频质量、指令跟随、物理合理性,归一化到 0‑100;
  2. 头对头对比(win‑rate):同一提示下两个模型输出,人工选出更好的一个。