WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models
视频质量评测
共 6 个维度:
| 评测维度 | 英文名称 | 指标说明 |
|---|---|---|
| 视觉质量 | Visual Quality | Image Quality:MUSIQ 无参考图像清晰度; Aesthetic Quality:LAION 美学打分; JEPA Similarity:V-JEPA 特征的 MMD 距离,衡量与真实视频特征分布的相似度。 |
| 运动质量 | Motion Quality | Dynamic Degree:通过光流统计关键区域的运动强度; Flow Score:全局光流的运动幅度; Motion Smoothness:利用帧插值模型评估运动的时序平滑性与惯性一致性。 |
| 内容一致性 | Content Consistency | Subject Consistency:DINO 特征衡量物体跨帧一致性; Background Consistency:CLIP 衡量背景场景稳定性; Photometric Consistency:光流 AEPE 衡量像素与纹理稳定性。 |
| 物理合规 | Physics Adherence | Interaction Quality:Qwen3-VL 判断机器人—物体交互的物理合理性; Trajectory Accuracy:SAM3 提取机械臂轨迹,NDTW 衡量其与真值的对齐程度。 |
| 3D 几何精度 | 3D Accuracy | Depth Accuracy:单目深度估计后,尺度归一化评估深度几何; Perspectivity:VLM 判断透视、遮挡、尺度与光照的 3D 合理性。 |
| 可控性 | Controllability | Instruction Following:VLM 判断是否执行指令; Semantic Alignment:VLM 生成视频描述,再由 CLIP 比对语义; Action Following:比较不同指令生成视频的特征差异,检验模型是否能区分不同动作指令。 |
具身任务功能评测
具身数据引擎 Embodied Data Engine
作为仿真环境 生成动作-观测配对数据 用于训练算法
大部分模型合成数据能带来小幅收益,但显著弱于真实数据;仅少数模型(RoboMaster、WoW)个别任务超过真实数据效果。当前世界模型还不能可靠产出高质量训练数据
具身策略评估器 Embodied Policy Evaluator
不同能力等级的机器人策略与世界模型交互 rollout 生成观测视频;VLM 自动判断任务是否成功。将世界模型给出的成功率,和 RoboTwin 物理仿真器结果做皮尔逊相关
普遍高估成功率现象
具身动作规划器 Embodied Action Planner
世界模型接收初始画面 + 文本指令预测未来状态,逆动力学模型解码输出动作序列;把动作送入 RoboTwin 仿真器执行,统计任务成功率。
可以拿到非零成功率,但远低于专门的 VLA 策略,长序列闭环任务执行能力不足,仍有巨大提升空间
但这里不知道是 世界模型 的问题,还是 逆动力学模型 输出动作不准确?
人类评估
招募 70 名标注者,评测 3500 条视频,分两种评测模式:
- 打分模式:1‑5 分,评估整体视频质量、指令跟随、物理合理性,归一化到 0‑100;
- 头对头对比(win‑rate):同一提示下两个模型输出,人工选出更好的一个。