Extensive reading
(EgoWM) Walk through Paintings: Egocentric World Models from Internet Priors
SVD、Cosmos、Wan 等视频生成模型已经从互联网视频中学到了大量关于外观、运动和常见物理现象的先验,保留这些视觉先验,只用少量机器人数据教会视频模型“动作是什么意思”
对齐视频的潜在时间轴
把动作注入扩散时间步通道(就是 DiT denoise 部分 会有一个当前去噪时间步 用来调制scale shift之类,这里加入动作与时间步一起调制):每连续 4 个动作对应一个 latent 时间片。
| 动作窗口 | Action Embedding | 对应 latent 时间片 |
|---|---|---|
| 1 | ||
| 2 | ||
| 3 | ||
| 4 |
提出的新评价指标SCS 结构一致性得分