Skip to main content

Extensive reading

(EgoWM) Walk through Paintings: Egocentric World Models from Internet Priors​

SVD、Cosmos、Wan 等视频生成模型已经从互联网视频中学到了大量关于外观、运动和常见物理现象的先验,保留这些视觉先验,只用少量机器人数据教会视频模型“动作是什么意思”

对齐视频的潜在时间轴

把动作注入扩散时间步通道(就是 DiT denoise 部分 会有一个当前去噪时间步 tt 用来调制scale shift之类,这里加入动作与时间步一起调制):每连续 4 个动作对应一个 latent 时间片。

动作窗口Action Embedding对应 latent 时间片
a1∼a4a_1 \sim a_4Za1Z_a^11
a5∼a8a_5 \sim a_8Za2Z_a^22
a9∼a12a_9 \sim a_{12}Za3Z_a^33
a13∼a16a_{13} \sim a_{16}Za4Z_a^44

提出的新评价指标SCS 结构一致性得分