OpenWAM研究团队推出世界—动作模型框架,将视频预测与机器人控制放在共同架构中,支持比较“先预测画面再行动”等不同生成方式。项目要解决的问题是:现有系统采用不同的主干、数据集和训练方法,难以判断预测与控制如何配合更有效。团队同时提供训练、评估及视频到动作组合代码,并开放预训练视频模型权重。
据项目页介绍,OpenWAM从Wan2.2-5B出发,在约334万条轨迹及录像、1.464万小时源视频上进行因果预训练,内容涵盖真实与合成机器人操作、人类引导操作和人类交互。这一阶段只使用视频,不使用动作标签或本体感知输入,训练耗时为32块NVIDIA B200 GPU运行14天。
随后,团队把50亿参数的视频专家与20亿参数的动作专家组成混合Transformer(MoT)。同一架构支持四种程序:先视频后动作(VTA)、先动作后视频(ATV)、联合生成(Joint),以及未来视频与动作令牌之间不互相注意的解耦生成(Decoupled)。比较时,主干、令牌化方式、训练目标和下游训练流程保持一致。
发布方自测显示,VTA在四个LIBERO任务集上的平均成功率为98.6%。在LIBERO-Long上,相比原始Wan2.2初始化,机器人视频预训练后的VTA成功率从68.4%升至97.8%,Joint从62.2%升至96.6%。不过,这组实验同时引入了机器人视频数据和因果注意力,不能将增益单独归因于其中一项。
真机实验使用两台Franka Research 3机械臂,执行烤面包、完成2×2魔方最后一层、按颜色分杯三项任务。发布方报告,VTA与Joint的平均成功率分别为92.1%和91.9%。
OpenWAM还支持独立训练的逆动力学模型(IDM)和前向动力学模型(FDM):前者把给定的未来画面转成动作,后者预测给定动作序列会产生什么画面。团队构建了LIBERO-Long-CF,在十个任务中恢复模拟器状态、尝试包含失败情况的替代动作,得到32,000个反事实片段。
据发布方自测,在四个超出IDM训练任务集的LIBERO-90任务上,使用相同混合监督数据的局部上下文IDM平均成功率为84.0%,全上下文IDM为47.0%。实验只冻结并复用IDM;视频预测器仍经过目标任务示范数据训练,且使用了动作标签。
前向预测方面,发布方报告,相比仅用示范数据训练,仅用反事实数据训练使RGB预测均方误差降低34.5%,在16个候选未来中识别正确结果的准确率从21.1%升至71.3%。项目页将动力学组件的复用从仿真扩展至真机、将前向预测从局部转移扩展至长时程规划列为后续挑战。