arXiv cs.RO· Ruiyan Xu, Haisheng Su, Sixu Lin, Zhaokun Yue, Chengming Hu, Xin Jin, Guiliang Liu·· 20 小时前精选AI 评分62
R²-WAM:面向世界动作模型的修复与拒绝后训练框架
$R^2$-WAM: Repair-and-Reject Post-Training for World Action Models
AI 导读
R²-WAM 提出修复与拒绝两阶段后训练框架,先通过运动学对齐分数提升预测未来与输入动作的一致性,再用修复后的视频模型比较采样动作与示范动作的预测结果,对任务进度低于示范参考一定幅度的样本做负向微调。
推荐理由
提出修复与拒绝两阶段后训练框架,让世界动作模型的预测更贴合输入动作并用于策略改进。
来源:arXiv cs.RO · arxiv.org