arXiv · 多模态、视频与世界模型· Zihan Wang·· 4 天前精选AI 评分76
PRISM通过反事实视频生成扩展人形机器人移动操作训练
Counterfactual Video Generation Enables Scalable Humanoid Loco-Manipulation
AI 导读
PRISM提出一个真实到仿真再到真实框架,用少量真实视频生成大规模多样的人体与物体交互训练数据。研究通过视频到视频生成数百条反事实视频,再重建并调整人和物体的运动轨迹,训练出无需真实世界微调的策略。搭载该策略的人形机器人仅使用机载深度观测,就能在不同物体实例、尺寸和初始配置下完成箱子、桶、箱体和球的拾取、搬运与放下。
推荐理由
PRISM展示了如何用少量真实交互视频生成反事实数据,并通过真实到仿真再到真实流程训练人形机器人的移动操作策略。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org