arXiv · 多模态、视频与世界模型· Patrick Amadeus Irawan·· 2 天前精选AI 评分82
Ego2Act 提出面向目标驱动操作的第一视角视频生成评测基准
Ego2Act: Evaluating Goal-Directed Manipulation in Egocentric Video Generation
AI 导读
论文作者提出 Ego2Act,用包含2,640段视频和110项日常任务的基准,评估模型根据初始场景图像和高层目标生成第一视角操作视频的能力。论文同时提出无参考评测流程 Ego2ActJudge,并发现模型常跳过或部分执行中间步骤,在复杂物体操作和持续世界建模中的细粒度物理动态表现不足。
推荐理由
Ego2Act将多步物理操作和目标完成纳入视频生成评测,并提供无参考评测流程,便于比较模型的目标驱动模拟能力。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org