跳到正文
原文
arXiv · 多模态、视频与世界模型· Chang-Bae Bang·· 4 天前AI 评分74

研究发现未来视频生成表征比观测视频更贴近人类视觉皮层

Future Video Generation Better Aligns with the Human Visual Cortex than Observed Video

AI 导读

一项研究比较了视频扩散模型中未来视频生成与观测视频重建的内部表征,发现前者与人类观看视频时的视觉皮层响应更一致。观测视频重建的对齐主要集中在低阶视觉皮层,未来视频生成则更多集中于高阶视觉皮层;行为实验中,受试者更偏好增强相关层贡献后生成的视频。

来源:arXiv · 多模态、视频与世界模型 · arxiv.org