arXiv · 多模态、视频与世界模型· Zequn Yang·· 3 天前AI 评分70
Gestalt:提出基于多模态交互的大型多模态模型
Gestalt: Large Multimodal Interplay Model
AI 导读
Zequn Yang 等作者提出 Gestalt,一种围绕多模态交互构建的大型多模态模型。该模型采用多模态交互金字塔、统一离散扩散框架和通过可学习交互 token 促进跨模态交换的架构,论文称其在图像生成、多模态理解和纯文本评测中提升了跨模态融合,同时保留模态特有信息。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org