跳到正文
原文
arXiv · 多模态、视频与世界模型· Zequn Yang·· 3 天前AI 评分70

Gestalt:提出基于多模态交互的大型多模态模型

Gestalt: Large Multimodal Interplay Model

AI 导读

Zequn Yang 等作者提出 Gestalt,一种围绕多模态交互构建的大型多模态模型。该模型采用多模态交互金字塔、统一离散扩散框架和通过可学习交互 token 促进跨模态交换的架构,论文称其在图像生成、多模态理解和纯文本评测中提升了跨模态融合,同时保留模态特有信息。

来源:arXiv · 多模态、视频与世界模型 · arxiv.org