跳到正文
原文
arXiv · 多模态、视频与世界模型· Hongyuan Tao·· 3 天前精选AI 评分80

Multimodal Flow在嵌入空间统一建模语言与视觉

Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces

AI 导读

Multimodal Flow提出一种在嵌入空间统一建模语言与视觉的全连续生成模型,使用共享的chunk-causal flow骨干和有序连续hyperchunks处理文本与图像。

推荐理由

该研究展示了语言与视觉采用统一连续流建模的架构路径,并提供了不同规模和匹配预算下的对比结果,便于评估其研究潜力。

来源:arXiv · 多模态、视频与世界模型 · arxiv.org