arXiv · 多模态、视频与世界模型· Hongyuan Tao·· 3 天前精选AI 评分80
Multimodal Flow在嵌入空间统一建模语言与视觉
Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces
AI 导读
Multimodal Flow提出一种在嵌入空间统一建模语言与视觉的全连续生成模型,使用共享的chunk-causal flow骨干和有序连续hyperchunks处理文本与图像。
推荐理由
该研究展示了语言与视觉采用统一连续流建模的架构路径,并提供了不同规模和匹配预算下的对比结果,便于评估其研究潜力。
来源:arXiv · 多模态、视频与世界模型 · arxiv.org