跳到正文

#Meta

今日 0 条
10月1日周四
  1. arXiv · 多模态、视频与世界模型76

    《The Planning Limits of Latent World Models》揭示潜在世界模型的规划局限

    论文评估了基于 V-JEPA 2、V-JEPA 2.1、VideoMAEv2、VideoPrism 和 DINOv2 的世界模型在 Meta-World 与 BridgeData V2 机器人任务中的规划能力。

    推荐理由:论文将世界模型的可规划范围量化到控制步数,并比较了延长想象轨迹、MPC和专家子目标对远距离任务成功率的影响。

8月10日周一
  1. Hugging Face Blog90

    Meta 发布 Muse Glimmer:面向本地智能体的 30B 开源多模态模型

    Meta 发布 Muse Glimmer-30B,这款采用 Apache 2.0 许可的开源多模态模型面向本地智能体场景。模型由 2B ViT-style 视觉编码器和 28B 文本解码器组成,并支持图像、视频输入与多模态工具调用。

    推荐理由:原文同时给出 Muse Glimmer 的 30B 架构、Apache 2.0 开放方式和本地部署路径,便于评估多模态智能体的落地门槛。

8月2日周五