《The Planning Limits of Latent World Models》揭示潜在世界模型的规划局限
论文评估了基于 V-JEPA 2、V-JEPA 2.1、VideoMAEv2、VideoPrism 和 DINOv2 的世界模型在 Meta-World 与 BridgeData V2 机器人任务中的规划能力。
推荐理由:论文将世界模型的可规划范围量化到控制步数,并比较了延长想象轨迹、MPC和专家子目标对远距离任务成功率的影响。
论文评估了基于 V-JEPA 2、V-JEPA 2.1、VideoMAEv2、VideoPrism 和 DINOv2 的世界模型在 Meta-World 与 BridgeData V2 机器人任务中的规划能力。
推荐理由:论文将世界模型的可规划范围量化到控制步数,并比较了延长想象轨迹、MPC和专家子目标对远距离任务成功率的影响。
该研究提出基于 LLM 的多模态对话情绪评估框架,在 IEMOCAP 上同时进行离散情绪识别和 Valence-Arousal-Dominance(VAD)维度评估,并比较 LLaMA、GPT 和 Qwen 系列的零样本、少样本提示与 LoRA 微调。
Meta 发布 Muse Glimmer-30B,这款采用 Apache 2.0 许可的开源多模态模型面向本地智能体场景。模型由 2B ViT-style 视觉编码器和 28B 文本解码器组成,并支持图像、视频输入与多模态工具调用。
推荐理由:原文同时给出 Muse Glimmer 的 30B 架构、Apache 2.0 开放方式和本地部署路径,便于评估多模态智能体的落地门槛。
Replicate 周报汇总本周开源 AI 动态:Black Forest Labs 发布图像生成模型套件 FLUX.1,含 pro、dev 和以 Apache 2.0 许可开源的 schnell 三个版本。
推荐理由:汇总一周开源模型与工具动态,并借编辑手记讨论生成模型作为世界镜像的反馈循环。