跳到正文

论文与研究

按论文与研究浏览相关 AIGC 创作资讯,保留原始出处、阶段与证据。

46条精选

最新精选

第 21–40 条 · 共 46 条
10月1日周四
  1. arXiv · 多模态、视频与世界模型76

    Radian:用表征空间对抗蒸馏增强自回归视频生成

    论文提出 Radian,通过冻结视觉基础模型提取多层视觉表征,并对自回归生成结果施加真实视频帧对抗监督,以改善细节退化、结构漂移和运动不稳定。基于 Wan2.1-1.3B 的实验显示,四步生成达到 VBench Total 0.8444 和 VideoAlign Total 0.8033,VBench-Long 从 0.7805 提升至 0.8041,且使用更少去噪步数。

    推荐理由:论文将视觉基础模型表征空间的对抗监督引入蒸馏,可为降低自回归视频生成中的时序误差传播提供一种训练思路。

  2. arXiv · 多模态、视频与世界模型79

    LOCI:面向流式世界模型的空间线性记忆

    Ji Xia 等人提出 LOCI,一种结合 key-value cache 与循环线性注意力记忆的空间记忆架构,用于让视频世界模型更准确地复现摄像机重访区域。

    推荐理由:LOCI 将可保留视觉细节的 key-value cache 与线性循环记忆结合,为长视频中的场景重访和显存控制提供了具体架构参考。

  3. arXiv · 多模态、视频与世界模型77

    WorldAuditBench:用多模态智能体审计交互式3D世界

    WorldAuditBench提出一个交互式3D世界审计基准,包含基于Unreal Engine 5构建的13个环境和213项异常任务,覆盖五类异常。论文在固定探索预算下评估五个前沿模型,采用VLA探索后由VLM识别异常,以及端到端VLM智能体两种范式,成功率为6.6%至42.3%,低于人类的83.4%。

    推荐理由:WorldAuditBench将3D世界审计拆为探索行动与视觉推理,并用统一预算比较两种范式,可用于评估多模态智能体的证据搜集能力。

  4. arXiv · 多模态、视频与世界模型85

    Physis-Lang:用自演化语言作为视频世界模型的物理表示

    Physis-Lang提出一种自演化框架,将物理语言作为视频世界模型在数据整理、模型训练和视频生成中的共享表示。在四个物理视频基准上,使用 Wan 和 Cosmos 主干的实验显示物理可信度持续提升;基于开源 Cosmos3-Nano 的增强模型超过 Veo 3.1。

    推荐理由:论文将物理过程拆成可优化的语言断言,并通过 PhysCapBench 与语言引导检索改善视频世界模型的物理可信度。

  5. arXiv · 多模态、视频与世界模型80

    Multimodal Flow在嵌入空间统一建模语言与视觉

    Multimodal Flow提出一种在嵌入空间统一建模语言与视觉的全连续生成模型,使用共享的chunk-causal flow骨干和有序连续hyperchunks处理文本与图像。

    推荐理由:该研究展示了语言与视觉采用统一连续流建模的架构路径,并提供了不同规模和匹配预算下的对比结果,便于评估其研究潜力。

  6. arXiv · 多模态、视频与世界模型78

    Audible World Models 提出面向 3D 世界的空间感知声音生成框架

    论文提出 Audible World Models,一种 training-free 框架,可从文本提示构建全景 3D proxy,将声音源锚定到重建几何,并根据听者视点和运动渲染空间音频。对 80 个生成场景的实验显示,该方法在空间一致性上优于文本、视频和全景图条件基线,同时保持有竞争力的语义对齐;论文已被 NeurIPS 2026 接收。

    推荐理由:论文将声音源位置、3D 几何与几何声学传播纳入世界状态,为构建随观察者移动而变化且保持空间一致性的多模态世界模型提供了可复用路线。

  7. arXiv · 多模态、视频与世界模型79

    统一多模态模型中的位置级梯度冲突与位置感知调制

    该研究提出位置级干扰图,用于定位统一多模态模型中图像理解与自回归图像生成之间的梯度冲突。在 Show-o 和 Janus-Pro 上,视觉 token 位置可解释较大比例的冲突差异,序列前四分之一的平均梯度余弦为 -0.18,末四分之一为 -0.02。

    推荐理由:该研究为统一多模态模型理解与生成目标的梯度冲突提供了位置级诊断,并给出无需改架构的调制方法。

  8. arXiv · 多模态、视频与世界模型80

    LongTake:学习在长时域视频生成中维持动态

    LongTake提出由 Long-Horizon Teacher Forcing 和 DMD 构成的两阶段训练流程,让自回归视频扩散模型基于长真实视频前缀预测后续帧,以维持长时域生成中的场景动态和视觉质量。在相同的五秒 DMD 训练设置下,该初始化在30秒生成中以相近美学质量获得更高动态程度;Hybrid DMD 在30秒和60秒自回滚评测中取得被评估方法中的最高动态程度。

    推荐理由:Long-Horizon Teacher Forcing 将长视频真实前缀引入训练,结合 Hybrid DMD,为提升长时域生成的动态持续性和画质提供了可复用的训练思路。

  9. arXiv · 多模态、视频与世界模型76

    EPIC:基于极线一致性的360°沉浸式立体视频生成

    EPIC提出一种零样本生成流程,将现有视频扩散模型扩展到4K立体360°视频生成。论文设计了感知极线几何的360°图像匹配指标,用于捕捉跨视角的时序与立体不一致,并在有限训练数据下进行直接偏好优化。

    推荐理由:论文将极线感知的360°图像匹配指标作为偏好信号,用于有限训练数据下的直接偏好优化,为沉浸式视频的一致性优化提供了可复用思路。

  10. arXiv · 多模态、视频与世界模型77

    研究提出 SEGUE,提升视频生成中途提示词切换的状态过渡

    该研究提出 SEGUE 框架,让视频生成器在中途切换提示词时先完成必要的状态过渡,再交还控制权给用户提示词。在包含 1,800 次切换的 OpenTrans-360 上,SEGUE 将整体得分从 0.866 提升至 0.887,并在八项过渡指标中均排名第一;其规划器也能迁移到无需重新训练的冻结自回归生成器。

    推荐理由:论文将中途提示词切换拆解为带状态和时长的过渡,并用两个基准展示了对生成连贯性与指令响应的改善。

  11. arXiv · 多模态、视频与世界模型76

    UniEvo-VL 提出多模态模型自我改进的在策略自蒸馏训练方法

    UniEvo-VL 提出一种让单个多模态模型分别充当教师和学生、利用自我批评反馈进行在策略自蒸馏的方法,以改进图像生成能力。在开源 Qwen-image-2512 上,GenEval 从 0.747 提升至 0.808,GenEval2 Soft-TIFA 从 32.97 提升至 35.53。

    推荐理由:论文给出不依赖独立教师的多模态自蒸馏路径,并用 GenEval 与 GenEval2 Soft-TIFA 的分数变化展示其对图像生成改进的测量方式。

  12. arXiv · 多模态、视频与世界模型76

    FrameMorrow:用前瞻 tokens 指导长时视频生成中的帧选择

    论文提出 FrameMorrow,通过预测代表未来信息需求的少量 prospective tokens,从历史中选择相关帧,以支持长时视频生成。该方法选择显式历史帧而非模型内部状态,可接入包括闭源模型在内的不同生成器,并在 5 个基准、11 个生成模型上评估了长视频生成、交互生成和动作条件世界模型任务,报告了长程一致性、视觉质量与动作对齐的持续提升。

    推荐理由:论文把历史选择从当前相关性转向未来信息需求,并以显式历史帧接入不同生成器,为长视频和交互生成的记忆设计提供了可复用思路。

  13. arXiv · 多模态、视频与世界模型79

    SceneJail 利用视频场景上下文攻击多模态大语言模型

    SceneJail 提出一种自适应黑盒越狱框架,通过构造兼容场景并搜索场景相关提示词,攻击视频多模态大语言模型。该方法在包含八个 Video-MLLMs 的评测中,SceneJail-F 的平均攻击成功率最高达 91.5%,较最强基线高 29.1 个百分点。将有害查询分布到连续帧的 SceneJail-S 在严格图像过滤下仍达到 72.3% 的攻击成功率。

    推荐理由:论文将视频场景从有害查询的载体提升为攻击面,为 Video-MLLM 安全评测和防御设计提供了可复用的测试思路。

  14. arXiv · 多模态、视频与世界模型79

    BadAction:通过动作引导触发器攻击交互式视频生成

    论文提出 BadAction,用预定义动作模式作为后门触发器,使交互式视频生成模型在触发后生成不再响应后续动作的冻结未来帧,同时保持对正常动作序列的行为。实验显示,动作单模态触发器的平均攻击成功率为 91.0%,多模态触发器为 80.4%;该方法还成功绕过现有后门检测方法,暴露交互式视频生成流程中的安全缺口。

    推荐理由:论文把交互式视频生成的攻击面具体化为动作序列触发器,并给出攻防实验,便于评估模型在可控生成场景中的安全边界。

  15. arXiv · 多模态、视频与世界模型86

    Asking the World 提出智能体世界建模与探测方法,提升视频物理推理

    Shenxiang Zeng 的论文提出 Asking the World(ATW),通过世界建模与世界探测两个自适应阶段,从视频构建并干预可执行的物理世界。基于 Gemini-3-Flash,ATW 在 CLEVRER 上达到 80.82% 问题级准确率,在 ContPhy 上达到 70.56%,并在三个真实场景中达到 71.67%。

    推荐理由:论文将视频中的物理推理转化为可执行世界的建模与探测,并用多组基准展示了这种验证式流程相对直接 VLM 推理的提升。

  16. arXiv · 多模态、视频与世界模型80

    MindWorldBench:评估图生视频中的心理状态到行为推理

    Ruiqi Li 等人提出 MindWorldBench,评估图生视频模型根据心理状态生成行为的能力。该基准使用 Zero-Action Prompting 和包含 744 个提示的反事实设计,并对 11 个模型进行评测。结果显示,模型虽然具备视觉保真度和物理推理能力,但难以让行为与潜在心理状态一致,常出现偏向客观世界状态而非人的主观信念的 Omniscient Bias。

    推荐理由:论文用 744 个反事实提示评估图生视频的心理状态到行为推理,并揭示模型偏向客观世界状态的失败模式。

  17. arXiv · 多模态、视频与世界模型79

    MEND:无标签检测、定位与校正世界模型中的潜在幻觉

    论文提出 MEND,用一个基于真实状态转移训练的条件 score network,在没有错误标签的情况下检测、定位并尝试校正冻结世界模型中的潜在幻觉。在两个导航环境中,MEND 的幻觉检测 AUROC 最高达 0.80,逐 token 定位 AUPRC 最高达 0.87,且不使用动作信息。推理时校正可降低单步潜在误差并改善预测,但部分误差位于数据流形切向方向,论文因此重点讨论检测与定位。

    推荐理由:论文把世界模型的潜在幻觉拆成检测、定位和推理时校正三个可评估环节,并给出无需错误标签的指标结果,适合参考相关鲁棒性研究设计。

9月30日周三
  1. arXiv · 多模态、视频与世界模型76

    PRISM通过反事实视频生成扩展人形机器人移动操作训练

    PRISM提出一个真实到仿真再到真实框架,用少量真实视频生成大规模多样的人体与物体交互训练数据。研究通过视频到视频生成数百条反事实视频,再重建并调整人和物体的运动轨迹,训练出无需真实世界微调的策略。搭载该策略的人形机器人仅使用机载深度观测,就能在不同物体实例、尺寸和初始配置下完成箱子、桶、箱体和球的拾取、搬运与放下。

    推荐理由:PRISM展示了如何用少量真实交互视频生成反事实数据,并通过真实到仿真再到真实流程训练人形机器人的移动操作策略。

  2. arXiv · 多模态、视频与世界模型82

    LongLive-Plug 提出一次性蒸馏框架,支持视频生成模型即插即用复用

    论文提出 LongLive-Plug,一种将蒸馏能力学习为基础模型 LoRA 的一次性框架,可免训练即插即用于兼容的下游视频模型。它覆盖单次 CFG、少步采样和长上下文错误校正,并在三类骨干网络、54 个下游模型和八类任务上进行了验证。

    推荐理由:论文给出把单次 CFG、少步采样和长上下文纠错封装为可复用 LoRA 的方案,并以 54 个下游模型展示跨任务免训练部署路径。

  3. arXiv · 多模态、视频与世界模型82

    FracGen 论文提出受物理信号控制的断裂视频生成模型

    FracGen 论文提出一种从单张完整物体图像生成可控断裂视频的模型,并通过物理信号建模撕裂与形变过程。作者构建 FracSim 生成带有密集像素对齐物理场的断裂视频数据,用联合预测和物理约束损失训练模型。实验显示,FracGen 在物理保真度和视觉保真度上均优于现有视频生成基线,并可控制撕裂位置、裂纹传播速度及失效前形变量。

    推荐理由:论文将断裂模拟产生的物理场用于视频生成训练与约束,为可控物理动态建模提供了具体技术路径。