跳到正文

#一致性/可控性

今日 1 条
今天10月3日周六
  1. 宝玉29

    宝玉尝试用 Opus 5.5 制作吃瓜视频,全程由模型自己找素材、自己配音,配音使用 Gemini 3.8 Flash TTS(自备 API Key),并产出了英文和中文两个版本。

    引用Shivon Zilis@shivon

    It’s hard to go from in love to let go in a week with no warning, but that’s just how it is sometimes 🤷🏻‍♀️ I feel happy that I got to show Elon how it feels to be deeply understood, nurtured, and peacefully loved with stability and gentleness. Given the tumultuous nature of his early life, his often tortured soul, and how hard he fights for humanity I wanted him to feel the deepest and most stable form of love this world can provide. My heart is full knowing I got to do that, and I hope it leaves a lasting good effect. We were always his safe space. A place where all of us were overjoyed to see him and one that was always full of happiness and love, not war, in contrast to his otherwise militant existence (a needed break from the battlefield where he could recharge his heart and soul before heading back out) I loved being that counterbalancing place of safety, sense of calm, and love — and delighted in bringing a smile back to his face when he was down. I will miss him dearly. I’ve loved him more than life itself and he’s taught me 100 lifetimes of knowledge and made my cup overflow with life meaning, so there is a lot of loss, but luckily we created four beautiful little loves of my life ❤️❤️❤️❤️ I am so beyond grateful for our children and they make every single day the best day of my life! I do hope and pray he and I can be great friends and coparents. I’m hurting, but care deeply about E and will always be cheering for his happiness. God speed, Elon, the world is lucky to have you.

10月2日周五
  1. 可灵 · 模型与创作实践73

    Kling 4.0 开启封闭测试,预告 10 月正式发布

    Kling 4.0 现已进入封闭测试,并预告于 10 月正式发布,支持最长 30 秒视频生成。官方介绍了稳定动态运动、立体声、高准确度口型同步、4K 分辨率和 10-bit HDR 输出等升级。Johnson Sheng 的商业制作实测显示,模型可用主体与场景素材生成单条 30 秒打斗镜头,并在快速运镜、复杂动作和道具跨镜头一致性测试中保持稳定。

    推荐理由:文章以商业广告实测为主线,呈现 Kling 4.0 在动态镜头、30 秒长镜头和商品跨镜头一致性上的具体表现,可供创作流程评估参考。

  2. arXiv · 多模态、视频与世界模型66

    PRISM:用范畴论测量和优化多模态类比

    论文提出 PRISM(Pullback Refinement via Interpretable Structural Mapping),用基于范畴论的显式关系映射和 pullback score 衡量多模态类比的关系对齐。在 AnaloBench 上,仅依据 pullback score 选择正确类比的准确率为 82.5%;迭代修正也提升了视觉隐喻的一致性与恰当性,但可能偏向视觉更拥挤的构图。

  3. arXiv · 多模态、视频与世界模型80

    DiVid 诊断视频生成模型的分维度多样性坍缩

    论文提出 DiVid,将视频生成多样性拆分为语义、风格、主体、场景、运动和摄影机六个维度。对代表性视频生成模型的系统评测显示,模型可能拥有较高全局多样性分数,却在运动和摄影机等因素上坍缩;这些差异在过滤不忠实生成后仍然存在。受控提示词实验进一步归纳出默认模式收敛和实现缺口两类瓶颈,框架计划发布以支持后续研究。

    推荐理由:DiVid将视频多样性拆成六个维度,并区分默认模式收敛与实现缺口,可为评测和训练目标设计提供更细的定位框架。

  4. arXiv · 多模态、视频与世界模型79

    MosaiChunk:用时空记忆拼接提升自回归视频生成的一致性

    MosaiChunk提出一种时空记忆机制,将跨空间与时间选择的历史KV条目组成马赛克,以帮助自回归视频生成在长时生成中保留对象和场景细节。该方法冻结视频生成器,仅训练一个轻量路由器,并发布包含T2V和I2V划分的RememBench;在匹配的记忆预算下,其重访一致性优于滑动窗口推理和整块检索。

    推荐理由:MosaiChunk展示了在固定活跃记忆预算下,通过选择历史KV片段提升长时视频重访一致性的实现思路。

  5. arXiv · 多模态、视频与世界模型85

    4Director:用刚性 3D 几何控制视频世界模型

    论文提出4Director,一种以显式4D场景表示控制相机和物体运动的视频世界模型。它为每个物体重建规范网格,并为每帧指定刚性变换,再通过Motion Adapter生成视角一致的外观、光照和非刚性动态。

    推荐理由:论文将刚性3D几何、视频生成和身份保持评测结合,为可控视频世界模型的设计与比较提供了具体参考。

  6. arXiv · 多模态、视频与世界模型82

    HiPhy:通过层级对齐实现符合物理规律的多原理视频生成

    HiPhy提出一种基于强化学习的层级物理对齐框架,使视频生成同时遵循多个物理原理并保持场景的物理与语义一致性。研究构建了包含 50K 提示词的数据集和 MultiPhyBench 基准,实验显示 HiPhy 在多个基准上显著优于既有方法,涉及多种并发物理原理的场景提升最大。

    推荐理由:论文将物理规律拆分为局部动态与全局场景一致性目标,并用 MultiPhyBench 支持多物理原理视频生成的比较评估。

  7. The Decoder78

    Black Forest Labs 发布 Flux 3 Image,支持不改变其他区域的多步编辑

    Black Forest Labs 发布 Flux 3 Image,主打在多步编辑中保持图像其他区域不变,并支持文生图、图生图、文字渲染和写实图像。模型支持用边界框构图、最多加入 10 张参考图,输出最高 4K;免费演示已开放,API 在 10 月 8 日前五折,商业权重可授权企业在自有基础设施上运行和微调,开放权重预计未来几周发布。

    推荐理由:Flux 3 Image 将多步局部编辑、参考图和边界框构图结合起来,适合评估图像工作流中的可控性与商品或角色保真需求。

  8. Luma · 创作产品与实践50

    2026 年建筑师最佳 AI 渲染工具

    2026 年建筑师的 AI 渲染工具选择正从试验转向工作流决策,重点比较建筑信息建模集成、画质与设计修改能力;44% 的建筑师已用 AI 制作概念图,74% 计划增加使用。Luma 以 Ray 3.2、图层编辑、场景变换和可重复工作流覆盖从概念图到动画制作;Veras 可直接连接 Revit、SketchUp、Rhino 等六个平台,Enscape 则提供实时渲染与虚拟现实漫游。

  9. Luma · 创作产品与实践28

    2026 年最适合儿童内容的 AI 卡通视频生成器

    面向儿童内容的 AI 卡通视频生成器,核心不是单个片段的惊艳效果,而是跨集保持角色外观、声音和风格一致,并支持高频完成系列制作。Luma 的 Ray 3.2 提供电影级视频、多关键帧序列和精确摄像机控制;Luma Skills 可保存并重复执行从脚本到角色设置再到成片的工作流。LongStories.ai 的 Universe 支持最长 15 分钟的一致角色视频。

  10. arXiv · 多模态、视频与世界模型85

    Memorizon:训练超越上下文窗口的世界模型

    论文《Memorizon》提出一种超越上下文窗口训练世界模型的方法,将长跨度重访监督与完整序列注意力解耦。训练样本可覆盖任意长度,但只对最后 k 个 chunks 评分,各 chunk 按相机共视关系检索自身的 top-K latents,共享 bank 上限为 kK;跨度从 100 s 增至 400 s 时,单步耗时增加 12%。

    推荐理由:论文将长跨度重访监督与完整序列注意力解耦,为训练世界模型的时序一致性提供了可复用的检索式方案和成本参考。

  11. arXiv · 多模态、视频与世界模型81

    Soundwich:用分层可控音频生成与视频同步

    Soundwich 提出一种无需训练的框架,将冻结的联合音视频 flow-matching 模型转化为可生成多条同步、可独立编辑音频轨道的系统。框架通过共享场景表示传递全局视听上下文,并让每条音频轨道与对应视觉来源进行跨模态交互,以保持声音与视频协调。论文称实验和人工评估显示其在时间控制、来源分离和自然度方面有所改善,生成的音频轨道可独立调整时序、静音、替换或重混。

    推荐理由:论文展示了如何在不训练新模型的情况下,把单一混音拆成可独立编辑的同步音频轨道,为音视频生成的后期重混与来源级控制提供参考。

  12. arXiv · 多模态、视频与世界模型66

    CF-JEPA 通过可控性分解提升 JEPA 世界模型鲁棒性

    论文提出 CF-JEPA,将 JEPA 世界模型的潜空间拆分为可控与不可控子空间,以隔离视觉背景干扰。该方法在 2D 和 3D 控制任务的正常条件下表现相当,并在受干扰条件下提升性能,且论文称其是唯一未出现潜表示坍塌的模型;作者还在模拟机器人任务中进行了验证。

  13. arXiv · 多模态、视频与世界模型69

    《视频生成模型的后训练与对齐》综述

    Chaoyu Li 等作者发表《视频生成模型的后训练与对齐》综述,系统梳理预训练视频模型的后训练与对齐方法。论文按隐式与显式对齐区分方法,并归纳为监督微调、自训练与蒸馏、偏好与奖励、推理时方法四类,同时总结数据集、基准和评测实践。文章还讨论可扩展奖励设计、长时域时序一致性、稳定性与表现力权衡,以及安全生成等开放问题。

  14. arXiv · 多模态、视频与世界模型77

    Align Then Reason 提出多语言唇形同步评判器,提升配音质检效果

    Rui Liu 等提出 Align Then Reason(ATR),用静音视频和候选文本判断配音台词的内容与时序是否匹配。在七语言基准上,ATR 相比对应的 Qwen3.5 SFT 基线,2B、4B 和 9B 推理器的平均 AUC 分别提升 59.4%、50.2% 和 50.8%。

    推荐理由:论文把逐帧唇部表征与候选台词的音素单元先做单调对齐,再交给 LLM 联合判断内容和时序,为无配音音频时的配音审片提供了可复用流程。

  15. arXiv · 多模态、视频与世界模型81

    论文提出 DynSC-Eval 评估长视频生成中的动态主体一致性

    论文提出 DynSC-Eval,通过动态跟踪视频中主体的可见生命周期,使用六项对象级指标评估局部连续性、全局身份保持和不一致事件。对5s、15s和60s视频生成的评测显示,传统指标会掩盖不同模型的主体一致性差异。

    推荐理由:论文将主体的可见生命周期纳入动态评测,并把一致性指标用于后训练,为长视频主体一致性的测量与优化提供了可复用思路。

  16. arXiv · 多模态、视频与世界模型82

    Ego2Act 提出面向目标驱动操作的第一视角视频生成评测基准

    论文作者提出 Ego2Act,用包含2,640段视频和110项日常任务的基准,评估模型根据初始场景图像和高层目标生成第一视角操作视频的能力。论文同时提出无参考评测流程 Ego2ActJudge,并发现模型常跳过或部分执行中间步骤,在复杂物体操作和持续世界建模中的细粒度物理动态表现不足。

    推荐理由:Ego2Act将多步物理操作和目标完成纳入视频生成评测,并提供无参考评测流程,便于比较模型的目标驱动模拟能力。

  17. ComfyUI · 工作流与实践77

    Comfy Agent 与 852話 Hakoniwa 如何创作动画短片《YUI》

    Comfy Agent 与 AI 动画艺术家 852話 Hakoniwa 共同完成了首部使用 Comfy Agent 创作的动画短片《YUI》。项目最终成片时长为 4:20,主要使用 Seedance 2.5 制作正片、MiniMax H3 制作幕后视频,并比较了 Wan 等视频模型。

    推荐理由:文章拆解了从角色设计、分镜准备到镜头重生成、模型比较和一致性检查的流程,并给出成本与工时参考。

10月1日周四
  1. arXiv · 多模态、视频与世界模型74

    PartiCam:通过奖励引导实现相机控制视频生成

    PartiCam 提出一种无需训练的相机控制视频生成方法,利用基于粒子过滤的全局与局部扩散奖励引导,使生成视频更准确地遵循指定相机轨迹。该方法基于 Sequential Monte-Carlo 引导加入局部细化阶段,在不重新训练模型的情况下改善轨迹遵循、减少漂移并提升视觉质量。

  2. arXiv · 多模态、视频与世界模型80

    为何传统世界模型难以学习元胞自动机?

    Shaoyang Guo 的研究发现,基于 Transformer 或卷积网络的自回归、扩散世界模型往往能预测多数像素,却难以完整复现元胞自动机的世界动力学。CNN 预测96.3%的细胞但仅完成18.9%的 rollout,联合扩散模型则未完成任何 rollout。

    推荐理由:论文用元胞自动机把世界模型的像素准确率与完整 rollout 区分开,并给出三类信息流修正,为时空一致性设计提供可复用的诊断框架。

  3. arXiv · 多模态、视频与世界模型76

    Radian:用表征空间对抗蒸馏增强自回归视频生成

    论文提出 Radian,通过冻结视觉基础模型提取多层视觉表征,并对自回归生成结果施加真实视频帧对抗监督,以改善细节退化、结构漂移和运动不稳定。基于 Wan2.1-1.3B 的实验显示,四步生成达到 VBench Total 0.8444 和 VideoAlign Total 0.8033,VBench-Long 从 0.7805 提升至 0.8041,且使用更少去噪步数。

    推荐理由:论文将视觉基础模型表征空间的对抗监督引入蒸馏,可为降低自回归视频生成中的时序误差传播提供一种训练思路。

  4. 可灵 · 模型与创作实践89

    可灵 Kling 4.0 进入早期访问,支持原生 30 秒生成与多参考控制

    可灵 Kling 4.0 进入早期访问,支持单次生成最长 30 秒视频、最多 15 个参考素材和最多 10 个关键帧。Kling 4.0 Flash 将于 9 月 28 日向 Ultra Yearly 订阅者开放,Kling 4.0 计划在 10 月扩大开放。新版本还加入音画同步、21:9 超宽画幅和更精细的视频编辑,10-bit HDR 输出将在后续提供。

    推荐理由:这次更新把长视频生成、多参考控制和时间线工作流放在同一升级中,适合比较连续叙事与商品广告制作的可控性。

  5. arXiv · 多模态、视频与世界模型78

    Audible World Models 提出面向 3D 世界的空间感知声音生成框架

    论文提出 Audible World Models,一种 training-free 框架,可从文本提示构建全景 3D proxy,将声音源锚定到重建几何,并根据听者视点和运动渲染空间音频。对 80 个生成场景的实验显示,该方法在空间一致性上优于文本、视频和全景图条件基线,同时保持有竞争力的语义对齐;论文已被 NeurIPS 2026 接收。

    推荐理由:论文将声音源位置、3D 几何与几何声学传播纳入世界状态,为构建随观察者移动而变化且保持空间一致性的多模态世界模型提供了可复用路线。

  6. arXiv · 多模态、视频与世界模型80

    LongTake:学习在长时域视频生成中维持动态

    LongTake提出由 Long-Horizon Teacher Forcing 和 DMD 构成的两阶段训练流程,让自回归视频扩散模型基于长真实视频前缀预测后续帧,以维持长时域生成中的场景动态和视觉质量。在相同的五秒 DMD 训练设置下,该初始化在30秒生成中以相近美学质量获得更高动态程度;Hybrid DMD 在30秒和60秒自回滚评测中取得被评估方法中的最高动态程度。

    推荐理由:Long-Horizon Teacher Forcing 将长视频真实前缀引入训练,结合 Hybrid DMD,为提升长时域生成的动态持续性和画质提供了可复用的训练思路。

  7. arXiv · 多模态、视频与世界模型71

    Exo2EgoHOI:面向手物交互保持的第三人称到第一人称视频生成

    Exo2EgoHOI提出一种手物交互感知的视频生成框架,将第三人称操作视频转换为第一人称观察,以保持手物交互和对象一致性。该方法结合4D HOI先验、双分支残差适配器和分解式门控交叉注意力,在ARCTIC-HOI和Ego-Exo4D上进行实验;在ARCTIC-HOI上,相比对应最佳基线,object mIoU提升32.3%,MPJPE和PA-MPJPE分别降低34.7%和50.0%。

  8. arXiv · 多模态、视频与世界模型76

    EPIC:基于极线一致性的360°沉浸式立体视频生成

    EPIC提出一种零样本生成流程,将现有视频扩散模型扩展到4K立体360°视频生成。论文设计了感知极线几何的360°图像匹配指标,用于捕捉跨视角的时序与立体不一致,并在有限训练数据下进行直接偏好优化。

    推荐理由:论文将极线感知的360°图像匹配指标作为偏好信号,用于有限训练数据下的直接偏好优化,为沉浸式视频的一致性优化提供了可复用思路。

  9. arXiv · 多模态、视频与世界模型77

    研究提出 SEGUE,提升视频生成中途提示词切换的状态过渡

    该研究提出 SEGUE 框架,让视频生成器在中途切换提示词时先完成必要的状态过渡,再交还控制权给用户提示词。在包含 1,800 次切换的 OpenTrans-360 上,SEGUE 将整体得分从 0.866 提升至 0.887,并在八项过渡指标中均排名第一;其规划器也能迁移到无需重新训练的冻结自回归生成器。

    推荐理由:论文将中途提示词切换拆解为带状态和时长的过渡,并用两个基准展示了对生成连贯性与指令响应的改善。

  10. arXiv · 多模态、视频与世界模型76

    FrameMorrow:用前瞻 tokens 指导长时视频生成中的帧选择

    论文提出 FrameMorrow,通过预测代表未来信息需求的少量 prospective tokens,从历史中选择相关帧,以支持长时视频生成。该方法选择显式历史帧而非模型内部状态,可接入包括闭源模型在内的不同生成器,并在 5 个基准、11 个生成模型上评估了长视频生成、交互生成和动作条件世界模型任务,报告了长程一致性、视觉质量与动作对齐的持续提升。

    推荐理由:论文把历史选择从当前相关性转向未来信息需求,并以显式历史帧接入不同生成器,为长视频和交互生成的记忆设计提供了可复用思路。

  11. arXiv · 多模态、视频与世界模型79

    BadAction:通过动作引导触发器攻击交互式视频生成

    论文提出 BadAction,用预定义动作模式作为后门触发器,使交互式视频生成模型在触发后生成不再响应后续动作的冻结未来帧,同时保持对正常动作序列的行为。实验显示,动作单模态触发器的平均攻击成功率为 91.0%,多模态触发器为 80.4%;该方法还成功绕过现有后门检测方法,暴露交互式视频生成流程中的安全缺口。

    推荐理由:论文把交互式视频生成的攻击面具体化为动作序列触发器,并给出攻防实验,便于评估模型在可控生成场景中的安全边界。

  12. arXiv · 多模态、视频与世界模型71

    超越预测:用回顾性世界建模引导 VLM 智能体

    这篇论文提出回顾性世界建模,让 VLM 智能体根据状态转移反向估计最可能导致该转移的动作。作者进一步设计自洽奖励,将策略动作与回顾性解释之间的一致性转化为强化学习中的逐转移反馈;实验显示,该方法相比仅使用前向世界建模的基线提升了策略的鲁棒性和泛化能力。

  13. arXiv · 多模态、视频与世界模型75

    UACD:面向少步视频生成的不确定性感知一致性蒸馏

    Lingyu Liu 提出不确定性感知一致性蒸馏方法 UACD,通过局部不确定性估计降低高难度时空区域的一致性监督权重。结合特征空间对抗训练、语义对齐和 LoRA 适配后,50步 Wan 模型实现了4步视频生成,在 VBench 2.0 上取得 0.556 mean score,并在用户研究中获得更高偏好。

  14. arXiv · 多模态、视频与世界模型80

    MindWorldBench:评估图生视频中的心理状态到行为推理

    Ruiqi Li 等人提出 MindWorldBench,评估图生视频模型根据心理状态生成行为的能力。该基准使用 Zero-Action Prompting 和包含 744 个提示的反事实设计,并对 11 个模型进行评测。结果显示,模型虽然具备视觉保真度和物理推理能力,但难以让行为与潜在心理状态一致,常出现偏向客观世界状态而非人的主观信念的 Omniscient Bias。

    推荐理由:论文用 744 个反事实提示评估图生视频的心理状态到行为推理,并揭示模型偏向客观世界状态的失败模式。