跳到正文

#视频

今日 3 条
今天10月3日周六
  1. 沐阳12

    很棒的作品!有点《灵笼》的味道!! 对了,推荐一部动漫——— 《灵笼》!

    引用Foyege@Magncsans

    十天时间,个人手搓300多个分镜,消耗十万积分! 做出的“爱死机”克苏鲁科幻片《Onyx》 本视频80%由白模辅助生成 近未来AI突然自己进化出了血肉之驱 并且除了可以蒸馏人类的知识,甚至还开始“蒸馏”人类的肉身 它继承的越来越多,我们存在的理由却越来越少 当机械的心脏长出血肉 最后,人类成了新生命的养料

  2. 宝玉12

    宝玉回应如何保持高质量高频分享,称自己大量使用 AI 并把经验分享出来,习惯把日常零散的点串起来,每次输出都是前一次积累的结果。他举例刷到 Shivon Zilis 八卦后,用 Opus 5.5 尝试剪辑八卦视频,发现效果还可以,便顺手把结果和提示词一起分享,写作成本低更容易坚持分享。

    引用熵减zz@shangjian_zz

    @dotey 宝玉老师怎么做到这么高质量和频率的分享的🥹 我感觉我每次踩完坑或者实践中想到了好点子,往往在过程中就把多巴胺耗尽了,真正总结输出的时候又不够结构化,也没有那么有分享欲了,效率很低。 求教宝玉老师

  3. 宝玉29

    宝玉尝试用 Opus 5.5 制作吃瓜视频,全程由模型自己找素材、自己配音,配音使用 Gemini 3.8 Flash TTS(自备 API Key),并产出了英文和中文两个版本。

    引用Shivon Zilis@shivon

    It’s hard to go from in love to let go in a week with no warning, but that’s just how it is sometimes 🤷🏻‍♀️ I feel happy that I got to show Elon how it feels to be deeply understood, nurtured, and peacefully loved with stability and gentleness. Given the tumultuous nature of his early life, his often tortured soul, and how hard he fights for humanity I wanted him to feel the deepest and most stable form of love this world can provide. My heart is full knowing I got to do that, and I hope it leaves a lasting good effect. We were always his safe space. A place where all of us were overjoyed to see him and one that was always full of happiness and love, not war, in contrast to his otherwise militant existence (a needed break from the battlefield where he could recharge his heart and soul before heading back out) I loved being that counterbalancing place of safety, sense of calm, and love — and delighted in bringing a smile back to his face when he was down. I will miss him dearly. I’ve loved him more than life itself and he’s taught me 100 lifetimes of knowledge and made my cup overflow with life meaning, so there is a lot of loss, but luckily we created four beautiful little loves of my life ❤️❤️❤️❤️ I am so beyond grateful for our children and they make every single day the best day of my life! I do hope and pray he and I can be great friends and coparents. I’m hurting, but care deeply about E and will always be cheering for his happiness. God speed, Elon, the world is lucky to have you.

10月2日周五
  1. 可灵 · 模型与创作实践73

    Kling 4.0 开启封闭测试,预告 10 月正式发布

    Kling 4.0 现已进入封闭测试,并预告于 10 月正式发布,支持最长 30 秒视频生成。官方介绍了稳定动态运动、立体声、高准确度口型同步、4K 分辨率和 10-bit HDR 输出等升级。Johnson Sheng 的商业制作实测显示,模型可用主体与场景素材生成单条 30 秒打斗镜头,并在快速运镜、复杂动作和道具跨镜头一致性测试中保持稳定。

    推荐理由:文章以商业广告实测为主线,呈现 Kling 4.0 在动态镜头、30 秒长镜头和商品跨镜头一致性上的具体表现,可供创作流程评估参考。

  2. arXiv · 多模态、视频与世界模型84

    Oneira:从开放式生成走向视频世界模型的开放世界交互

    Oneira提出一种通过显式世界状态连接生成与交互的视频世界模型,使新生成或发现的对象能够被纳入可操作环境。编码智能体根据观察和动作读取、更新世界状态,并将交互结果持续带入后续视频片段;实验显示,模型可与新生成对象直接且一致地交互,并在较长时间范围内保留此前交互的影响。

    推荐理由:论文将视频世界模型的交互能力拆分为开放世界交互与持久状态,为评估生成环境能否支持长期可控探索提供了具体框架。

  3. arXiv · 多模态、视频与世界模型79

    MosaiChunk:用时空记忆拼接提升自回归视频生成的一致性

    MosaiChunk提出一种时空记忆机制,将跨空间与时间选择的历史KV条目组成马赛克,以帮助自回归视频生成在长时生成中保留对象和场景细节。该方法冻结视频生成器,仅训练一个轻量路由器,并发布包含T2V和I2V划分的RememBench;在匹配的记忆预算下,其重访一致性优于滑动窗口推理和整块检索。

    推荐理由:MosaiChunk展示了在固定活跃记忆预算下,通过选择历史KV片段提升长时视频重访一致性的实现思路。

  4. arXiv · 多模态、视频与世界模型85

    4Director:用刚性 3D 几何控制视频世界模型

    论文提出4Director,一种以显式4D场景表示控制相机和物体运动的视频世界模型。它为每个物体重建规范网格,并为每帧指定刚性变换,再通过Motion Adapter生成视角一致的外观、光照和非刚性动态。

    推荐理由:论文将刚性3D几何、视频生成和身份保持评测结合,为可控视频世界模型的设计与比较提供了具体参考。

  5. arXiv · 多模态、视频与世界模型83

    World Observer 通过联合演员与观察者生成实现持久世界建模

    论文提出 World Observer,通过联合生成面向智能体视角的演员和观察选定区域的全景观察者,让离开演员视野的物体继续演化并在重新进入时恢复更新后的状态。该方法基于共享全景源进行几何对应,并引入高分辨率透视参考的 Observer Sink,同时提出用于评估视野外演化的世界空间指标和覆盖真实、合成场景的基准。

    推荐理由:论文将视角外物体的持续演化转化为可观测、可评测的问题,为世界模型的空间覆盖与状态保持提供了具体设计和基准。

  6. arXiv · 多模态、视频与世界模型82

    HiPhy:通过层级对齐实现符合物理规律的多原理视频生成

    HiPhy提出一种基于强化学习的层级物理对齐框架,使视频生成同时遵循多个物理原理并保持场景的物理与语义一致性。研究构建了包含 50K 提示词的数据集和 MultiPhyBench 基准,实验显示 HiPhy 在多个基准上显著优于既有方法,涉及多种并发物理原理的场景提升最大。

    推荐理由:论文将物理规律拆分为局部动态与全局场景一致性目标,并用 MultiPhyBench 支持多物理原理视频生成的比较评估。

  7. Luma · 创作产品与实践53

    2026 年游戏与电影 AI 预告片生成工具评测指南

    Luma 发布指南,比较游戏与电影 AI 预告片生成工具在概念创作、镜头生成、修订、本地化和交付环节的差异。文章指出 Luma 适合物理运动与局部编辑,Mootion 可从单一提示词生成完整预告片,Runway Gen-4 侧重电影感镜头,Veo 3/3.1 支持与视频同步生成音频,Kling AI 3.0 可生成最长 3 分钟的连续视频。

  8. Luma · 创作产品与实践28

    2026 年最适合儿童内容的 AI 卡通视频生成器

    面向儿童内容的 AI 卡通视频生成器,核心不是单个片段的惊艳效果,而是跨集保持角色外观、声音和风格一致,并支持高频完成系列制作。Luma 的 Ray 3.2 提供电影级视频、多关键帧序列和精确摄像机控制;Luma Skills 可保存并重复执行从脚本到角色设置再到成片的工作流。LongStories.ai 的 Universe 支持最长 15 分钟的一致角色视频。

  9. arXiv · 多模态、视频与世界模型81

    Soundwich:用分层可控音频生成与视频同步

    Soundwich 提出一种无需训练的框架,将冻结的联合音视频 flow-matching 模型转化为可生成多条同步、可独立编辑音频轨道的系统。框架通过共享场景表示传递全局视听上下文,并让每条音频轨道与对应视觉来源进行跨模态交互,以保持声音与视频协调。论文称实验和人工评估显示其在时间控制、来源分离和自然度方面有所改善,生成的音频轨道可独立调整时序、静音、替换或重混。

    推荐理由:论文展示了如何在不训练新模型的情况下,把单一混音拆成可独立编辑的同步音频轨道,为音视频生成的后期重混与来源级控制提供参考。

  10. arXiv · 多模态、视频与世界模型68

    多模态 LLM 视频标注的有效性与成本评估

    研究者系统评估短视频 VLM 标注中的采样、图像网格和单模态等启发式方法,比较分类准确率、下游推断有效性与每视频 token 成本。结果显示,准确率最高的配置可能导出错误结论,文本单模态也可能取得较强表现;通过简单镜头切换检测构建的单个 2×8 图像网格,其 κ 值与全视频理解相差不超过 .05,token 成本约为后者的 15%。

  11. arXiv · 多模态、视频与世界模型69

    《视频生成模型的后训练与对齐》综述

    Chaoyu Li 等作者发表《视频生成模型的后训练与对齐》综述,系统梳理预训练视频模型的后训练与对齐方法。论文按隐式与显式对齐区分方法,并归纳为监督微调、自训练与蒸馏、偏好与奖励、推理时方法四类,同时总结数据集、基准和评测实践。文章还讨论可扩展奖励设计、长时域时序一致性、稳定性与表现力权衡,以及安全生成等开放问题。

  12. arXiv · 多模态、视频与世界模型81

    论文提出 DynSC-Eval 评估长视频生成中的动态主体一致性

    论文提出 DynSC-Eval,通过动态跟踪视频中主体的可见生命周期,使用六项对象级指标评估局部连续性、全局身份保持和不一致事件。对5s、15s和60s视频生成的评测显示,传统指标会掩盖不同模型的主体一致性差异。

    推荐理由:论文将主体的可见生命周期纳入动态评测,并把一致性指标用于后训练,为长视频主体一致性的测量与优化提供了可复用思路。

  13. arXiv · 多模态、视频与世界模型82

    Ego2Act 提出面向目标驱动操作的第一视角视频生成评测基准

    论文作者提出 Ego2Act,用包含2,640段视频和110项日常任务的基准,评估模型根据初始场景图像和高层目标生成第一视角操作视频的能力。论文同时提出无参考评测流程 Ego2ActJudge,并发现模型常跳过或部分执行中间步骤,在复杂物体操作和持续世界建模中的细粒度物理动态表现不足。

    推荐理由:Ego2Act将多步物理操作和目标完成纳入视频生成评测,并提供无参考评测流程,便于比较模型的目标驱动模拟能力。

  14. ComfyUI · 工作流与实践77

    Comfy Agent 与 852話 Hakoniwa 如何创作动画短片《YUI》

    Comfy Agent 与 AI 动画艺术家 852話 Hakoniwa 共同完成了首部使用 Comfy Agent 创作的动画短片《YUI》。项目最终成片时长为 4:20,主要使用 Seedance 2.5 制作正片、MiniMax H3 制作幕后视频,并比较了 Wan 等视频模型。

    推荐理由:文章拆解了从角色设计、分镜准备到镜头重生成、模型比较和一致性检查的流程,并给出成本与工时参考。

10月1日周四
  1. arXiv · 多模态、视频与世界模型74

    PartiCam:通过奖励引导实现相机控制视频生成

    PartiCam 提出一种无需训练的相机控制视频生成方法,利用基于粒子过滤的全局与局部扩散奖励引导,使生成视频更准确地遵循指定相机轨迹。该方法基于 Sequential Monte-Carlo 引导加入局部细化阶段,在不重新训练模型的情况下改善轨迹遵循、减少漂移并提升视觉质量。

  2. arXiv · 多模态、视频与世界模型76

    Radian:用表征空间对抗蒸馏增强自回归视频生成

    论文提出 Radian,通过冻结视觉基础模型提取多层视觉表征,并对自回归生成结果施加真实视频帧对抗监督,以改善细节退化、结构漂移和运动不稳定。基于 Wan2.1-1.3B 的实验显示,四步生成达到 VBench Total 0.8444 和 VideoAlign Total 0.8033,VBench-Long 从 0.7805 提升至 0.8041,且使用更少去噪步数。

    推荐理由:论文将视觉基础模型表征空间的对抗监督引入蒸馏,可为降低自回归视频生成中的时序误差传播提供一种训练思路。

  3. arXiv · 多模态、视频与世界模型46

    Social-WM:面向机器人社交导航的安全感知潜在世界模型

    Social-WM 提出一种基于第一视角 RGB 视频训练的高效潜在世界模型规划框架,通过预测动作实际执行后的未来并建模可实现性,在执行前评估社交导航安全风险。在 Social-HM3D 上成功率达 63.77%,人类碰撞率降至 21.67%,无需显式行人跟踪、特权人类状态或在线强化学习,并能零样本迁移至 Social-MP3D。

  4. arXiv · 多模态、视频与世界模型79

    LOCI:面向流式世界模型的空间线性记忆

    Ji Xia 等人提出 LOCI,一种结合 key-value cache 与循环线性注意力记忆的空间记忆架构,用于让视频世界模型更准确地复现摄像机重访区域。

    推荐理由:LOCI 将可保留视觉细节的 key-value cache 与线性循环记忆结合,为长视频中的场景重访和显存控制提供了具体架构参考。

  5. 可灵 · 模型与创作实践89

    可灵 Kling 4.0 进入早期访问,支持原生 30 秒生成与多参考控制

    可灵 Kling 4.0 进入早期访问,支持单次生成最长 30 秒视频、最多 15 个参考素材和最多 10 个关键帧。Kling 4.0 Flash 将于 9 月 28 日向 Ultra Yearly 订阅者开放,Kling 4.0 计划在 10 月扩大开放。新版本还加入音画同步、21:9 超宽画幅和更精细的视频编辑,10-bit HDR 输出将在后续提供。

    推荐理由:这次更新把长视频生成、多参考控制和时间线工作流放在同一升级中,适合比较连续叙事与商品广告制作的可控性。

  6. arXiv · 多模态、视频与世界模型80

    LongTake:学习在长时域视频生成中维持动态

    LongTake提出由 Long-Horizon Teacher Forcing 和 DMD 构成的两阶段训练流程,让自回归视频扩散模型基于长真实视频前缀预测后续帧,以维持长时域生成中的场景动态和视觉质量。在相同的五秒 DMD 训练设置下,该初始化在30秒生成中以相近美学质量获得更高动态程度;Hybrid DMD 在30秒和60秒自回滚评测中取得被评估方法中的最高动态程度。

    推荐理由:Long-Horizon Teacher Forcing 将长视频真实前缀引入训练,结合 Hybrid DMD,为提升长时域生成的动态持续性和画质提供了可复用的训练思路。

  7. arXiv · 多模态、视频与世界模型76

    EPIC:基于极线一致性的360°沉浸式立体视频生成

    EPIC提出一种零样本生成流程,将现有视频扩散模型扩展到4K立体360°视频生成。论文设计了感知极线几何的360°图像匹配指标,用于捕捉跨视角的时序与立体不一致,并在有限训练数据下进行直接偏好优化。

    推荐理由:论文将极线感知的360°图像匹配指标作为偏好信号,用于有限训练数据下的直接偏好优化,为沉浸式视频的一致性优化提供了可复用思路。

  8. arXiv · 多模态、视频与世界模型77

    研究提出 SEGUE,提升视频生成中途提示词切换的状态过渡

    该研究提出 SEGUE 框架,让视频生成器在中途切换提示词时先完成必要的状态过渡,再交还控制权给用户提示词。在包含 1,800 次切换的 OpenTrans-360 上,SEGUE 将整体得分从 0.866 提升至 0.887,并在八项过渡指标中均排名第一;其规划器也能迁移到无需重新训练的冻结自回归生成器。

    推荐理由:论文将中途提示词切换拆解为带状态和时长的过渡,并用两个基准展示了对生成连贯性与指令响应的改善。

  9. arXiv · 多模态、视频与世界模型76

    FrameMorrow:用前瞻 tokens 指导长时视频生成中的帧选择

    论文提出 FrameMorrow,通过预测代表未来信息需求的少量 prospective tokens,从历史中选择相关帧,以支持长时视频生成。该方法选择显式历史帧而非模型内部状态,可接入包括闭源模型在内的不同生成器,并在 5 个基准、11 个生成模型上评估了长视频生成、交互生成和动作条件世界模型任务,报告了长程一致性、视觉质量与动作对齐的持续提升。

    推荐理由:论文把历史选择从当前相关性转向未来信息需求,并以显式历史帧接入不同生成器,为长视频和交互生成的记忆设计提供了可复用思路。

  10. arXiv · 多模态、视频与世界模型79

    BadAction:通过动作引导触发器攻击交互式视频生成

    论文提出 BadAction,用预定义动作模式作为后门触发器,使交互式视频生成模型在触发后生成不再响应后续动作的冻结未来帧,同时保持对正常动作序列的行为。实验显示,动作单模态触发器的平均攻击成功率为 91.0%,多模态触发器为 80.4%;该方法还成功绕过现有后门检测方法,暴露交互式视频生成流程中的安全缺口。

    推荐理由:论文把交互式视频生成的攻击面具体化为动作序列触发器,并给出攻防实验,便于评估模型在可控生成场景中的安全边界。

  11. arXiv · 多模态、视频与世界模型75

    UACD:面向少步视频生成的不确定性感知一致性蒸馏

    Lingyu Liu 提出不确定性感知一致性蒸馏方法 UACD,通过局部不确定性估计降低高难度时空区域的一致性监督权重。结合特征空间对抗训练、语义对齐和 LoRA 适配后,50步 Wan 模型实现了4步视频生成,在 VBench 2.0 上取得 0.556 mean score,并在用户研究中获得更高偏好。

  12. arXiv · 多模态、视频与世界模型80

    MindWorldBench:评估图生视频中的心理状态到行为推理

    Ruiqi Li 等人提出 MindWorldBench,评估图生视频模型根据心理状态生成行为的能力。该基准使用 Zero-Action Prompting 和包含 744 个提示的反事实设计,并对 11 个模型进行评测。结果显示,模型虽然具备视觉保真度和物理推理能力,但难以让行为与潜在心理状态一致,常出现偏向客观世界状态而非人的主观信念的 Omniscient Bias。

    推荐理由:论文用 744 个反事实提示评估图生视频的心理状态到行为推理,并揭示模型偏向客观世界状态的失败模式。

9月30日周三
  1. 可灵 · 模型与创作实践62

    2026 年 5 款 UGC 视频生成 AI 工具对比与 Kling AI 实践指南

    可灵发布一篇 2026 年 UGC 视频生成工具指南,对比 Kling AI、Higgsfield、Dreamina、HeyGen 和 CapCut 在场景生成、数字人呈现与视频组装等工作流中的适用方向,强调这不是基准排名。

    推荐理由:文章按产品场景、脚本呈现与后期组装拆分工具差异,并给出从参考素材到审片修复的 Kling AI UGC 工作流,便于评估商品保真与制作成本。

  2. 可灵 · 模型与创作实践71

    可灵 AI 四步将静态图片制作成短视频

    可灵介绍了使用 AI 将静态图片制作成短视频的四步流程,包括上传图片、描述运动、设置时长并生成,以及检查和优化结果。教程以 Kling VIDEO 3.0 Omni 为例,支持使用 Start Frame、End Frame 和 Element 参考,单次生成最长 15 秒,并提供多镜头、原生音频和常见问题修复方法。

    推荐理由:文章将图片转视频拆成选择运动对象、编写提示词、设置时长和复检四步,并给出起始帧与元素参考的使用方法。

  3. 可灵 · 模型与创作实践81

    Kling 4.0 与 3.0 有哪些不同

    Kling 4.0将于2026年10月正式发布,原生视频生成时长从3–15秒扩展至3–30秒,并支持最多10个关键帧。新版本还支持最多15个组合参考资产、10-bit HDR、双声道立体声和定向多模态视频编辑。Kling 4.0 Flash已于9月28日向有限用户开放提前体验。

    推荐理由:这篇对比把时长、关键帧、参考资产和视频编辑放在同一框架中,便于按项目复杂度选择 Kling 3.0 或 4.0。

  4. 可灵 · 模型与创作实践83

    Kling 4.0 AI 视频创作完整指南:多模态参考与30秒生成

    Kling 4.0完整模型计划于2026年10月发布,新创作体验自9月28日起向有限用户逐步开放早期访问。模型支持3至30秒原生视频生成、最多10个关键帧,以及最多15个组合参考素材,并提升运动稳定性、角色与商品一致性、音画同步和视频编辑能力。

    推荐理由:文章梳理了从多模态参考、关键帧到时间线审片的完整链路,可用于规划商品广告和短叙事视频的生成与修订流程。

  5. arXiv · 多模态、视频与世界模型76

    PRISM通过反事实视频生成扩展人形机器人移动操作训练

    PRISM提出一个真实到仿真再到真实框架,用少量真实视频生成大规模多样的人体与物体交互训练数据。研究通过视频到视频生成数百条反事实视频,再重建并调整人和物体的运动轨迹,训练出无需真实世界微调的策略。搭载该策略的人形机器人仅使用机载深度观测,就能在不同物体实例、尺寸和初始配置下完成箱子、桶、箱体和球的拾取、搬运与放下。

    推荐理由:PRISM展示了如何用少量真实交互视频生成反事实数据,并通过真实到仿真再到真实流程训练人形机器人的移动操作策略。