跳到正文

#视频

今日 3 条
9月7日周一
  1. Luma · 创作产品与实践59

    InVideo AI 2026:功能与局限

    Luma评测 InVideo AI 2026,指出它能从单条提示词完成脚本、素材、配音、字幕、音乐和剪辑,适合高频社媒与 YouTube 内容生产。文章称其整合 200+ AI models,并接入 Sora 2 和 VEO 3.1,但精确修改常需手动调整或重新生成。免费层每周提供 2–10 AI minutes 和 4 次带水印导出,且生成失败仍消耗 credits。

  2. Luma · 创作产品与实践79

    Sora 关停后,创意团队如何评估视频工作流替代方案

    OpenAI 已于 2026 年 4 月 26 日关闭 Sora 网页和应用,API 将于 2026 年 9 月 24 日停止,用户需在期限前导出数据。文章建议团队从工作流整合、关键帧控制、精准修改和专业导出格式等方面评估替代方案,并介绍 Luma Ray 3.2 的 16-keyframe 控制以及 HDR、EXR 导出能力。

    推荐理由:文章以 Sora 关停为背景,提醒创意团队从数据迁移、版本修订和最终交付等完整流程评估视频工具。

9月4日周五
9月3日周四
9月2日周三
8月28日周五
  1. ComfyUI · 工作流与实践66

    Gemini Omni 1.1 Flash 接入 ComfyUI:支持视频生成、编辑与 4K 输出

    Gemini Omni 1.1 Flash 通过 Partner Nodes 在 ComfyUI 上线,封装在 Gemini Video Omni 节点中,可从模型下拉菜单选择 Omni Flash 1.1,在单个节点内完成文生视频、图生视频、参考生视频、视频编辑和场景延展。

    推荐理由:ComfyUI 接入 Gemini Omni 1.1 Flash 的节点参数与提示词写法,可供视频生成与编辑工作流选型参考。

8月26日周三
8月25日周二
  1. ComfyUI · 工作流与实践87

    Wan 3.0 接入 ComfyUI,支持原生 30 秒视频与 Omni-Reference 控制

    Alibaba 的 Wan 3.0 已接入 ComfyUI,支持原生生成最长 30 秒的视频,并提供 Omni-Reference 控制。模型支持 480p、720p 和 1080p,可使用最多 10 张图片、5 个视频和 5 段音频等参考素材,还支持视频编辑与扩展。使用这些功能需将 ComfyUI 更新至 v0.33.4,或访问 Comfy Cloud。

    推荐理由:原文同时给出时长、参考素材和分辨率选项,便于评估 Wan 3.0 在长镜头、多素材控制与低成本草稿中的工作流价值。

8月21日周五
  1. Black Forest Labs · 图像与视频71

    Black Forest Labs 发布 FLUX Video Upscale,支持最高原生 4K

    Black Forest Labs 推出 FLUX Video Upscale,作为独立的 FLUX Tool 和 endpoint,可将 480p 起的视频重新生成到最高原生 4K,并原生理解 FLUX 3 的输出,修复通用放大器容易遗漏的模糊人脸、水面和草地纹理网格伪影。

    推荐理由:官方给出两种模式的价格与倍率差异,便于按交付分辨率在成本与修复细节之间取舍。

8月20日周四
  1. Diffusers · Releases62

    Diffusers 0.40.0 发布:新增 LTX-2.5、MiniMax-H3 等管线并支持张量并行

    Diffusers 0.40.0 发布,新增 LTX-2.5、MiniMax-H3、MiniMax Music 3、Stable Audio 3、Wan-Animate-2、JoyAI-Image-Edit-Plus 等管线,Modular Diffusers 结束实验阶段转为稳定支持。

    推荐理由:Diffusers 0.40.0 的发布说明列出了新增视频与音频管线、张量并行和量化后端,可据此判断多模态生成与部署选型。

  2. ComfyUI · 工作流与实践77

    ComfyUI 与 MiniMax 发起 H3 音画同步社区挑战赛

    ComfyUI 与 MiniMax 团队发起 H3 音画同步社区挑战赛,要求参赛者用 H3 在同一轮生成视频和同步音频,作品最长 90 秒且每人限投一次。参赛者还需提交实际的 ComfyUI `.json` 工作流,活动支持本地运行或 Comfy Cloud,9/2 公布结果。

    推荐理由:挑战同时要求 H3 在同一轮生成音频与视频,并提交可复现的 ComfyUI 工作流,呈现了音画同步创作的实践约束。

8月12日周三
  1. ComfyUI · 工作流与实践80

    ComfyUI 首日支持 LTX-2.5 开放视频模型

    ComfyUI 在 LTX-2.5 发布当天提供支持,该模型是 LTX 最新开放视频模型,权重可下载并在本地 GPU 运行,也可通过 Partner Nodes 使用托管版本。

    推荐理由:LTX-2.5 在 ComfyUI 的 Day-0 支持给出了开放权重与托管两条路径,可据此判断本地视频生成的可控性与部署成本。

8月8日周六
  1. ComfyUI · 工作流与实践78

    Seedance 2.5 通过 Partner Nodes 上线 ComfyUI

    Seedance 2.5 通过 Partner Nodes 在 ComfyUI 上线,单次生成一段连续 30 秒视频,无需拼接短片。单次生成最多可接入 50 个参考素材,包括 30 张图片、10 个视频和 10 个音频文件,参考素材可在提示词中逐条指定。

    推荐理由:ComfyUI 接入 Seedance 2.5 后,可据此判断单次 30 秒连续生成与 50 个参考素材对现有分镜拼接流程的替代空间。

  2. ComfyUI · Releases78

    ComfyUI v0.31.0 更新,新增 Wan-Animate2、Flux 3 视频和 SeeDance 2.5 支持

    ComfyUI 发布 v0.31.0,新增 Wan-Animate2、Flux 3 视频模型和 SeeDance 2.5 支持,并改进多项 MiniMax H3 与音频处理。版本还加入 ImageCompositor 节点、Bloom 2 和 Wonder 3.5 支持,并对 LTX、Wan 做加速;同时修复 Linux 内存、采样器和 MiniMax H3 相关问题。

    推荐理由:该版本集中带来视频、图像合成与音频处理更新,读者可据新增节点、模型接入和性能修复安排升级。

8月6日周四
8月4日周二
  1. Black Forest Labs · 图像与视频80

    Black Forest Labs 发布 FLUX 3 Video,支持文生视频与图生视频

    Black Forest Labs 通过 BFL API 和部分合作方开放 FLUX 3 Video 生成能力的初始版本,可生成最长 20 秒的 HD 视频并同步生成原生音频,Full HD 通过超分输出。

    推荐理由:官方给出 FLUX 3 Video 的生成能力、分辨率与草稿模式,可据此判断多模态视频生成在创作流程中的可用边界。

8月3日周一
  1. ComfyUI · 工作流与实践89

    MiniMax H3 发布并获 ComfyUI Day-0 支持,开放权重支持原生音频与 2K 视频

    MiniMax H3 今日发布开放权重,并在 ComfyUI 中获得 Day-0 原生支持,可接收文本、图像、视频或音频,生成带立体声的 2K、最长 15 秒视频。

    推荐理由:文章把 H3 的多模态输入、原生立体声和 ComfyUI 本地运行路径放在一起,并给出显存缩减与工作流入口,便于评估视频创作部署成本。

7月31日周五
  1. ByteDance Seed · 视觉生成与编辑87

    字节 Seedance 2.5 正式发布:单次生成 30 秒、支持多轮延长

    字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.5,单次生成时长从 15 秒提升至 30 秒并支持多轮延长,延续 Seedance 2.0 统一的多模态音视频联合生成架构,重点突破长叙事、多模态参考和编辑能力。

    推荐理由:官方给出 30 秒单次生成、多模态参考与时间戳编辑的具体能力边界,可据此判断长叙事视频工作流的可用性。

7月29日周三
  1. ComfyUI · Releases79

    ComfyUI v0.29.0 发布,新增视频处理与多模型支持

    ComfyUI 发布 v0.29.0,更新视频转码、视频处理节点与训练支持,并新增 JoyImageEdit、Gemma4 12B、MageFlow 和 Wan 的 Uni3C Controlnet 原生支持。Partner Nodes 新增 GPT5.6、Gemini 3.5 Flash、Claude Opus 5、Recraft V4.1 等模型或节点,同时包含多项性能优化与修复。

    推荐理由:这次更新把视频处理、控制模型和第三方模型接入集中到同一版本,便于评估 ComfyUI 工作流的兼容范围与处理效率。

7月23日周四
  1. Black Forest Labs · 图像与视频78

    Black Forest Labs 发布多模态基础模型 FLUX 3,进入 Early Access

    Black Forest Labs 发布多模态基础模型 FLUX 3,进入 Early Access,联合学习图像、视频和音频,可混合模态生成图像与带音频的视频,单次生成视频最长 20 秒。

    推荐理由:FLUX 3 把图像、视频、音频与动作预测放进同一架构,并给出与多家视频模型的早期对比,可供多模态选型参考。

7月15日周三
  1. ComfyUI · Releases79

    ComfyUI v0.28.0 更新,新增 ByteDance 模型与 3D 节点并修复四个漏洞

    ComfyUI 发布 v0.28.0,新增 Seed Audio 1.0、Seedream 5 Pro、SeedVR2 支持以及 Save 3D (Advanced) 节点族。版本还修复了四个安全漏洞,改进 Qwen3-VL、自定义嵌入、视频音频流和 int4 模型等问题。

    推荐理由:该版本把模型接入、3D 工作流与安全修复集中在一次更新中,可用于评估 ComfyUI 对视频、图像和 3D 创作链路的覆盖变化。

7月3日周五
  1. Diffusers · Releases62

    Diffusers 0.39.0 发布:新增 Cosmos 3、Ideogram 4、Krea 2 等多条图像与视频管线

    Hugging Face Diffusers 发布 0.39.0,新增 Cosmos 3、Ideogram 4、Krea 2、DreamLite、PRX Pixel、Motif-Video、AnyFlow、JoyAI-Image-Edit、DiffusionGemma、Anima 等图像与视频管线。

    推荐理由:Diffusers 0.39.0 一次性接入 Cosmos 3、Ideogram 4、Krea 2 等十余条新管线,可据此判断各模型的开放方式与工程适配成本。

7月1日周三
6月24日周三
  1. ComfyUI · Releases83

    ComfyUI v0.26.0 发布

    ComfyUI 发布 v0.26.0,新增 Qwen3-VL 文本生成、Boogu-Image、Krea2、Load3DAdvanced 以及 LTX2 的 Context Windows sampling 支持。

    推荐理由:该版本把多种模型节点、分辨率支持和工作流基础设施集中到一次更新中,便于评估 ComfyUI 的模型接入与创作流程变化。

6月19日周五
5月18日周一
  1. Google DeepMind91

    Google DeepMind 发布 Gemini Omni,首个模型 Gemini Omni Flash 开始上线

    Google DeepMind 发布 Gemini Omni,并推出首个模型 Gemini Omni Flash,支持结合图像、音频、视频和文本输入生成视频。用户可通过自然语言多轮编辑视频,保持角色、物理效果和场景连续性。

    推荐理由:材料给出了多模态输入、连续对话编辑和时空一致性等能力,并交代订阅、免费入口与 API 计划,便于判断其创作工作流适配范围。

4月15日周三
  1. Replicate · 模型与制作实践76

    如何用 Seedance 2.0 制作出色视频

    Replicate 发布 Seedance 2.0 使用教程,介绍该模型可同时接收最多 9 张图片、3 段视频、3 个音频和文本提示,并用 [Image1]、[Audio1] 等标记在提示词中引用素材。

    推荐理由:通过参考素材组合、时间码分镜和音画同源三条实操路径,可迁移到需要角色一致性与多镜头调度的视频创作流程。

3月5日周四
2月12日周四
  1. ByteDance Seed · 视觉生成与编辑87

    字节 Seedance 2.0 正式发布,支持四种模态输入与音视频联合生成

    字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.0,采用统一的多模态音视频联合生成架构,支持文字、图片、音频、视频四种模态输入,可同时输入多达 9 张图片、3 段视频、3 段音频及自然语言指令。

    推荐理由:官方给出多模态参考、视频编辑与双声道音频的能力边界和失败项,可据此判断其在电商与影视流程中的可用位置。

12月16日周二
  1. ByteDance Seed · 视觉生成与编辑82

    字节 Seedance 1.5 pro 音视频创作模型正式发布

    字节 Seed 团队正式发布新一代音视频创作模型 Seedance 1.5 pro,支持文本到音视频合成与图像引导的音视频生成,已上线即梦AI和豆包。模型采用基于 MMDiT 的统一音视频联合生成框架,实现口型、语调与表演节奏的音画同步,原生支持中文、英文、日文、韩语、西班牙语、印尼语及四川话、粤语等方言。

    推荐理由:官方披露了音视频联合生成的架构与评测细节,可据此判断音画同步能力在短剧、广告等场景的可用边界。

12月8日周一
  1. Diffusers · Releases62

    Diffusers 0.36.0 发布:新增多条图像与视频管线、TaylorSeer 缓存和 kernels 注意力后端

    Hugging Face 的 Diffusers 发布 0.36.0,新增多条图像与视频管线,包括 Black Forest Labs 的 Flux2、6B 参数的 Z-Image、支持多图参考的 QwenImage Edit Plus、Bria FIBO、Kandinsky 5.0 Image Lite 和把图像编辑重构为视频生成任务的 ChronoEdit。

    推荐理由:Diffusers 0.36.0 一次性接入 Flux2、Z-Image、HunyuanVideo 1.5 等新管线并新增缓存与注意力后端,可据此判断生成工作流的升级路径。

11月17日周一
  1. ElevenLabs · 音频创作85

    ElevenLabs 发布 Image & Video(Beta),整合图像、视频与音频创作

    ElevenLabs 发布 Image & Video(Beta),将图像、视频和音频创作整合到同一平台工作流中。用户可调用 Veo、Sora、Kling、Wan、Seedance 等模型生成视频,也可使用 Nanobanana、Flux Kontext、GPT Image 和 Seedream 生成图像,并在 Studio 中完成配音、音乐、音效、口型同步、时间线调整和导出。

    推荐理由:将图像、视频生成与配音、音乐、音效及时间线编辑放进同一工作流,便于评估一站式多模态创作的实际覆盖范围。

10月16日周四
  1. Replicate · 模型与制作实践84

    Veo 3.1 提示词编写指南:参考生视频与首尾帧控制

    Replicate 介绍 Veo 3.1 的提示词编写方法,以及参考生视频、首尾帧生视频和增强图生视频功能。参考生视频最多接收三张图片并结合文本生成连贯场景,其余端点提供耗时低于 60 秒、价格约为标准版本一半的快速生成选项。

    推荐理由:文章把镜头构图、焦段、风格和运动等提示词要素,与参考图、首尾帧及快速版本的使用场景对应起来,便于设计可控的视频生成流程。

8月19日周二
  1. Diffusers · Releases90

    Diffusers 0.35.0 发布,新增 Qwen Image、Flux Kontext 和 Wan 2.2 管线

    Hugging Face 发布 Diffusers 0.35.0,新增 Wan 2.2、Flux-Kontext、Qwen-Image 和 Qwen-Image-Edit 等图像与视频管线。版本加入 Regional compilation,称可将编译时间减少 8–10x,并支持加速设备直接加载管线、分片并行加载和 GGUF CUDA kernels,后者预计带来约 10% 的推理速度提升。

    推荐理由:该版本同时覆盖新图像与视频管线、编译和加载优化,可帮助开发者比较模型接入方式与推理部署路径。

8月1日周五
  1. Replicate · 模型与制作实践60

    如何用图像提示 Veo 3:Replicate 实测风格保持与文字动画

    Replicate 发布 Veo 3 图像输入的使用技巧,实测显示模型能在动画中保持输入图的画风、滤镜和调色,并让文字在复杂背景中保持清晰可读。输入图始终作为视频首帧,可用提示词只动画局部元素、其余保持静止,也可先用 Ideogram 3.0 生成特定风格图再交给 Veo 3 做动作与运镜,从而把风格控制交给图像模型。

    推荐理由:Replicate 实测了 Veo 3 图像输入在风格保持、文字动画和局部动画上的表现,可据此调整参考图加提示词的创作流程。

7月31日周四
  1. Replicate · 模型与制作实践75

    Replicate 联合 Pruna AI 发布优化版 Wan 2.2 视频模型

    Replicate 与 Pruna AI 合作发布优化版 Wan 2.2,FAST 文生视频和图生视频 480p 每条 0.05 美元、720p 每条 0.10 美元,推理时间约 30 秒。未优化的图生视频 480p 每条 0.40 美元、720p 每条 1.00 美元,可通过 Replicate API 调用。Replicate 称未来几天将发布更多与 Pruna 的优化版本。

    推荐理由:Replicate 与 Pruna AI 优化的 Wan 2.2 给出了按条计费的视频生成价格与推理耗时,可据此评估低成本视频试错方案。

7月7日周一