InVideo AI 2026:功能与局限
Luma评测 InVideo AI 2026,指出它能从单条提示词完成脚本、素材、配音、字幕、音乐和剪辑,适合高频社媒与 YouTube 内容生产。文章称其整合 200+ AI models,并接入 Sora 2 和 VEO 3.1,但精确修改常需手动调整或重新生成。免费层每周提供 2–10 AI minutes 和 4 次带水印导出,且生成失败仍消耗 credits。
Luma评测 InVideo AI 2026,指出它能从单条提示词完成脚本、素材、配音、字幕、音乐和剪辑,适合高频社媒与 YouTube 内容生产。文章称其整合 200+ AI models,并接入 Sora 2 和 VEO 3.1,但精确修改常需手动调整或重新生成。免费层每周提供 2–10 AI minutes 和 4 次带水印导出,且生成失败仍消耗 credits。
Pika 2026 适合快速创意探索和短视频生成,但专业项目会受限于角色一致性、编辑控制和最长 5-10 秒的片段长度。平台基于 Pika 2.5,通常 60 到 90 秒完成生成,支持文本、静态图像和现有素材生成视频。免费版输出上限为 480p,并带有水印。
OpenAI 已于 2026 年 4 月 26 日关闭 Sora 网页和应用,API 将于 2026 年 9 月 24 日停止,用户需在期限前导出数据。文章建议团队从工作流整合、关键帧控制、精准修改和专业导出格式等方面评估替代方案,并介绍 Luma Ray 3.2 的 16-keyframe 控制以及 HDR、EXR 导出能力。
推荐理由:文章以 Sora 关停为背景,提醒创意团队从数据迁移、版本修订和最终交付等完整流程评估视频工具。
ComfyUI × MiniMax H3 Sync Sound Challenge 公布获奖结果,要求用 MiniMax H3 在 ComfyUI 中让音频与视频同一次生成产出,不得后期配乐或配音。
Synthesia 评测显示,其更适合企业培训等结构化 AI avatar 视频,而非生产级素材、产品发布或品牌营销。
Google DeepMind 推出智能体视频理解功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,官方称分析成本最多降低 66%、token 消耗最多降低 88%、准确率最多提升 7%。
推荐理由:官方给出 token 与成本降幅及可用入口,可据此评估长视频分析方案的选型与改造成本。
Gemini Omni 1.1 Flash 通过 Partner Nodes 在 ComfyUI 上线,封装在 Gemini Video Omni 节点中,可从模型下拉菜单选择 Omni Flash 1.1,在单个节点内完成文生视频、图生视频、参考生视频、视频编辑和场景延展。
推荐理由:ComfyUI 接入 Gemini Omni 1.1 Flash 的节点参数与提示词写法,可供视频生成与编辑工作流选型参考。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向开发者的生成视频控制能力。
推荐理由:官方给出场景延展、首尾帧插值与 4K 放大等具体控制项和定价入口,可据此判断生成视频工作流的可控性变化。
ComfyUI 发布 v0.34.0,新增 Wan 3.0 视频生成、Seedance 2.5 的 1080p 分辨率与视频延长 task_type、Gemini 3.7 Flash 文本节点、Flux Video Upscale、Meshy-7、Pixverse V6 等 Partner Nodes。
Alibaba 的 Wan 3.0 已接入 ComfyUI,支持原生生成最长 30 秒的视频,并提供 Omni-Reference 控制。模型支持 480p、720p 和 1080p,可使用最多 10 张图片、5 个视频和 5 段音频等参考素材,还支持视频编辑与扩展。使用这些功能需将 ComfyUI 更新至 v0.33.4,或访问 Comfy Cloud。
推荐理由:原文同时给出时长、参考素材和分辨率选项,便于评估 Wan 3.0 在长镜头、多素材控制与低成本草稿中的工作流价值。
Black Forest Labs 推出 FLUX Video Upscale,作为独立的 FLUX Tool 和 endpoint,可将 480p 起的视频重新生成到最高原生 4K,并原生理解 FLUX 3 的输出,修复通用放大器容易遗漏的模糊人脸、水面和草地纹理网格伪影。
推荐理由:官方给出两种模式的价格与倍率差异,便于按交付分辨率在成本与修复细节之间取舍。
Diffusers 0.40.0 发布,新增 LTX-2.5、MiniMax-H3、MiniMax Music 3、Stable Audio 3、Wan-Animate-2、JoyAI-Image-Edit-Plus 等管线,Modular Diffusers 结束实验阶段转为稳定支持。
推荐理由:Diffusers 0.40.0 的发布说明列出了新增视频与音频管线、张量并行和量化后端,可据此判断多模态生成与部署选型。
ComfyUI 与 MiniMax 团队发起 H3 音画同步社区挑战赛,要求参赛者用 H3 在同一轮生成视频和同步音频,作品最长 90 秒且每人限投一次。参赛者还需提交实际的 ComfyUI `.json` 工作流,活动支持本地运行或 Comfy Cloud,9/2 公布结果。
推荐理由:挑战同时要求 H3 在同一轮生成音频与视频,并提交可复现的 ComfyUI 工作流,呈现了音画同步创作的实践约束。
ComfyUI 在 LTX-2.5 发布当天提供支持,该模型是 LTX 最新开放视频模型,权重可下载并在本地 GPU 运行,也可通过 Partner Nodes 使用托管版本。
推荐理由:LTX-2.5 在 ComfyUI 的 Day-0 支持给出了开放权重与托管两条路径,可据此判断本地视频生成的可控性与部署成本。
Seedance 2.5 通过 Partner Nodes 在 ComfyUI 上线,单次生成一段连续 30 秒视频,无需拼接短片。单次生成最多可接入 50 个参考素材,包括 30 张图片、10 个视频和 10 个音频文件,参考素材可在提示词中逐条指定。
推荐理由:ComfyUI 接入 Seedance 2.5 后,可据此判断单次 30 秒连续生成与 50 个参考素材对现有分镜拼接流程的替代空间。
ComfyUI 发布 v0.31.0,新增 Wan-Animate2、Flux 3 视频模型和 SeeDance 2.5 支持,并改进多项 MiniMax H3 与音频处理。版本还加入 ImageCompositor 节点、Bloom 2 和 Wonder 3.5 支持,并对 LTX、Wan 做加速;同时修复 Linux 内存、采样器和 MiniMax H3 相关问题。
推荐理由:该版本集中带来视频、图像合成与音频处理更新,读者可据新增节点、模型接入和性能修复安排升级。
Black Forest Labs 的 FLUX 3 Video 已在 ComfyUI 通过 Partner Nodes 提供,目前上线的是视频生成,开放权重即将推出。
推荐理由:FLUX 3 Video 通过 ComfyUI Partner Nodes 上线,可据此判断原生音画同出与多风格视频在现有工作流中的接入方式。
Black Forest Labs 通过 BFL API 和部分合作方开放 FLUX 3 Video 生成能力的初始版本,可生成最长 20 秒的 HD 视频并同步生成原生音频,Full HD 通过超分输出。
推荐理由:官方给出 FLUX 3 Video 的生成能力、分辨率与草稿模式,可据此判断多模态视频生成在创作流程中的可用边界。
ComfyUI 发布 v0.30.0,新增 MiniMax H3 模型支持(含 768P 分辨率)和更快的 LTX2.3 解码器 PrunaVAED,并加入 int8 convrot embedding lookup。该版本还引入数据集文件夹隔离、视频节点 crf 选项与 mp4 元数据前置存储,前端包升级至 1.47.11,工作流模板更新至 v0.11.27。
MiniMax H3 今日发布开放权重,并在 ComfyUI 中获得 Day-0 原生支持,可接收文本、图像、视频或音频,生成带立体声的 2K、最长 15 秒视频。
推荐理由:文章把 H3 的多模态输入、原生立体声和 ComfyUI 本地运行路径放在一起,并给出显存缩减与工作流入口,便于评估视频创作部署成本。
字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.5,单次生成时长从 15 秒提升至 30 秒并支持多轮延长,延续 Seedance 2.0 统一的多模态音视频联合生成架构,重点突破长叙事、多模态参考和编辑能力。
推荐理由:官方给出 30 秒单次生成、多模态参考与时间戳编辑的具体能力边界,可据此判断长叙事视频工作流的可用性。
ComfyUI 发布 v0.29.0,更新视频转码、视频处理节点与训练支持,并新增 JoyImageEdit、Gemma4 12B、MageFlow 和 Wan 的 Uni3C Controlnet 原生支持。Partner Nodes 新增 GPT5.6、Gemini 3.5 Flash、Claude Opus 5、Recraft V4.1 等模型或节点,同时包含多项性能优化与修复。
推荐理由:这次更新把视频处理、控制模型和第三方模型接入集中到同一版本,便于评估 ComfyUI 工作流的兼容范围与处理效率。
Black Forest Labs 发布多模态基础模型 FLUX 3,进入 Early Access,联合学习图像、视频和音频,可混合模态生成图像与带音频的视频,单次生成视频最长 20 秒。
推荐理由:FLUX 3 把图像、视频、音频与动作预测放进同一架构,并给出与多家视频模型的早期对比,可供多模态选型参考。
ComfyUI 发布 v0.28.0,新增 Seed Audio 1.0、Seedream 5 Pro、SeedVR2 支持以及 Save 3D (Advanced) 节点族。版本还修复了四个安全漏洞,改进 Qwen3-VL、自定义嵌入、视频音频流和 int4 模型等问题。
推荐理由:该版本把模型接入、3D 工作流与安全修复集中在一次更新中,可用于评估 ComfyUI 对视频、图像和 3D 创作链路的覆盖变化。
Hugging Face Diffusers 发布 0.39.0,新增 Cosmos 3、Ideogram 4、Krea 2、DreamLite、PRX Pixel、Motif-Video、AnyFlow、JoyAI-Image-Edit、DiffusionGemma、Anima 等图像与视频管线。
推荐理由:Diffusers 0.39.0 一次性接入 Cosmos 3、Ideogram 4、Krea 2 等十余条新管线,可据此判断各模型的开放方式与工程适配成本。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)与 Gemini Omni Flash(gemini-omni-flash-preview)两款模型。
推荐理由:两款模型的延迟、单价与限制条件都写明了,可据此判断图像到视频链路的选型与成本。
ComfyUI 发布 v0.26.0,新增 Qwen3-VL 文本生成、Boogu-Image、Krea2、Load3DAdvanced 以及 LTX2 的 Context Windows sampling 支持。
推荐理由:该版本把多种模型节点、分辨率支持和工作流基础设施集中到一次更新中,便于评估 ComfyUI 的模型接入与创作流程变化。
ComfyUI 发布 v0.25.1,新增对 Kling V3-Turbo 模型的支持。该版本为不可变发布版本,自本次发布以来 master 分支已有 604 次提交,只有发布标题和说明可修改。
Google DeepMind 发布 Gemini Omni,并推出首个模型 Gemini Omni Flash,支持结合图像、音频、视频和文本输入生成视频。用户可通过自然语言多轮编辑视频,保持角色、物理效果和场景连续性。
推荐理由:材料给出了多模态输入、连续对话编辑和时空一致性等能力,并交代订阅、免费入口与 API 计划,便于判断其创作工作流适配范围。
Replicate 发布 Seedance 2.0 使用教程,介绍该模型可同时接收最多 9 张图片、3 段视频、3 个音频和文本提示,并用 [Image1]、[Audio1] 等标记在提示词中引用素材。
推荐理由:通过参考素材组合、时间码分镜和音画同源三条实操路径,可迁移到需要角色一致性与多镜头调度的视频创作流程。
Hugging Face 发布 Diffusers 0.37.0,引入 Modular Diffusers,用可复用模块组合自定义扩散管线,与原有 DiffusionPipeline 并存。
推荐理由:Diffusers 0.37.0 的模块化管线与新增图像视频模型清单,可供选型与工作流搭建时对照参考。
字节跳动 Seed 团队正式发布新一代视频创作模型 Seedance 2.0,采用统一的多模态音视频联合生成架构,支持文字、图片、音频、视频四种模态输入,可同时输入多达 9 张图片、3 段视频、3 段音频及自然语言指令。
推荐理由:官方给出多模态参考、视频编辑与双声道音频的能力边界和失败项,可据此判断其在电商与影视流程中的可用位置。
字节 Seed 团队正式发布新一代音视频创作模型 Seedance 1.5 pro,支持文本到音视频合成与图像引导的音视频生成,已上线即梦AI和豆包。模型采用基于 MMDiT 的统一音视频联合生成框架,实现口型、语调与表演节奏的音画同步,原生支持中文、英文、日文、韩语、西班牙语、印尼语及四川话、粤语等方言。
推荐理由:官方披露了音视频联合生成的架构与评测细节,可据此判断音画同步能力在短剧、广告等场景的可用边界。
Hugging Face 的 Diffusers 发布 0.36.0,新增多条图像与视频管线,包括 Black Forest Labs 的 Flux2、6B 参数的 Z-Image、支持多图参考的 QwenImage Edit Plus、Bria FIBO、Kandinsky 5.0 Image Lite 和把图像编辑重构为视频生成任务的 ChronoEdit。
推荐理由:Diffusers 0.36.0 一次性接入 Flux2、Z-Image、HunyuanVideo 1.5 等新管线并新增缓存与注意力后端,可据此判断生成工作流的升级路径。
ElevenLabs 发布 Image & Video(Beta),将图像、视频和音频创作整合到同一平台工作流中。用户可调用 Veo、Sora、Kling、Wan、Seedance 等模型生成视频,也可使用 Nanobanana、Flux Kontext、GPT Image 和 Seedream 生成图像,并在 Studio 中完成配音、音乐、音效、口型同步、时间线调整和导出。
推荐理由:将图像、视频生成与配音、音乐、音效及时间线编辑放进同一工作流,便于评估一站式多模态创作的实际覆盖范围。
Replicate 介绍 Veo 3.1 的提示词编写方法,以及参考生视频、首尾帧生视频和增强图生视频功能。参考生视频最多接收三张图片并结合文本生成连贯场景,其余端点提供耗时低于 60 秒、价格约为标准版本一半的快速生成选项。
推荐理由:文章把镜头构图、焦段、风格和运动等提示词要素,与参考图、首尾帧及快速版本的使用场景对应起来,便于设计可控的视频生成流程。
Hugging Face 发布 Diffusers 0.35.0,新增 Wan 2.2、Flux-Kontext、Qwen-Image 和 Qwen-Image-Edit 等图像与视频管线。版本加入 Regional compilation,称可将编译时间减少 8–10x,并支持加速设备直接加载管线、分片并行加载和 GGUF CUDA kernels,后者预计带来约 10% 的推理速度提升。
推荐理由:该版本同时覆盖新图像与视频管线、编译和加载优化,可帮助开发者比较模型接入方式与推理部署路径。
Replicate 发布 Veo 3 图像输入的使用技巧,实测显示模型能在动画中保持输入图的画风、滤镜和调色,并让文字在复杂背景中保持清晰可读。输入图始终作为视频首帧,可用提示词只动画局部元素、其余保持静止,也可先用 Ideogram 3.0 生成特定风格图再交给 Veo 3 做动作与运镜,从而把风格控制交给图像模型。
推荐理由:Replicate 实测了 Veo 3 图像输入在风格保持、文字动画和局部动画上的表现,可据此调整参考图加提示词的创作流程。
Replicate 与 Pruna AI 合作发布优化版 Wan 2.2,FAST 文生视频和图生视频 480p 每条 0.05 美元、720p 每条 0.10 美元,推理时间约 30 秒。未优化的图生视频 480p 每条 0.40 美元、720p 每条 1.00 美元,可通过 Replicate API 调用。Replicate 称未来几天将发布更多与 Pruna 的优化版本。
推荐理由:Replicate 与 Pruna AI 优化的 Wan 2.2 给出了按条计费的视频生成价格与推理耗时,可据此评估低成本视频试错方案。
Replicate 发布 AI 视频模型对比,列出 Google Veo 3、字节 Seedance 1、MiniMax Hailuo 02、快手 Kling 2.1。