AIGC创作日报 · 2026 年 10 月 3 日 · 星期六
创作雷达
Kling 4.0 进入早期访问,支持原生30秒生成
Kling 4.0进入早期访问,单次最长生成30秒视频,并支持最多15个参考素材和10个关键帧。Comfy Agent已向所有Comfy Cloud用户开放,OpenAI则推出ChatGPT应用分发、登录和企业应用市场。
基模进展
可灵 Kling 4.0 进入早期访问,支持原生 30 秒生成与多参考控制
可灵 Kling 4.0 进入早期访问,支持单次生成最长 30 秒视频、最多 15 个参考素材和最多 10 个关键帧。Kling 4.0 Flash 将于 9 月 28 日向 Ultra Yearly 订阅者开放,Kling 4.0 计划在 10 月扩大开放。新版本还加入音画同步、21:9 超宽画幅和更精细的视频编辑,10-bit HDR 输出将在后续提供。
Asking the World 提出智能体世界建模与探测方法,提升视频物理推理
Shenxiang Zeng 的论文提出 Asking the World(ATW),通过世界建模与世界探测两个自适应阶段,从视频构建并干预可执行的物理世界。基于 Gemini-3-Flash,ATW 在 CLEVRER 上达到 80.82% 问题级准确率,在 ContPhy 上达到 70.56%,并在三个真实场景中达到 71.67%。
Memorizon:训练超越上下文窗口的世界模型
论文《Memorizon》提出一种超越上下文窗口训练世界模型的方法,将长跨度重访监督与完整序列注意力解耦。训练样本可覆盖任意长度,但只对最后 k 个 chunks 评分,各 chunk 按相机共视关系检索自身的 top-K latents,共享 bank 上限为 kK;跨度从 100 s 增至 400 s 时,单步耗时增加 12%。
Physis-Lang:用自演化语言作为视频世界模型的物理表示
Physis-Lang提出一种自演化框架,将物理语言作为视频世界模型在数据整理、模型训练和视频生成中的共享表示。在四个物理视频基准上,使用 Wan 和 Cosmos 主干的实验显示物理可信度持续提升;基于开源 Cosmos3-Nano 的增强模型超过 Veo 3.1。
4Director:用刚性 3D 几何控制视频世界模型
论文提出4Director,一种以显式4D场景表示控制相机和物体运动的视频世界模型。它为每个物体重建规范网格,并为每帧指定刚性变换,再通过Motion Adapter生成视角一致的外观、光照和非刚性动态。
Oneira:从开放式生成走向视频世界模型的开放世界交互
Oneira提出一种通过显式世界状态连接生成与交互的视频世界模型,使新生成或发现的对象能够被纳入可操作环境。编码智能体根据观察和动作读取、更新世界状态,并将交互结果持续带入后续视频片段;实验显示,模型可与新生成对象直接且一致地交互,并在较长时间范围内保留此前交互的影响。
World Observer 通过联合演员与观察者生成实现持久世界建模
论文提出 World Observer,通过联合生成面向智能体视角的演员和观察选定区域的全景观察者,让离开演员视野的物体继续演化并在重新进入时恢复更新后的状态。该方法基于共享全景源进行几何对应,并引入高分辨率透视参考的 Observer Sink,同时提出用于评估视野外演化的世界空间指标和覆盖真实、合成场景的基准。
多模态 RL 如何学会看:Same Reward, Different Skills 研究视觉学习信号
论文研究发现,即使训练时不使用视觉信息,模型在测试时仍能恢复部分真实图像带来的能力增益,但持续使用真实图像训练可能削弱 grounding。作者提出 visual resolvability 设计规则,并在反事实坐标场景中用 GRPO 训练 7B 模型,使目标发现准确率从 0.425 提升至 0.875。
创作实践
Comfy Agent 与 852話 Hakoniwa 如何创作动画短片《YUI》
Comfy Agent 与 AI 动画艺术家 852話 Hakoniwa 共同完成了首部使用 Comfy Agent 创作的动画短片《YUI》。项目最终成片时长为 4:20,主要使用 Seedance 2.5 制作正片、MiniMax H3 制作幕后视频,并比较了 Wan 等视频模型。
Kling 4.0 开启封闭测试,预告 10 月正式发布
Kling 4.0 现已进入封闭测试,并预告于 10 月正式发布,支持最长 30 秒视频生成。官方介绍了稳定动态运动、立体声、高准确度口型同步、4K 分辨率和 10-bit HDR 输出等升级。Johnson Sheng 的商业制作实测显示,模型可用主体与场景素材生成单条 30 秒打斗镜头,并在快速运镜、复杂动作和道具跨镜头一致性测试中保持稳定。
产品与竞品
ComfyUI 发布 Comfy Agent,现已登陆 Comfy Cloud
ComfyUI 发布 Comfy Agent,现已向所有 Comfy Cloud 用户开放,并计划在几周后进入 Comfy Desktop。它可在画布中根据描述构建、运行和迭代工作流,支持比较模型、解释工作流、批量处理 20 张图片,并允许最多 5 个并行聊天。Comfy Agent 目前处于 beta 阶段,可领取免费初始聊天次数,并使用已有的 Comfy Credits。
OpenAI 在 Dev Day 推出 ChatGPT 应用分发、身份登录与企业应用市场功能
OpenAI 在 Dev Day 宣布让 ChatGPT 承担应用发现、启动和使用,并推出“Sign in with ChatGPT”、企业应用市场及 Dots 智能体。ChatGPT 将根据对话推荐应用,支持交互式扩展面板;Dots 可连接超过 4,000 个应用,企业市场首批有 30 多家合作方。OpenAI 尚未公布类似传统应用商店的计费或收入分成机制。
Luma 上线 Variants,支持静态广告多尺寸多语言生成
Luma 上线 Variants,用户上传一份已批准的静态广告后,可生成不同版式和语言的广告版本。产品提供 Story 9:16、Portrait 4:5、Square 1:1、Medium Rectangle 6:5 和 Widescreen 16:9 五种标准版式,并返回每种尺寸与语言组合。用户可预览各版本、重新生成不合适的版本,下载成品或导出到 Luma Canvas 审核。
NVIDIA DGX Spark 推出 64GB 配置,支持双机集群扩展本地 AI
NVIDIA DGX Spark 将推出 64GB 统一内存配置,支持在设备上运行最多 100B 参数模型,起售价为 $4,999。两台设备可通过 NVIDIA Sync Cluster Assistant 组建 128GB 集群,将模型支持范围扩展至最多 200B 参数;NVIDIA 在 Qwen 3.8 27B 测试中称,双机性能最高达到单机的 1.7x。
Comfy Developer Platform 发起开源付费功能挑战赛
ComfyUI 发起 Comfy Developer Platform 挑战赛,邀请开发者在两周内将付费功能重做为开源工作流并提交仓库。参赛作品须使用 Comfy Developer Platform、Comfy Cloud 或本地 Comfy SDK,并附开源许可证和可复现的设置说明。
快讯
- Ego2Act 提出面向目标驱动操作的第一视角视频生成评测基准arXiv · 多模态、视频与世界模型
- HiPhy:通过层级对齐实现符合物理规律的多原理视频生成arXiv · 多模态、视频与世界模型
- 论文提出 DynSC-Eval 评估长视频生成中的动态主体一致性arXiv · 多模态、视频与世界模型
- AutoGUIWorld:用图像生成器构建 GUI 智能体视觉世界模型arXiv · 多模态、视频与世界模型
- Soundwich:用分层可控音频生成与视频同步arXiv · 多模态、视频与世界模型
- Multimodal Flow在嵌入空间统一建模语言与视觉arXiv · 多模态、视频与世界模型
- MindWorldBench:评估图生视频中的心理状态到行为推理arXiv · 多模态、视频与世界模型
- 为何传统世界模型难以学习元胞自动机?arXiv · 多模态、视频与世界模型
- DiVid 诊断视频生成模型的分维度多样性坍缩arXiv · 多模态、视频与世界模型
- LongTake:学习在长时域视频生成中维持动态arXiv · 多模态、视频与世界模型
- Kepler:面向 ARC-AGI-3 的可审计世界模型arXiv · 多模态、视频与世界模型
- MEND:无标签检测、定位与校正世界模型中的潜在幻觉arXiv · 多模态、视频与世界模型