跳到正文

模型发布

按模型发布浏览相关 AIGC 创作资讯,保留原始出处、阶段与证据。

62条精选

最新精选

第 1–20 条 · 共 62 条
10月2日周五
  1. 可灵 · 模型与创作实践73

    Kling 4.0 开启封闭测试,预告 10 月正式发布

    Kling 4.0 现已进入封闭测试,并预告于 10 月正式发布,支持最长 30 秒视频生成。官方介绍了稳定动态运动、立体声、高准确度口型同步、4K 分辨率和 10-bit HDR 输出等升级。Johnson Sheng 的商业制作实测显示,模型可用主体与场景素材生成单条 30 秒打斗镜头,并在快速运镜、复杂动作和道具跨镜头一致性测试中保持稳定。

    推荐理由:文章以商业广告实测为主线,呈现 Kling 4.0 在动态镜头、30 秒长镜头和商品跨镜头一致性上的具体表现,可供创作流程评估参考。

  2. The Decoder78

    Black Forest Labs 发布 Flux 3 Image,支持不改变其他区域的多步编辑

    Black Forest Labs 发布 Flux 3 Image,主打在多步编辑中保持图像其他区域不变,并支持文生图、图生图、文字渲染和写实图像。模型支持用边界框构图、最多加入 10 张参考图,输出最高 4K;免费演示已开放,API 在 10 月 8 日前五折,商业权重可授权企业在自有基础设施上运行和微调,开放权重预计未来几周发布。

    推荐理由:Flux 3 Image 将多步局部编辑、参考图和边界框构图结合起来,适合评估图像工作流中的可控性与商品或角色保真需求。

  3. The Decoder76

    Tavus推出 Griffin 人类交互模型,48%受试者将其误认真人

    Tavus推出 Griffin,这是一种面向实时面对面交流的 Human Interaction Model;Tavus称其研究中有48%的参与者在一分钟视频通话后相信 Griffin 是真人。

    推荐理由:材料提供了 Griffin 与真人及上一代 AI 的对照数据,并交代了研究预览的开放范围和安全前提,便于判断其当前成熟度。

10月1日周四
  1. The Decoder84

    Google 发布 Gemini 4 Argon,性能追近 OpenAI 和 Anthropic 但未形成明确领先

    Google 发布前沿模型 Gemini 4 Argon,支持文本、图像、视频和音频输入,输出文本,初期仅向 Fairwind 计划中的“trusted cyber defenders”和内部团队开放。

    推荐理由:文章同时给出独立评测、价格与 token 消耗,能帮助读者区分 Gemini 4 Argon 的性能追赶、成本优势和效率代价。

  2. Runway · 研究与模型81

    Runway 宣布开放权重世界动作模型 Praxis-1

    Runway宣布Praxis-1,这是其首个开放权重世界动作模型,目前正与早期伙伴在不同机器人具身和环境中测试,并计划未来几个月公开发布。Praxis-1基于大规模视频预训练,Runway称其在世界模型中模拟机器人策略与现实结果的相关性达到0.95。早期测试伙伴包括Noble Machines、Standard Bots和Ultra,模型将在各自硬件上运行。

    推荐理由:Praxis-1将视频预训练用于跨具身机器人策略,并以0.95相关性仿真结果和多种硬件测试说明其开放权重路线。

9月30日周三
  1. 可灵 · 模型与创作实践81

    Kling 4.0 与 3.0 有哪些不同

    Kling 4.0将于2026年10月正式发布,原生视频生成时长从3–15秒扩展至3–30秒,并支持最多10个关键帧。新版本还支持最多15个组合参考资产、10-bit HDR、双声道立体声和定向多模态视频编辑。Kling 4.0 Flash已于9月28日向有限用户开放提前体验。

    推荐理由:这篇对比把时长、关键帧、参考资产和视频编辑放在同一框架中,便于按项目复杂度选择 Kling 3.0 或 4.0。

  2. 可灵 · 模型与创作实践83

    Kling 4.0 AI 视频创作完整指南:多模态参考与30秒生成

    Kling 4.0完整模型计划于2026年10月发布,新创作体验自9月28日起向有限用户逐步开放早期访问。模型支持3至30秒原生视频生成、最多10个关键帧,以及最多15个组合参考素材,并提升运动稳定性、角色与商品一致性、音画同步和视频编辑能力。

    推荐理由:文章梳理了从多模态参考、关键帧到时间线审片的完整链路,可用于规划商品广告和短叙事视频的生成与修订流程。

9月28日周一
  1. Hugging Face Blog62

    H 公司发布 Holo4 系列通用电脑操作智能体模型

    H 公司发布 Holo4 系列智能体模型,含 27B dense 与 35B-A3B MoE 两个版本,并推出基于 Nemotron 3 Nano Omni 的 Holotron4 Nano,均已上线 H Models API,权重以 BF16、FP8、NVFP4 和 4-bit GGUF 在 Hugging Face 开放。

    推荐理由:Holo4 给出跨 GUI、代码、MCP 与 API 的统一智能体方案,并公开轨迹与权重,便于评估开源电脑操作智能体的成本与能力边界。

  2. ElevenLabs · 音频创作75

    ElevenLabs 发布 Eleven v4 与 Eleven v4 Turbo 语音模型

    ElevenLabs 发布情感表现更强的文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,两者支持 90 多种语言,已在 ElevenAgents、ElevenCreative 和 ElevenAPI 上线。

    推荐理由:官方给出 Eleven v4 与 Turbo 的延迟、盲测偏好和音频标签控制细节,可用于语音智能体与配音选型参考。

9月24日周四
  1. Black Forest Labs · 图像与视频84

    Black Forest Labs 发布 FLUX 3 Action,开放 7B 机器人动作策略权重

    Black Forest Labs 发布 FLUX 3 Action(F3A)机器人动作策略模型及其开放权重,采用 WAM 联合预测未来视频与动作。报告称,其单步 7B checkpoint 在 RoboLab 达到 38.3%,高于 Cosmos 3 Nano 的 36.8%;guidance-distilled checkpoint 达到 42.2%。

    推荐理由:报告同时给出 RoboLab、真实机器人和推理效率数据,可用于比较 WAM 与 VLA 在成功率、速度和部署成本上的取舍。

9月23日周三
9月16日周三
9月10日周四
  1. OpenAI News62

    OpenAI 在 API 中上线 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,为开发者带来自然的全双工语音对话能力。该模型在指令遵循上更强,并支持自定义音色与电话(telephony)接入。

    推荐理由:OpenAI 把全双工语音对话能力开放到 API,读者可据此判断语音类应用的接入门槛与能力边界。

9月3日周四
9月1日周二
  1. World Labs · 空间智能与世界模型85

    World Labs 发布世界模型 Atlas,原生支持文本、图像、视频与 3D

    World Labs 发布下一代世界模型 Atlas,这是一个从零预训练的多模态自回归扩散 Transformer,原生处理文本、图像、视频和 3D,所有输入被组合进共享的空间上下文。

    推荐理由:Atlas 把相机位姿与 3D 深度作为原生输入,读者可据此判断世界模型在可控生成与稀疏重建上的路线差异。

8月28日周五
8月27日周四
8月25日周二
  1. ComfyUI · 工作流与实践87

    Wan 3.0 接入 ComfyUI,支持原生 30 秒视频与 Omni-Reference 控制

    Alibaba 的 Wan 3.0 已接入 ComfyUI,支持原生生成最长 30 秒的视频,并提供 Omni-Reference 控制。模型支持 480p、720p 和 1080p,可使用最多 10 张图片、5 个视频和 5 段音频等参考素材,还支持视频编辑与扩展。使用这些功能需将 ComfyUI 更新至 v0.33.4,或访问 Comfy Cloud。

    推荐理由:原文同时给出时长、参考素材和分辨率选项,便于评估 Wan 3.0 在长镜头、多素材控制与低成本草稿中的工作流价值。