跳到正文

全部动态

今日 10 条
10月1日周四
  1. arXiv · 多模态、视频与世界模型86

    Asking the World 提出智能体世界建模与探测方法,提升视频物理推理

    Shenxiang Zeng 的论文提出 Asking the World(ATW),通过世界建模与世界探测两个自适应阶段,从视频构建并干预可执行的物理世界。基于 Gemini-3-Flash,ATW 在 CLEVRER 上达到 80.82% 问题级准确率,在 ContPhy 上达到 70.56%,并在三个真实场景中达到 71.67%。

    推荐理由:论文将视频中的物理推理转化为可执行世界的建模与探测,并用多组基准展示了这种验证式流程相对直接 VLM 推理的提升。

  2. arXiv · 多模态、视频与世界模型80

    MindWorldBench:评估图生视频中的心理状态到行为推理

    Ruiqi Li 等人提出 MindWorldBench,评估图生视频模型根据心理状态生成行为的能力。该基准使用 Zero-Action Prompting 和包含 744 个提示的反事实设计,并对 11 个模型进行评测。结果显示,模型虽然具备视觉保真度和物理推理能力,但难以让行为与潜在心理状态一致,常出现偏向客观世界状态而非人的主观信念的 Omniscient Bias。

    推荐理由:论文用 744 个反事实提示评估图生视频的心理状态到行为推理,并揭示模型偏向客观世界状态的失败模式。

  3. arXiv · 多模态、视频与世界模型38

    线性循环记忆足以蒸馏用于机器人空气曲棍球的世界模型策略

    一项机器人空气曲棍球防守研究表明,采用64维状态的纯线性循环模型(k=0)蒸馏DreamerV3教师策略后,在暂时失去冰球追踪时的表现可匹配GRU基线和教师策略。五个匹配随机种子的实验显示,增加非线性创新秩未带来测得收益;该模型循环参数更少、计算量更低。结论仅限于文中设定的模拟任务、教师、状态维度和 blackout horizon。

  4. arXiv · 多模态、视频与世界模型66

    TPAE:通过 Token 级视觉落地优势估计强化多模态推理

    论文提出 Token 级感知落地优势估计(TPAE),利用 token 的视觉依赖与预测熵,为多模态推理生成细粒度强化学习监督信号。分析显示,正确推理链在视觉落地增强时熵下降更明显,关键 token 也是正确推理链联合分布中的统计异常点。TPAE 在七个基准上持续优于强基线,并带来更稳定、高效的优化。

  5. arXiv · 多模态、视频与世界模型31

    LocoWM:世界模型引导的残差适应实现高精度运动控制

    LocoWM提出世界模型引导的预主动残差适应框架,提升机器人高精度运动控制能力。基础策略负责跟随运动指令,动作条件世界模型根据本体感知历史预测未来物理状态,残差适配器据此生成动作修正。地形调平、加速度补偿和推搡恢复实验显示,LocoWM相比端到端和反应式残差基线具有更高控制精度与抗扰性。

  6. arXiv · 多模态、视频与世界模型79

    MEND:无标签检测、定位与校正世界模型中的潜在幻觉

    论文提出 MEND,用一个基于真实状态转移训练的条件 score network,在没有错误标签的情况下检测、定位并尝试校正冻结世界模型中的潜在幻觉。在两个导航环境中,MEND 的幻觉检测 AUROC 最高达 0.80,逐 token 定位 AUPRC 最高达 0.87,且不使用动作信息。推理时校正可降低单步潜在误差并改善预测,但部分误差位于数据流形切向方向,论文因此重点讨论检测与定位。

    推荐理由:论文把世界模型的潜在幻觉拆成检测、定位和推理时校正三个可评估环节,并给出无需错误标签的指标结果,适合参考相关鲁棒性研究设计。

  7. TechCrunch · AI82

    OpenAI 在 Dev Day 推出 ChatGPT 应用分发、身份登录与企业应用市场功能

    OpenAI 在 Dev Day 宣布让 ChatGPT 承担应用发现、启动和使用,并推出“Sign in with ChatGPT”、企业应用市场及 Dots 智能体。ChatGPT 将根据对话推荐应用,支持交互式扩展面板;Dots 可连接超过 4,000 个应用,企业市场首批有 30 多家合作方。OpenAI 尚未公布类似传统应用商店的计费或收入分成机制。

    推荐理由:原文把 ChatGPT 的应用分发、身份层、企业市场与 Dots 串成一套路径,可用于判断 AI 入口如何改变软件发现和调用方式。

  8. TechCrunch · AI53

    Google 发布 Gemini 4 Argon,主打防御性网络安全与复杂任务处理

    Google 发布 Gemini 4 Argon,称其面向编码、研究和写作等任务,尤其擅长防御性网络安全,并可自主发现、验证和修复关键软件漏洞。Argon 目前仅通过 Fairwind Program 向一组选定的网络安全合作伙伴开放。Google 还称其在多项基准测试中高于 OpenAI 的 GPT-6 Astra 及 Anthropic 的 Fable、Opus。

  9. 宝玉12

    Figure AI 将第二代 Figure 02 人形机器人投入芬兰一家铸造厂的 75 吨电弧炉钢水中熔毁退役,熔出的金属将加工成限量纪念品。Figure 02 曾完成首次进 BMW 工厂、首次运行 Helix、首次做家务和物流等任务,如今 F.03 数量渐增,维护 F.02 已不划算。团队在加州圣何塞训练新 AI 模型,让机器人在陌生铸造厂自主跳入钢水容器,全程仅 24 小时、6 炉机会。

    引用Figure@Figure_robot

    The story is crazy, started with Arnold on social and ended in Finland having F.02's jump into a 75-ton arc furnace Read about our journey here: https://www.figure.ai/news/f-02-decommission

  10. The Decoder84

    Google 发布 Gemini 4 Argon,性能追近 OpenAI 和 Anthropic 但未形成明确领先

    Google 发布前沿模型 Gemini 4 Argon,支持文本、图像、视频和音频输入,输出文本,初期仅向 Fairwind 计划中的“trusted cyber defenders”和内部团队开放。

    推荐理由:文章同时给出独立评测、价格与 token 消耗,能帮助读者区分 Gemini 4 Argon 的性能追赶、成本优势和效率代价。

  11. 宝玉74

    谷歌发布新一代旗舰模型 Gemini 4 Argon,在 19 项对比测试中 13 项第一,输出上限从上一代 6.4 万 token 提升到单次最多 100 万 token。

    引用Sundar Pichai@sundarpichai

    Lots of discussion out there about our next model(!), so I wanted to give an early look as soon as possible. Introducing Gemini 4 Argon! It shows frontier performance in complex workflows, cyber defense and software engineering. Teams are using it extensively at Google, from coding to quantum computing, great feedback. Here’s a look at the benchmarks:

  12. TechCrunch · AI54

    OpenAI披露 Decisions API 有限预览,可用于预设选项决策

    OpenAI在Dev Day上披露了Decisions API有限预览,可让模型在预设选项中快速作出决策,并支持图像理解、广泛语言和安全能力。该API被认为与TypeSafe AI面向软件自动化的Jev相似,后者可低成本、高速输出选项概率。QueryStory的演示显示,用Jev监控每次智能体行动的成本为$2.94,而使用frontier LLM为$372。

  13. TechCrunch · AI63

    ElevenLabs允许员工套现部分股权,估值翻倍至$22B

    AI语音公司ElevenLabs宣布允许员工以$22B估值出售部分已归属股权,近期完成的$300 million要约收购由Wellington和T. Rowe Price联合牵头。该估值是公司今年2月以$500 million融资时$11B估值的两倍,也是其第二次为员工安排二次交易;公司曾于2025年9月以$6.6B估值完成$100 million要约收购。

  14. The Decoder77

    Google 在 Gemini 聊天中推出 Skills,取代 Gems

    Google 正在全球 Gemini 聊天中推出 Skills,用于保存和调用特定任务的详细提示词,并取代 Gems。用户可输入“/”加 Skill 名称调用,Gemini 还能从历史对话生成 Skills,并在检测到匹配提示时自动运行;Skills 支持文本文档、PDF 和图片作为参考材料。

    推荐理由:这次迁移展示了 Google 如何把可复用提示词、自动触发和多份参考材料组织进 Gemini 的智能体工作流,便于比较不同厂商的 Skills 方向。

  15. ComfyUI · 工作流与实践86

    Comfy API 上线,将 ComfyUI 工作流部署为生产 API

    Comfy API 面向付费 Comfy plan 用户上线,可将 ComfyUI 工作流及其 custom nodes、LoRAs、models 和 Python dependencies 打包为可自动扩缩的 API endpoint。

    推荐理由:它把 ComfyUI 工作流的环境封装、版本固定与弹性部署合并进同一流程,适合评估从本地创作到产品化 API 的迁移成本。

  16. Runway · 研究与模型81

    Runway 宣布开放权重世界动作模型 Praxis-1

    Runway宣布Praxis-1,这是其首个开放权重世界动作模型,目前正与早期伙伴在不同机器人具身和环境中测试,并计划未来几个月公开发布。Praxis-1基于大规模视频预训练,Runway称其在世界模型中模拟机器人策略与现实结果的相关性达到0.95。早期测试伙伴包括Noble Machines、Standard Bots和Ultra,模型将在各自硬件上运行。

    推荐理由:Praxis-1将视频预训练用于跨具身机器人策略,并以0.95相关性仿真结果和多种硬件测试说明其开放权重路线。

9月30日周三
  1. Google DeepMind66

    Google DeepMind 发布 SynthID Bio,为 AI 设计蛋白质加入可验证水印

    Google DeepMind 发布 SynthID Bio,可将不可感知的签名嵌入蛋白质序列或预测的3D结构,并在合成后的实体蛋白质上验证来源。实验覆盖 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三种目标,水印设计保持了未加水印版本的命中率、结合亲和力和天然序列多样性。Google DeepMind 同时开放方法论文、代码、体外数据和研究权重。

    推荐理由:文章同时给出蛋白序列与3D结构水印的实现路径、实验边界和开放内容,便于判断其在生物安全审查与科研数据库溯源中的落地位置。

  2. 可灵 · 模型与创作实践62

    2026 年 5 款 UGC 视频生成 AI 工具对比与 Kling AI 实践指南

    可灵发布一篇 2026 年 UGC 视频生成工具指南,对比 Kling AI、Higgsfield、Dreamina、HeyGen 和 CapCut 在场景生成、数字人呈现与视频组装等工作流中的适用方向,强调这不是基准排名。

    推荐理由:文章按产品场景、脚本呈现与后期组装拆分工具差异,并给出从参考素材到审片修复的 Kling AI UGC 工作流,便于评估商品保真与制作成本。

  3. 可灵 · 模型与创作实践74

    Kling 4.0 如何用 Multiple Keyframes 控制 30 秒 AI 视频

    Kling 4.0 通过 Multiple Keyframes 在视频时间线上设置多个视觉节点,单次生成最多支持 10 张关键帧图像,原生视频时长为 3 到 30 秒。官方指南还介绍了如何结合 Omni Reference、时间线提示词和一致性参考素材,控制商品广告或短叙事中的角色、产品、场景与镜头变化。

    推荐理由:这篇指南把长视频控制拆成关键时间点、参考素材与过渡提示词,适合复用到商品广告和结构化短叙事的制作流程中。

  4. 可灵 · 模型与创作实践71

    可灵 AI 四步将静态图片制作成短视频

    可灵介绍了使用 AI 将静态图片制作成短视频的四步流程,包括上传图片、描述运动、设置时长并生成,以及检查和优化结果。教程以 Kling VIDEO 3.0 Omni 为例,支持使用 Start Frame、End Frame 和 Element 参考,单次生成最长 15 秒,并提供多镜头、原生音频和常见问题修复方法。

    推荐理由:文章将图片转视频拆成选择运动对象、编写提示词、设置时长和复检四步,并给出起始帧与元素参考的使用方法。

  5. 可灵 · 模型与创作实践81

    Kling 4.0 与 3.0 有哪些不同

    Kling 4.0将于2026年10月正式发布,原生视频生成时长从3–15秒扩展至3–30秒,并支持最多10个关键帧。新版本还支持最多15个组合参考资产、10-bit HDR、双声道立体声和定向多模态视频编辑。Kling 4.0 Flash已于9月28日向有限用户开放提前体验。

    推荐理由:这篇对比把时长、关键帧、参考资产和视频编辑放在同一框架中,便于按项目复杂度选择 Kling 3.0 或 4.0。

  6. 可灵 · 模型与创作实践83

    Kling 4.0 AI 视频创作完整指南:多模态参考与30秒生成

    Kling 4.0完整模型计划于2026年10月发布,新创作体验自9月28日起向有限用户逐步开放早期访问。模型支持3至30秒原生视频生成、最多10个关键帧,以及最多15个组合参考素材,并提升运动稳定性、角色与商品一致性、音画同步和视频编辑能力。

    推荐理由:文章梳理了从多模态参考、关键帧到时间线审片的完整链路,可用于规划商品广告和短叙事视频的生成与修订流程。

  7. Hugging Face Blog77

    Hugging Face 发布 Open TTS Leaderboard,支持多语言与语音克隆评测

    Hugging Face 发布 Open TTS Leaderboard,用客观指标评估开放源码 TTS 模型的可懂度、速度和说话人相似度,并覆盖多语言与语音克隆场景。排行榜使用 WER/CER、RTFx、TTFA 和 SIM,支持在 H200 GPU 与 CPU 上比较流式性能,并提供 Listen 标签页供用户试听和投票。

    推荐理由:该排行榜把 WER/CER、推理速度和说话人相似度纳入统一评测,并保留试听投票,便于比较开放源码 TTS 在多语言和流式场景中的取舍。

  8. ElevenLabs · 音频创作73

    ElevenLabs完成$300 million员工要约收购,估值升至$22 billion

    ElevenLabs完成$300 million员工要约收购,估值达到$22 billion,是其2026年2月Series D估值的两倍。公司称企业客户已贡献55%的收入,ElevenAgents每周处理超过15 million次对话,较2月增长3x;其语音智能体平均比聊天智能体快31%解决问题。

    推荐理由:企业收入占比、智能体处理量和多渠道部署数据,提供了观察语音智能体商业化进展的具体参照。

  9. 宝玉62

    OpenAI 在开发者大会上发布 Decisions API,开发者写好问题和备选答案后,模型直接从选项里挑一个返回,不生成多余内容。它基于 GPT-6 家族最小最便宜的 Luna 特化版本,OpenAI 称一次判断约 150 毫秒,同样任务走普通 Luna 接口约 1.6 秒。

    引用OpenAI Developers@OpenAIDevs

    Give your app real-time decision-making with Decisions API, powered by GPT-6 Luna. Define questions and possible answers to classify content, route requests, or choose an agent’s next action. Available in limited preview.

  10. arXiv · 多模态、视频与世界模型76

    PRISM通过反事实视频生成扩展人形机器人移动操作训练

    PRISM提出一个真实到仿真再到真实框架,用少量真实视频生成大规模多样的人体与物体交互训练数据。研究通过视频到视频生成数百条反事实视频,再重建并调整人和物体的运动轨迹,训练出无需真实世界微调的策略。搭载该策略的人形机器人仅使用机载深度观测,就能在不同物体实例、尺寸和初始配置下完成箱子、桶、箱体和球的拾取、搬运与放下。

    推荐理由:PRISM展示了如何用少量真实交互视频生成反事实数据,并通过真实到仿真再到真实流程训练人形机器人的移动操作策略。

  11. arXiv · 多模态、视频与世界模型82

    LongLive-Plug 提出一次性蒸馏框架,支持视频生成模型即插即用复用

    论文提出 LongLive-Plug,一种将蒸馏能力学习为基础模型 LoRA 的一次性框架,可免训练即插即用于兼容的下游视频模型。它覆盖单次 CFG、少步采样和长上下文错误校正,并在三类骨干网络、54 个下游模型和八类任务上进行了验证。

    推荐理由:论文给出把单次 CFG、少步采样和长上下文纠错封装为可复用 LoRA 的方案,并以 54 个下游模型展示跨任务免训练部署路径。

  12. arXiv · 多模态、视频与世界模型82

    FracGen 论文提出受物理信号控制的断裂视频生成模型

    FracGen 论文提出一种从单张完整物体图像生成可控断裂视频的模型,并通过物理信号建模撕裂与形变过程。作者构建 FracSim 生成带有密集像素对齐物理场的断裂视频数据,用联合预测和物理约束损失训练模型。实验显示,FracGen 在物理保真度和视觉保真度上均优于现有视频生成基线,并可控制撕裂位置、裂纹传播速度及失效前形变量。

    推荐理由:论文将断裂模拟产生的物理场用于视频生成训练与约束,为可控物理动态建模提供了具体技术路径。

  13. arXiv · 多模态、视频与世界模型77

    LIFT:通过在策略自蒸馏实现大视点变化下的未来布局视频生成

    研究团队提出 LIFT 图像到视频生成框架,用最后一帧布局控制未来视图中应出现的内容及其位置。该方法通过在策略自蒸馏,将密集布局教师的控制能力迁移到最后一帧布局学生,并构建包含大视点变化、相机与时序一致布局标注的 LIFT-Vista 数据集;实验显示其视频质量、未来布局可控性和相机可控性优于其他方法。

    推荐理由:论文把最后一帧布局引入大视点变化的视频生成,为未来画面内容与空间位置的联合控制提供了可复用思路。

  14. arXiv · 多模态、视频与世界模型88

    HelixWorld:实时交互式音视频世界模型

    论文提出HelixWorld,使视觉场景与基于相机的空间立体声音在用户交互下共同演化。研究通过6-DoF相机轨迹和用户动作进行训练,并将模型蒸馏为低延迟流式模型,在单GPU上以24 FPS生成无漂移的音视频轨迹。论文还提出空间声学一致性与HelixBench,用于评估声音场是否跟随动态视点变化。

    推荐理由:论文将空间立体声纳入实时世界模型,并以24 FPS单GPU交互和HelixBench展示音画协同建模与评测路径。

9月29日周二
  1. 沐阳10

    Tibo的实体重置按钮曝光了!! 我就知道,一定有实体的Reset按钮! 不是按钮,而是个拉杆! 万万没想到的是: 按下按钮之后,十秒钟之内,还可以撤销!!! 谈话间,Tibo撤销了一次重置!

    引用Vaibhav Sisinty@VaibhavSisinty

    Guys, @thsottiaux’s reset button is REAL! 🤯 My full conversation with the man himself drops tomorrow on X and YouTube! Some massive updates are coming our way. I wish I could say more 👀