UACD:面向少步视频生成的不确定性感知一致性蒸馏
Lingyu Liu 提出不确定性感知一致性蒸馏方法 UACD,通过局部不确定性估计降低高难度时空区域的一致性监督权重。结合特征空间对抗训练、语义对齐和 LoRA 适配后,50步 Wan 模型实现了4步视频生成,在 VBench 2.0 上取得 0.556 mean score,并在用户研究中获得更高偏好。
Lingyu Liu 提出不确定性感知一致性蒸馏方法 UACD,通过局部不确定性估计降低高难度时空区域的一致性监督权重。结合特征空间对抗训练、语义对齐和 LoRA 适配后,50步 Wan 模型实现了4步视频生成,在 VBench 2.0 上取得 0.556 mean score,并在用户研究中获得更高偏好。
Shenxiang Zeng 的论文提出 Asking the World(ATW),通过世界建模与世界探测两个自适应阶段,从视频构建并干预可执行的物理世界。基于 Gemini-3-Flash,ATW 在 CLEVRER 上达到 80.82% 问题级准确率,在 ContPhy 上达到 70.56%,并在三个真实场景中达到 71.67%。
推荐理由:论文将视频中的物理推理转化为可执行世界的建模与探测,并用多组基准展示了这种验证式流程相对直接 VLM 推理的提升。
Ruiqi Li 等人提出 MindWorldBench,评估图生视频模型根据心理状态生成行为的能力。该基准使用 Zero-Action Prompting 和包含 744 个提示的反事实设计,并对 11 个模型进行评测。结果显示,模型虽然具备视觉保真度和物理推理能力,但难以让行为与潜在心理状态一致,常出现偏向客观世界状态而非人的主观信念的 Omniscient Bias。
推荐理由:论文用 744 个反事实提示评估图生视频的心理状态到行为推理,并揭示模型偏向客观世界状态的失败模式。
一项机器人空气曲棍球防守研究表明,采用64维状态的纯线性循环模型(k=0)蒸馏DreamerV3教师策略后,在暂时失去冰球追踪时的表现可匹配GRU基线和教师策略。五个匹配随机种子的实验显示,增加非线性创新秩未带来测得收益;该模型循环参数更少、计算量更低。结论仅限于文中设定的模拟任务、教师、状态维度和 blackout horizon。
论文提出 Token 级感知落地优势估计(TPAE),利用 token 的视觉依赖与预测熵,为多模态推理生成细粒度强化学习监督信号。分析显示,正确推理链在视觉落地增强时熵下降更明显,关键 token 也是正确推理链联合分布中的统计异常点。TPAE 在七个基准上持续优于强基线,并带来更稳定、高效的优化。
LocoWM提出世界模型引导的预主动残差适应框架,提升机器人高精度运动控制能力。基础策略负责跟随运动指令,动作条件世界模型根据本体感知历史预测未来物理状态,残差适配器据此生成动作修正。地形调平、加速度补偿和推搡恢复实验显示,LocoWM相比端到端和反应式残差基线具有更高控制精度与抗扰性。
论文提出 MEND,用一个基于真实状态转移训练的条件 score network,在没有错误标签的情况下检测、定位并尝试校正冻结世界模型中的潜在幻觉。在两个导航环境中,MEND 的幻觉检测 AUROC 最高达 0.80,逐 token 定位 AUPRC 最高达 0.87,且不使用动作信息。推理时校正可降低单步潜在误差并改善预测,但部分误差位于数据流形切向方向,论文因此重点讨论检测与定位。
推荐理由:论文把世界模型的潜在幻觉拆成检测、定位和推理时校正三个可评估环节,并给出无需错误标签的指标结果,适合参考相关鲁棒性研究设计。
PRISM提出一个真实到仿真再到真实框架,用少量真实视频生成大规模多样的人体与物体交互训练数据。研究通过视频到视频生成数百条反事实视频,再重建并调整人和物体的运动轨迹,训练出无需真实世界微调的策略。搭载该策略的人形机器人仅使用机载深度观测,就能在不同物体实例、尺寸和初始配置下完成箱子、桶、箱体和球的拾取、搬运与放下。
推荐理由:PRISM展示了如何用少量真实交互视频生成反事实数据,并通过真实到仿真再到真实流程训练人形机器人的移动操作策略。
论文提出 LongLive-Plug,一种将蒸馏能力学习为基础模型 LoRA 的一次性框架,可免训练即插即用于兼容的下游视频模型。它覆盖单次 CFG、少步采样和长上下文错误校正,并在三类骨干网络、54 个下游模型和八类任务上进行了验证。
推荐理由:论文给出把单次 CFG、少步采样和长上下文纠错封装为可复用 LoRA 的方案,并以 54 个下游模型展示跨任务免训练部署路径。
FracGen 论文提出一种从单张完整物体图像生成可控断裂视频的模型,并通过物理信号建模撕裂与形变过程。作者构建 FracSim 生成带有密集像素对齐物理场的断裂视频数据,用联合预测和物理约束损失训练模型。实验显示,FracGen 在物理保真度和视觉保真度上均优于现有视频生成基线,并可控制撕裂位置、裂纹传播速度及失效前形变量。
推荐理由:论文将断裂模拟产生的物理场用于视频生成训练与约束,为可控物理动态建模提供了具体技术路径。
研究团队提出 LIFT 图像到视频生成框架,用最后一帧布局控制未来视图中应出现的内容及其位置。该方法通过在策略自蒸馏,将密集布局教师的控制能力迁移到最后一帧布局学生,并构建包含大视点变化、相机与时序一致布局标注的 LIFT-Vista 数据集;实验显示其视频质量、未来布局可控性和相机可控性优于其他方法。
推荐理由:论文把最后一帧布局引入大视点变化的视频生成,为未来画面内容与空间位置的联合控制提供了可复用思路。
论文提出HelixWorld,使视觉场景与基于相机的空间立体声音在用户交互下共同演化。研究通过6-DoF相机轨迹和用户动作进行训练,并将模型蒸馏为低延迟流式模型,在单GPU上以24 FPS生成无漂移的音视频轨迹。论文还提出空间声学一致性与HelixBench,用于评估声音场是否跟随动态视点变化。
推荐理由:论文将空间立体声纳入实时世界模型,并以24 FPS单GPU交互和HelixBench展示音画协同建模与评测路径。
Hugging Face 的最新研究提出三项测试,用于量化语音识别模型针对公开基准进行优化的程度,并评估了 11 个常用开源 ASR 模型。
推荐理由:研究把参考文本错误、静音数字和拼写切换转化为三项可量化测试,为语音模型选型和评测集设计提供了具体方法。
Real World VoiceEQ 评估语音 AI 的人类交互质量,覆盖 40 多个专有和开源语音模型、15 多个维度及 60 多项指标。该基准基于超过 1 million 个人类评分,涵盖 ASR、TTS、S2S 和语音理解,结果显示不同模型在技术准确性、情绪理解、表达力与鲁棒性之间存在明显专长差异。
推荐理由:该基准将语音模型评测从 WER 和延迟扩展到情绪、身份与背景声等人类感知维度,可帮助定位真实对话中的听辨与回应短板。
Google DeepMind 宣布 AI co-clinician 研究计划,探索在医生临床监督下由 AI 智能体协助患者护理,并评估其面向医生和患者的能力。在98个真实感初级保健问题中,系统有97个案例未出现关键错误,并在开放式药物问答中超过其他前沿 AI 系统。实时音视频远程医疗模拟显示,AI co-clinician 在140项会诊能力中的68项达到或超过初级保健医生,但医生整体表现更好。
推荐理由:文章同时给出证据检索、药物问答和实时多模态会诊的评测设计,可用于理解医疗智能体的能力边界与临床安全架构。
字节跳动 Seed 团队发布 Seedream 3.0 技术报告,该原生高分辨率中英双语图像生成基础模型相比 2.0 在分辨率、结构准确性、小字生成与排版、美感等方面提升,可原生 2K 直出、1K 分辨率端到端约 3 秒出图,已在豆包、即梦全量开放。
推荐理由:技术报告披露了缺陷感知数据扩充、跨模态 RoPE 与推理蒸馏等做法,可借鉴到高分辨率文生图的数据与加速方案。