跳到正文

全部动态

今日 8 条
今天10月3日周六
  1. 宝玉12

    宝玉回应如何保持高质量高频分享,称自己大量使用 AI 并把经验分享出来,习惯把日常零散的点串起来,每次输出都是前一次积累的结果。他举例刷到 Shivon Zilis 八卦后,用 Opus 5.5 尝试剪辑八卦视频,发现效果还可以,便顺手把结果和提示词一起分享,写作成本低更容易坚持分享。

    引用熵减zz@shangjian_zz

    @dotey 宝玉老师怎么做到这么高质量和频率的分享的🥹 我感觉我每次踩完坑或者实践中想到了好点子,往往在过程中就把多巴胺耗尽了,真正总结输出的时候又不够结构化,也没有那么有分享欲了,效率很低。 求教宝玉老师

  2. 宝玉29

    宝玉尝试用 Opus 5.5 制作吃瓜视频,全程由模型自己找素材、自己配音,配音使用 Gemini 3.8 Flash TTS(自备 API Key),并产出了英文和中文两个版本。

    引用Shivon Zilis@shivon

    It’s hard to go from in love to let go in a week with no warning, but that’s just how it is sometimes 🤷🏻‍♀️ I feel happy that I got to show Elon how it feels to be deeply understood, nurtured, and peacefully loved with stability and gentleness. Given the tumultuous nature of his early life, his often tortured soul, and how hard he fights for humanity I wanted him to feel the deepest and most stable form of love this world can provide. My heart is full knowing I got to do that, and I hope it leaves a lasting good effect. We were always his safe space. A place where all of us were overjoyed to see him and one that was always full of happiness and love, not war, in contrast to his otherwise militant existence (a needed break from the battlefield where he could recharge his heart and soul before heading back out) I loved being that counterbalancing place of safety, sense of calm, and love — and delighted in bringing a smile back to his face when he was down. I will miss him dearly. I’ve loved him more than life itself and he’s taught me 100 lifetimes of knowledge and made my cup overflow with life meaning, so there is a lot of loss, but luckily we created four beautiful little loves of my life ❤️❤️❤️❤️ I am so beyond grateful for our children and they make every single day the best day of my life! I do hope and pray he and I can be great friends and coparents. I’m hurting, but care deeply about E and will always be cheering for his happiness. God speed, Elon, the world is lucky to have you.

10月2日周五
  1. 可灵 · 模型与创作实践73

    Kling 4.0 开启封闭测试,预告 10 月正式发布

    Kling 4.0 现已进入封闭测试,并预告于 10 月正式发布,支持最长 30 秒视频生成。官方介绍了稳定动态运动、立体声、高准确度口型同步、4K 分辨率和 10-bit HDR 输出等升级。Johnson Sheng 的商业制作实测显示,模型可用主体与场景素材生成单条 30 秒打斗镜头,并在快速运镜、复杂动作和道具跨镜头一致性测试中保持稳定。

    推荐理由:文章以商业广告实测为主线,呈现 Kling 4.0 在动态镜头、30 秒长镜头和商品跨镜头一致性上的具体表现,可供创作流程评估参考。

  2. NVIDIA Blog72

    NVIDIA DGX Spark 推出 64GB 配置,支持双机集群扩展本地 AI

    NVIDIA DGX Spark 将推出 64GB 统一内存配置,支持在设备上运行最多 100B 参数模型,起售价为 $4,999。两台设备可通过 NVIDIA Sync Cluster Assistant 组建 128GB 集群,将模型支持范围扩展至最多 200B 参数;NVIDIA 在 Qwen 3.8 27B 测试中称,双机性能最高达到单机的 1.7x。

    推荐理由:64GB 配置提供了从单机本地智能体到双机集群的渐进路径,适合评估本地推理、长上下文和多智能体工作流的硬件需求。

  3. arXiv · 多模态、视频与世界模型66

    PRISM:用范畴论测量和优化多模态类比

    论文提出 PRISM(Pullback Refinement via Interpretable Structural Mapping),用基于范畴论的显式关系映射和 pullback score 衡量多模态类比的关系对齐。在 AnaloBench 上,仅依据 pullback score 选择正确类比的准确率为 82.5%;迭代修正也提升了视觉隐喻的一致性与恰当性,但可能偏向视觉更拥挤的构图。

  4. arXiv · 多模态、视频与世界模型79

    VTR-Bench:系统评测视频生成中的视觉文本渲染

    研究提出VTR-Bench,用于系统评测视频生成模型在场景文本渲染上的表现。基准包含覆盖五类场景的300个提示词,并通过结合人工对齐的自动化流程分别评估文本保真度及场景、运动要求。对11个模型的实验显示,最佳模型整体词错误率(WER)为0.250,研究还提出由Director agent协调图像与视频生成、视觉评估和迭代筛选的Keyframe-Guided Agentic Framework。

    推荐理由:VTR-Bench将视频生成中的文本渲染拆分为可测指标,并用11个模型的结果呈现当前短板,为广告和科学视频的模型评测提供了具体参照。

  5. arXiv · 多模态、视频与世界模型84

    Oneira:从开放式生成走向视频世界模型的开放世界交互

    Oneira提出一种通过显式世界状态连接生成与交互的视频世界模型,使新生成或发现的对象能够被纳入可操作环境。编码智能体根据观察和动作读取、更新世界状态,并将交互结果持续带入后续视频片段;实验显示,模型可与新生成对象直接且一致地交互,并在较长时间范围内保留此前交互的影响。

    推荐理由:论文将视频世界模型的交互能力拆分为开放世界交互与持久状态,为评估生成环境能否支持长期可控探索提供了具体框架。

  6. arXiv · 多模态、视频与世界模型80

    DiVid 诊断视频生成模型的分维度多样性坍缩

    论文提出 DiVid,将视频生成多样性拆分为语义、风格、主体、场景、运动和摄影机六个维度。对代表性视频生成模型的系统评测显示,模型可能拥有较高全局多样性分数,却在运动和摄影机等因素上坍缩;这些差异在过滤不忠实生成后仍然存在。受控提示词实验进一步归纳出默认模式收敛和实现缺口两类瓶颈,框架计划发布以支持后续研究。

    推荐理由:DiVid将视频多样性拆成六个维度,并区分默认模式收敛与实现缺口,可为评测和训练目标设计提供更细的定位框架。

  7. arXiv · 多模态、视频与世界模型61

    时间序列世界模型中预测精度与机制一致性的分歧

    该论文形式化并基准测试时间序列世界模型,发现预测误差与模型对改变后行动的机制一致性可能明显分离。基准涵盖八个公开数据集、七种骨干网络和五个随机种子;冻结潜在预测空间使平均 MAE 降低 9.9%,门控输出融合较输入拼接降低 12.7%。方向监督可在不改变 MAE 的情况下提升受惩罚机制上的一致性。

  8. arXiv · 多模态、视频与世界模型72

    《Walking the Embedding Space》研究多模态 RAG 的数据存储提取攻击

    论文提出一种针对返回图像的多模态 RAG 系统的自适应黑盒数据提取攻击,将恶意指令嵌入用户输入图像,并通过检索反馈探索嵌入空间。在单次 2500 次查询中,该方法最多重构 611 张放射学图像、566 份文档扫描件和 416 张通用图像,获得的数据存储项数量最高为非自适应基线的 5.6 倍。

  9. arXiv · 多模态、视频与世界模型83

    多模态 RL 如何学会看:Same Reward, Different Skills 研究视觉学习信号

    论文研究发现,即使训练时不使用视觉信息,模型在测试时仍能恢复部分真实图像带来的能力增益,但持续使用真实图像训练可能削弱 grounding。作者提出 visual resolvability 设计规则,并在反事实坐标场景中用 GRPO 训练 7B 模型,使目标发现准确率从 0.425 提升至 0.875。

    推荐理由:论文提出视觉可解性这一设计规则,并用对照实验区分图像出现在提示中与视觉证据真正进入学习信号的差异。

  10. arXiv · 多模态、视频与世界模型59

    TouchTherm 构建支持触觉与热渲染的多模态物体数字孪生

    论文提出 TouchTherm,用真实物体构建可用于视觉、触觉与热渲染的多模态数字孪生资产。系统结合结构光扫描、多视角法线图和同步红外视频,分别重建微观表面高度场与受物理约束的动态热场。在 20 个物体上,30 s 和 45 s 的留出表面温度 MAE 分别为 0.465 °C 和 0.592 °C,生成的资产还支持触觉观测下的合成到真实物体识别与手套式 VR 热反馈。

  11. arXiv · 多模态、视频与世界模型68

    ExpertLens 通过多模态 MoE 领域专家实现高效适配

    论文提出数据无关方法 ExpertLens,从预训练多模态 MoE 的路由权重中识别领域专长专家,并选择性微调目标领域相关专家。在数学、医疗和遥感任务上,该方法仅更新 21.7 - 47.0% 的模型参数,平均训练速度提升 4.0x,效果达到或超过全量微调。ExpertLens 在适配性能和训练效率上均优于 LoRA。

  12. arXiv · 多模态、视频与世界模型79

    MosaiChunk:用时空记忆拼接提升自回归视频生成的一致性

    MosaiChunk提出一种时空记忆机制,将跨空间与时间选择的历史KV条目组成马赛克,以帮助自回归视频生成在长时生成中保留对象和场景细节。该方法冻结视频生成器,仅训练一个轻量路由器,并发布包含T2V和I2V划分的RememBench;在匹配的记忆预算下,其重访一致性优于滑动窗口推理和整块检索。

    推荐理由:MosaiChunk展示了在固定活跃记忆预算下,通过选择历史KV片段提升长时视频重访一致性的实现思路。

  13. arXiv · 多模态、视频与世界模型85

    4Director:用刚性 3D 几何控制视频世界模型

    论文提出4Director,一种以显式4D场景表示控制相机和物体运动的视频世界模型。它为每个物体重建规范网格,并为每帧指定刚性变换,再通过Motion Adapter生成视角一致的外观、光照和非刚性动态。

    推荐理由:论文将刚性3D几何、视频生成和身份保持评测结合,为可控视频世界模型的设计与比较提供了具体参考。

  14. arXiv · 多模态、视频与世界模型83

    World Observer 通过联合演员与观察者生成实现持久世界建模

    论文提出 World Observer,通过联合生成面向智能体视角的演员和观察选定区域的全景观察者,让离开演员视野的物体继续演化并在重新进入时恢复更新后的状态。该方法基于共享全景源进行几何对应,并引入高分辨率透视参考的 Observer Sink,同时提出用于评估视野外演化的世界空间指标和覆盖真实、合成场景的基准。

    推荐理由:论文将视角外物体的持续演化转化为可观测、可评测的问题,为世界模型的空间覆盖与状态保持提供了具体设计和基准。

  15. arXiv · 多模态、视频与世界模型82

    HiPhy:通过层级对齐实现符合物理规律的多原理视频生成

    HiPhy提出一种基于强化学习的层级物理对齐框架,使视频生成同时遵循多个物理原理并保持场景的物理与语义一致性。研究构建了包含 50K 提示词的数据集和 MultiPhyBench 基准,实验显示 HiPhy 在多个基准上显著优于既有方法,涉及多种并发物理原理的场景提升最大。

    推荐理由:论文将物理规律拆分为局部动态与全局场景一致性目标,并用 MultiPhyBench 支持多物理原理视频生成的比较评估。

  16. Hugging Face Blog70

    AutoSynthData 将模型失败转为企业智能体训练数据

    ServiceNow CoreAI介绍 AutoSynthData,它利用目标模型的失败和更强教师模型的成功,生成并验证适用于企业环境的智能体训练任务。该流程通过可执行性检查、正负验证、修复和批次覆盖审查筛选数据,并将训练目标移向模型仍然困难的能力边界。

    推荐理由:文章把企业智能体训练拆成失败诊断、任务生成、环境执行和正负验证闭环,为构建可复用且难度贴合的 SFT 数据流程提供了具体参考。

  17. The Decoder78

    Black Forest Labs 发布 Flux 3 Image,支持不改变其他区域的多步编辑

    Black Forest Labs 发布 Flux 3 Image,主打在多步编辑中保持图像其他区域不变,并支持文生图、图生图、文字渲染和写实图像。模型支持用边界框构图、最多加入 10 张参考图,输出最高 4K;免费演示已开放,API 在 10 月 8 日前五折,商业权重可授权企业在自有基础设施上运行和微调,开放权重预计未来几周发布。

    推荐理由:Flux 3 Image 将多步局部编辑、参考图和边界框构图结合起来,适合评估图像工作流中的可控性与商品或角色保真需求。

  18. Luma · 创作产品与实践53

    2026 年游戏与电影 AI 预告片生成工具评测指南

    Luma 发布指南,比较游戏与电影 AI 预告片生成工具在概念创作、镜头生成、修订、本地化和交付环节的差异。文章指出 Luma 适合物理运动与局部编辑,Mootion 可从单一提示词生成完整预告片,Runway Gen-4 侧重电影感镜头,Veo 3/3.1 支持与视频同步生成音频,Kling AI 3.0 可生成最长 3 分钟的连续视频。

  19. Luma · 创作产品与实践50

    2026 年建筑师最佳 AI 渲染工具

    2026 年建筑师的 AI 渲染工具选择正从试验转向工作流决策,重点比较建筑信息建模集成、画质与设计修改能力;44% 的建筑师已用 AI 制作概念图,74% 计划增加使用。Luma 以 Ray 3.2、图层编辑、场景变换和可重复工作流覆盖从概念图到动画制作;Veras 可直接连接 Revit、SketchUp、Rhino 等六个平台,Enscape 则提供实时渲染与虚拟现实漫游。

  20. Luma · 创作产品与实践28

    2026 年最适合儿童内容的 AI 卡通视频生成器

    面向儿童内容的 AI 卡通视频生成器,核心不是单个片段的惊艳效果,而是跨集保持角色外观、声音和风格一致,并支持高频完成系列制作。Luma 的 Ray 3.2 提供电影级视频、多关键帧序列和精确摄像机控制;Luma Skills 可保存并重复执行从脚本到角色设置再到成片的工作流。LongStories.ai 的 Universe 支持最长 15 分钟的一致角色视频。

  21. arXiv · 多模态、视频与世界模型54

    ScaffoldM3C:用于生成式稳定建造规划的多模态 Sequential Monte Carlo 框架

    论文提出 ScaffoldM3C,一种用于稳定积木式建造的轻量级多模态自回归模型,结合候选区块生成与 Sequential Monte Carlo,同时规划多条装配序列。该模型规模仅为竞品的 1/4,推理速度提升 5x 至 20x,在建造质量相当的情况下实现更高的整体稳定性,并通过仿真和真实机器人装配进行展示。

  22. arXiv · 多模态、视频与世界模型85

    Memorizon:训练超越上下文窗口的世界模型

    论文《Memorizon》提出一种超越上下文窗口训练世界模型的方法,将长跨度重访监督与完整序列注意力解耦。训练样本可覆盖任意长度,但只对最后 k 个 chunks 评分,各 chunk 按相机共视关系检索自身的 top-K latents,共享 bank 上限为 kK;跨度从 100 s 增至 400 s 时,单步耗时增加 12%。

    推荐理由:论文将长跨度重访监督与完整序列注意力解耦,为训练世界模型的时序一致性提供了可复用的检索式方案和成本参考。

  23. arXiv · 多模态、视频与世界模型70

    Gestalt:提出基于多模态交互的大型多模态模型

    Zequn Yang 等作者提出 Gestalt,一种围绕多模态交互构建的大型多模态模型。该模型采用多模态交互金字塔、统一离散扩散框架和通过可学习交互 token 促进跨模态交换的架构,论文称其在图像生成、多模态理解和纯文本评测中提升了跨模态融合,同时保留模态特有信息。