Liquid AI 发布 LFM2.5-VL-DSpark 草稿模型,为 LFM2.5-VL-3B 加速视觉语言推理
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下提升推理速度。该草稿模型增加 280M 参数(约 8.9%),在设备端解码最高加速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,通过投机解码在不改变输出质量的前提下提升推理速度。该草稿模型增加 280M 参数(约 8.9%),在设备端解码最高加速 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。
Hugging Face 发布 LeRobot v0.6.0,引入 VLA-JEPA、FastWAM、LingBot-VA 三个世界模型策略,让机器人策略在训练中预测未来、推理时零额外成本。
字节跳动 Seed 团队发布视觉空间重建模型 Depth Anything 3(DA3),作为 Depth Anything 系列最新开源续作,将单目深度估计能力扩展至任意视角。
推荐理由:官方给出单一 Transformer 架构与深度-射线统一表征的设计取舍,以及相对 VGGT 的精度提升,可供空间重建选型参考。
Perceptron AI 发布 Isaac 0.1,一个 2B 参数的开源权重视觉语言模型,面向有依据的感知任务,现可在 Replicate 上运行。该模型能回答图像问题、推理空间关系、在杂乱环境中读取文字,并给出与答案对应的边界框或区域以提供依据。官方称其在 OCR、物体识别和视觉推理上可媲美体量大得多的模型,且仅需少量标注示例即可适配新任务,无需微调。
推荐理由:可了解一个 2B 开源视觉语言模型在 OCR、空间推理与少样本适配上的定位,供选型参考。
Hugging Face 发布 Diffusers v0.35.1,重点改进 Qwen-Image Edit。该版本包含 PR #12188 和 #12190,贡献者为 naykun。
Diffusers 发布 v0.33.1,修复了 wan pipelines 的 ftfy 导入问题,该修复由 @yiyixuxu 在 #11262 中提交。此版本距上一版本已有 1620 次提交。
Fal.ai 发布 68 亿参数开源文生图模型 AuraFlow,性能对标闭源方案。研究者推出 llama.ttf,将完整语言模型推理引擎嵌入字体文件。Google DeepMind 提出 JEST 方法,数据筛选效率比随机采样高 13 倍,可用 10 倍更少算力训练高质量多模态模型。