跳到正文

#数据/训练

今日 0 条
10月2日周五
  1. Hugging Face Blog70

    AutoSynthData 将模型失败转为企业智能体训练数据

    ServiceNow CoreAI介绍 AutoSynthData,它利用目标模型的失败和更强教师模型的成功,生成并验证适用于企业环境的智能体训练任务。该流程通过可执行性检查、正负验证、修复和批次覆盖审查筛选数据,并将训练目标移向模型仍然困难的能力边界。

    推荐理由:文章把企业智能体训练拆成失败诊断、任务生成、环境执行和正负验证闭环,为构建可复用且难度贴合的 SFT 数据流程提供了具体参考。

10月1日周四
  1. Runway · 研究与模型81

    Runway 宣布开放权重世界动作模型 Praxis-1

    Runway宣布Praxis-1,这是其首个开放权重世界动作模型,目前正与早期伙伴在不同机器人具身和环境中测试,并计划未来几个月公开发布。Praxis-1基于大规模视频预训练,Runway称其在世界模型中模拟机器人策略与现实结果的相关性达到0.95。早期测试伙伴包括Noble Machines、Standard Bots和Ultra,模型将在各自硬件上运行。

    推荐理由:Praxis-1将视频预训练用于跨具身机器人策略,并以0.95相关性仿真结果和多种硬件测试说明其开放权重路线。

9月30日周三
  1. Google DeepMind66

    Google DeepMind 发布 SynthID Bio,为 AI 设计蛋白质加入可验证水印

    Google DeepMind 发布 SynthID Bio,可将不可感知的签名嵌入蛋白质序列或预测的3D结构,并在合成后的实体蛋白质上验证来源。实验覆盖 VEGF-A、SARS-CoV-2 spike protein RBD 和 PD-L1 三种目标,水印设计保持了未加水印版本的命中率、结合亲和力和天然序列多样性。Google DeepMind 同时开放方法论文、代码、体外数据和研究权重。

    推荐理由:文章同时给出蛋白序列与3D结构水印的实现路径、实验边界和开放内容,便于判断其在生物安全审查与科研数据库溯源中的落地位置。

9月3日周四
  1. Hugging Face Blog66

    用 TRL 和 OpenEnv 训练编码模型画水彩

    作者用 TRL 和 OpenEnv 复现了 Surya Narreddi 让语言模型通过 p5.brush 写 JavaScript 画水彩的思路,参考池、RL 环境、训练脚本和训练好的模型全部开源,整条流程跑在 Hugging Face 上。

    推荐理由:完整公开了一套用 RL 训练模型写代码作画的流程与全部产物,可借鉴其奖励设计与环境搭建思路。

8月28日周五
  1. Hugging Face Blog62

    Open ASR Leaderboard 新增首个全球南方语言:印地语与印度英语评测集

    Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言标签页上的首个印度语言。

    推荐理由:公开 ASR 榜单首次纳入印地语与印度英语,并公开说话人元数据与格参考,可用于判断语音模型的地域偏差。

8月14日周五
7月28日周二
7月27日周一
7月6日周一
  1. Hugging Face Blog62

    Photoroom 详解 PRX 数据策略:从 Lance 构建到 MDS 流式训练

    Photoroom 发布 PRX 系列第四篇,介绍其预训练数据管线:混合公开与内部数据集,用 VLM 重新生成约 100-200 词的长描述,再转为 MDS 供训练流式读取。

    推荐理由:Photoroom 公开 PRX 预训练数据管线的取舍与实测数据,为自建文生图数据流程提供可迁移的工程参考。

6月3日周三
  1. World Labs · 空间智能与世界模型62

    World Labs 提出世界模型功能分类:渲染器、模拟器与规划器

    World Labs 发布文章,把当前被称为世界模型的能力拆成三类功能:渲染器输出像素、追求视觉保真;模拟器输出状态,要求几何、物理与动力学忠实;规划器输出动作,回答智能体下一步该做什么。

    推荐理由:World Labs 把世界模型拆成渲染、模拟、规划三类,并说明模拟为何是连接视觉与行动的关键环节。

11月27日周四
  1. ByteDance Seed · 视觉生成与编辑77

    字节跳动 Seed 发布 Depth Anything 3,单一 Transformer 实现任意视角空间重建

    字节跳动 Seed 团队发布视觉空间重建模型 Depth Anything 3(DA3),作为 Depth Anything 系列最新开源续作,将单目深度估计能力扩展至任意视角。

    推荐理由:官方给出单一 Transformer 架构与深度-射线统一表征的设计取舍,以及相对 VGGT 的精度提升,可供空间重建选型参考。

4月16日周三
  1. ByteDance Seed · 视觉生成与编辑82

    字节 Seed 发布 Seedream 3.0 文生图模型技术报告

    字节跳动 Seed 团队发布 Seedream 3.0 技术报告,该原生高分辨率中英双语图像生成基础模型相比 2.0 在分辨率、结构准确性、小字生成与排版、美感等方面提升,可原生 2K 直出、1K 分辨率端到端约 3 秒出图,已在豆包、即梦全量开放。

    推荐理由:技术报告披露了缺陷感知数据扩充、跨模态 RoPE 与推理蒸馏等做法,可借鉴到高分辨率文生图的数据与加速方案。

3月28日周五
8月2日周五
7月12日周五