AI 智能体从照片生成 3D 场景,却无法判断自己是否做对
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来重建 3D 场景。
研究团队提出 Image-to-Code 方法,让编码智能体从单张照片编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来重建 3D 场景。
Voice Arena 与 Hugging Face 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言标签页上的首个印度语言。
推荐理由:公开 ASR 榜单首次纳入印地语与印度英语,并公开说话人元数据与格参考,可用于判断语音模型的地域偏差。
Hugging Face 发布 LeRobot v0.6.0,引入 VLA-JEPA、FastWAM、LingBot-VA 三个世界模型策略,让机器人策略在训练中预测未来、推理时零额外成本。
Replicate 发布 AI 视频模型对比,列出 Google Veo 3、字节 Seedance 1、MiniMax Hailuo 02、快手 Kling 2.1。
豆包实时语音大模型正式推出,并在豆包 APP 全量开放,升级至 7.2.0 版本即可体验。该模型是语音理解与生成一体化的端到端语音系统,相比传统 ASR+LLM+TTS 级联模式,具备低时延、对话中可随时打断、情绪承接和语音指令控制等特性,主要面向中文语境,可进行英语对话但暂不支持多语种。
推荐理由:官方给出端到端语音架构、众测维度与满意度对比,可用于判断实时语音交互的落地程度与能力边界。