跳到正文
原文
arXiv · 多模态、视频与世界模型· Kowndinya Boyalakuntla·· 3 天前AI 评分34

超越策略对齐:PL-MPC 闭合学习世界模型机器人控制的规划—学习循环

Beyond Policy Alignment: Closing the Planning-Learning Loop for Robot Control with Learned World Models

AI 导读

研究者提出 PL-MPC(Planning-Learning MPC),通过改进 critic 监督与规划器终端价值估计,闭合学习世界模型机器人控制的规划—学习循环。HumanoidBench 上,balance-hard 的 TAR 从 $98±18 升至 $387±255,hurdle 从 $199±13 升至 $466±200,表现仍具任务依赖性。

来源:arXiv · 多模态、视频与世界模型 · arxiv.org