Hydra-0:将「动作」表示为像素运动的跨本体世界模型
世界模型难以泛化的一个核心原因是不同机器人的动作空间缺乏统一表示。Hydra-0提出「动作流」(action flow),将机器人动作统一表示为屏幕上的像素运动,使跨本体、跨任务、跨环境甚至不同视频生成骨干的数据都能喂入同一模型。最佳配置下机器人运动误差降低90.4%、物体运动误差降低60.2%,RoboLab上回放成功率与真实成功率的皮尔逊相关系数达0.96(可用于离线策略评估),并支持「逆向模式」——从人类演示的目标物体运动直接反推兼容的机器人动作。
world-modelcross-embodimentaction-representation
QWM:世界模型只做推理时搜索、不训练策略,规避复合模型偏差
传统基于模型的RL直接在「想象轨迹」上训练策略或价值函数,偏差随任务变长、场景变复杂而不断复合。QWM重新定位世界模型的角色:策略与价值函数只在真实交互上训练,世界模型仅在推理时对想象轨迹做测试时搜索以选出高价值动作。在Robomimic和LIBERO上,样本效率与最终性能均显著超越此前最强方法。
world-modelreinforcement-learningtest-time-search
FetchMan:纯仿真训练的人形移动操作策略,真机零样本成功率73.3%
该工作将运动控制领域「仿真训练+sim2real」的成熟配方移植到人形移动操作:仅靠克隆合成演示会触及数据堆不破的性能天花板,必须配合Flow-GRPO在单一稀疏奖励上做强化学习才能突破。训练流程覆盖超15万个场景,策略零样本部署到真实Unitree G1,在未见场景中接近并抓取目标物体的成功率达73.3%。
humanoidloco-manipulationsim2real
VLCP:冻结VLM,在单次任务内自我重写控制代码
将前沿VLM改造成机器人策略通常需要微调,而这会侵蚀其预训练中获得的推理能力。VLCP反其道而行:VLM完全冻结,直接编写一个简短的Python控制函数,无需演示、无需微调;每隔K步重新观察多视角RGB与本体状态,直接重写失败的控制代码而非重试同一策略。在57个MuJoCo/RoboVerse任务上,该免训练策略综合成功率达35.1%,而每回合仅查询一次VLM的同系统只有3.5%,提升主要来自抓取失败后27.3%的回合内自恢复率。
vlmmanipulationtraining-free
ManiGuard:任务成功≠安全成功,6-21%的「成功」轨迹违反安全规范
操作基础模型的任务成功率快速攀升,但「是否安全地成功」很少被严格评估。ManiGuard将安全规范独立于任务成功来定义,用LTLf自动机做运行时物理谓词检查(而非学习式分类器或LLM裁判),在仿真与真实Franka机械臂上运行超2.3万次rollout后发现:6-21%的「成功」轨迹实际违反安全规范。用配套8000条安全标注演示微调后,安全完成率从近零升至7.5-29.8%,但仍有21-42%的干预轨迹违规,且增加数据也难以弥合。
safetybenchmarkmanipulation
关联机器人:franka-arm
Teach and Grow:把部署当持续学习,绕开端到端VLA的「重训练税」
端到端VLA一旦遇到验证覆盖之外的对象、传感器或本体,修正一个错误就要重新采数据、更新策略、重跑回归测试——作者称之为「重训练税」。上海交大团队提出的TGL让多模态智能体将少量成功演示固化为可复用的「技能块」(面向子目标的闭环行为),在新场景中重组、观察物理结果并在偏离意图时改道;技能库与经验记忆持续累积,新任务无需定向重训练策略,在LIBERO基准上达到SOTA。
vlalifelong-learningskill-library