SWAP:面向视觉-语言-动作模型的逐步动作策略路由
单一VLA模型难以在所有任务状态和环境下保持高性能,SWAP提出在执行过程中动态组合多个VLA策略的框架,将策略路由形式化为离线强化学习问题,通过学习路由评价器逐步决定调用哪个策略。
SWAP提出VLA策略动态路由框架,将多模型组合形式化为离线强化学习问题;新研究以安慰剂对照实验质疑冻结VLA上学习型纠正器的实际价值;BRACE使人形机器人全身跟踪同时感知交互力与地形;ProactiveVLA通过主动环境探索增强具身记忆
单一VLA模型难以在所有任务状态和环境下保持高性能,SWAP提出在执行过程中动态组合多个VLA策略的框架,将策略路由形式化为离线强化学习问题,通过学习路由评价器逐步决定调用哪个策略。
在为冻结VLA策略部署运行时恢复机制前,需先证明干预效果超出正常的运行间波动。作者在冻结的π0.5上、四个RoboTwin任务中引入同种子基策略重跑作为安慰剂对照,严格评估学习型纠正器是否优于简单的撤退动作。
结合推理智能体与冻结VLA的系统依赖执行反馈和记忆来适应新环境,因此经验的选择至关重要。ProactiveVLA指出反复练习目标任务只会精炼熟悉的解法,提出通过主动环境探索来构建更全面的具身记忆。
全身跟踪已成为操作员驾驶人形机器人的核心接口,但参考动作通常在平地空手状态下录制,跟踪器对交互力与地形毫无感知。BRACE统一了只命令末端力而不规定全身姿态的力能力策略与只适应地形的两类现有控制器,填补这一空白。
世界-动作模型联合学习视觉预测与机器人动作,但现有视频与动作损失无法为示范动作序列的几何后果提供显式监督目标。ACG-WAM引入动作条件几何潜空间预测,让世界模型显式刻画动作的几何效果。
人类会通过主动与环境交互来推断物理属性,而现有多种感官机器人系统只做被动的输入融合。ROMA基于LLM构建以物体为中心的主动感知系统,自主判断缺失什么信息、如何获取以及何时证据已充分。
行为克隆虽然方法简单,却在实际应用中表现出许多反直觉现象,例如模型性能常随着对训练数据的进一步过拟合而持续提升。本文对这些谜题展开系统研究,对依赖BC的机器人策略训练具有重要启示。
特权3D监督在训练时利用几何信息指导RGB视觉运动策略、部署时无需几何输入,但低重建误差并不保证表征捕获对控制有用的几何信息。LEAP识别出本体感知捷径、主导视角依赖和任务无关重建目标三大局限并加以改进。
人机物理交互实验长期受制于人类安全约束、IRB审批流程以及被试可重复性与多样性问题。本文提出幻影平台作为人类替身,用于理疗、搜救、远程医疗等场景的人机物理交互研究,大幅提升实验的可扩展性。
多楼层场景下的物体目标导航因长时域决策导致奖励极度稀疏。本文提出层次分解的模块化策略框架,将单一全局策略解构为子策略组合,用于系统性分析多楼层导航的失败因素。
深度神经网络控制的信息物理系统中,微小输入扰动即可引发不安全的系统级行为。现有方法多为单张图像优化扰动且仅在仿真中评估,本文利用可解释AI引导的搜索生成跨操作观测均有效的鲁棒性测试,提升其实践有效性。
提出将等式与不等式约束统一在单一几何形式化框架内的运动规划方法,服务于高维机器人系统的采样式规划。相比传统投影加二值碰撞检测的处理方式,可避免低效的探索行为。
本日报由 AI 综合以下公开信息源自动生成:
原始内容版权归原作者所有。如有异议请联系本站。