OpenRUA:机器人使用智能体即零样本视觉运动策略
编码智能体正通过编写和执行机器人控制程序进入物理世界。本文挑战了以往为机器人使用智能体定制复杂专用工作流和接口的做法,证明智能体可以直接以零样本方式调用工程师数十年积累的成熟机器人软件栈来访问传感器和控制运动,为LLM智能体驱动机器人提供了更简洁的范式。
OpenRUA提出机器人使用智能体即零样本视觉运动策略,无需定制接口即可让编码智能体直接调用成熟机器人软件栈;VLA动作生成新范式:世界校准的提议到动作流让预测世界表征直接决定动作分布;人形机器人安全新进展:滤波器感知微调让RL全身跟踪与控制屏障函数安全滤波器协同工作;CriticHack警示视觉奖励模型的'错误对象操作'失效模式可能在指标看似健康时被策略优化持续放大
编码智能体正通过编写和执行机器人控制程序进入物理世界。本文挑战了以往为机器人使用智能体定制复杂专用工作流和接口的做法,证明智能体可以直接以零样本方式调用工程师数十年积累的成熟机器人软件栈来访问传感器和控制运动,为LLM智能体驱动机器人提供了更简洁的范式。
现有基于流匹配的VLA策略从任务无关的各向同性高斯源采样生成动作块,既丢弃了近期执行动作建立的局部连续性,也无法让预测性世界表征真正决定动作落点。本文提出世界校准的提议到动作流,让世界模型直接约束动作生成的目标分布,改进VLA的动作生成质量。
人形机器人在非结构化环境部署需要安全的全身运动。该工作将运行时安全滤波器(如控制屏障函数CBF)与强化学习跟踪策略协同设计,在微调阶段让策略显式感知滤波器的存在,在保证动态可行与安全约束的同时提升全身跟踪性能。
视觉-触觉机器人数据稀缺是灵巧操作的核心瓶颈:机器人遥操作演示成本高,而人类演示虽便宜却要求人手与机器人手的触觉信号可对应。SoTa为人类与机器人手配备信号对应的软触觉皮肤,打通了用人类演示规模化采集触觉数据的路径。
机器人演示的同一帧画面同时记录了'物体发生了什么'和'某只特定的臂如何做到',本文选择只以效果为条件:将演示编译为效果程序——被移动物体的3D关键点轨迹、抓持点与终态场景配置,并剔除演示者信息。71.5M参数的PEWAM据此生成效果与机器人执行,为跨具身迁移提供了新思路。
长时程组合操作是机器人真实部署的关键需求,但现有世界-动作模型联合预测短时视觉未来与动作,缺乏子任务级的显式推理。本文提出分层框架ViGAR,将操作分解为视觉子目标预测与动作推理两个层级,并支持上下文内任务泛化。
VLA策略执行中可能失败而不自知,而人类观察者的语音、表情等自发反应往往在失败完成前就已出现。SocialVLA构建本地、策略无关的社会感知网关,将这些人类反应转化为运行时干预信号,实现VLA操作的失败检测与恢复。
本文揭示视觉奖励模型的一个危险失效模式:对'操作了错误对象'的执行给出与完成任务同样高的分数,且随着奖励与任务成功率同步上升,此类错误会被扩散策略优化持续放大——而从业者常规监控的信号看起来一切正常。该工作为基于视觉奖励的机器人策略训练敲响警钟。
生成有用的机器人训练数据不仅需要视觉上合理的场景:物体必须支持交互、摆放必须物理有效、任务必须可重复执行。Awomo-SimDataEngine用智能体化系统将资产生成(含结构支撑的零件与关节生成)、场景构建与机器人演示合成端到端打通,规模化产出仿真就绪的训练数据。
机器人演示即使在单条episode低效或失败时也蕴含有用行为。本文提出离线数据增强算法NEEDLE,直接在高维机器人数据中识别有用的轨迹连接点并验证其可行性,将碎片行为缝合重组为更优的训练数据,突破以往依赖低维状态表示的方法局限。
发布MoRoOp数据集,记录实验室套件准备与供应场景中9个8小时班次的AMR运行数据,涵盖随机生成的套件供应、空箱补给与充电三类作业。数据集将作业规格、调度事件与机器人状态关联起来,为生产物流中的AMR调度与运营研究提供了真实基准。
本日报由 AI 综合以下公开信息源自动生成:
原始内容版权归原作者所有。如有异议请联系本站。