DriftOPD:面向单步VLA策略的序列级反向KL蒸馏
DriftOPD提出序列级反向KL蒸馏方法,将生成短动作块的动作专家式VLA策略压缩为单步策略。该方法无需昂贵的策略rollout与闭环交互,即可显式优化长时程任务成功率,兼顾跨本体训练便利性与推理效率,为VLA模型的高效部署提供了新路径。
DriftOPD通过序列级反向KL蒸馏将VLA动作专家压缩为单步策略,无需闭环rollout即可优化长时程任务成功率;DeepJEPA提出"向内扩展"的世界模型新范式,自适应地为决策关键事件分配更深计算;新研究利用第一人称全身人类视频预训练通用人形全身操作模型;HumanoidTTT实现人形机器人在持续部署中安全复用已验证动作能力
DriftOPD提出序列级反向KL蒸馏方法,将生成短动作块的动作专家式VLA策略压缩为单步策略。该方法无需昂贵的策略rollout与闭环交互,即可显式优化长时程任务成功率,兼顾跨本体训练便利性与推理效率,为VLA模型的高效部署提供了新路径。
DeepJEPA挑战了世界模型 planner "向外扩展"(滚动更远、采样更多)的惯例,指出对所有想象转移施加同等深度的计算是一种浪费甚至有害。该工作提出权重共享的联合嵌入预测架构,自适应地将更深的计算分配给少数决策关键事件,提升规划质量的同时节省算力。
该工作利用第一人称全身人类视频对人形全身操作模型进行预训练,为行走、姿态、双臂交互与灵巧手协调提供无需真实机器人运行的可扩展监督信号。研究重点解决了现有视频监督对全身运动与手部协调覆盖不足的问题,向通用人形loco-manipulation基础模型迈进一步。
针对人形机器人持续部署中相同动作能力被反复调用、但中间动作会改变机器人进入状态从而使盲目回放变得不安全的问题,HumanoidTTT提出测试时能力复用机制,在部署过程中不断积累已验证的动作能力并安全地复用它们,提升人形控制的运行效率。
DexPolicy针对灵巧操作强化学习中"动作噪声有助于发现指-物接触,却干扰精细物体控制"的固有矛盾,提出显式的探索尺度调度机制。在ViViDEx等从人类视频轨迹引导的设置下,该方法显著优于探索噪声几乎不衰减的PPO基线。
该工作将长期物体搜索中的开放词汇记忆建模为对"删失观测"的概率推断,核心洞见是:检测或未检测事件应按机器人对该位置的观测机会按比例更新信念。这使得机器人能从对动态环境重复而不均匀的观测中,学习物体通常出现的位置。
IndoorBEV提出面向室内移动机器人的轻量级LiDAR感知系统,克服了点云与体素方法计算开销大、传统BEV表示丢失垂直几何信息的问题。该系统在严格的时延与内存约束下实现实时感知,适合部署于算力受限的服务机器人平台。
该工作提出循环教师-学生框架,在仿真中联合学习飞行、机械臂与夹爪的单一策略,解决空中抓取-举升任务中目标部分可见、接近失败限制训练暴露等难题,实现接近、抓取、举升三个阶段的全机身协调。
ScaffoldM3C应对自主搭建物理可实现3D结构的核心难题——组合爆炸的动作空间、可互换部件、殊途同归的装配序列与严格的稳定性约束,提出多模态序列蒙特卡洛框架,实现生成式的稳定建造规划。
该论文提出反直觉观点:在面向LLM驱动机器人的治理基准测试中,过度追求物体交接处的接触物理保真度反而会注入审计链分歧等噪声。作者提出以动作捕捉交接替代接触仿真,用"有界保真度"仿真器正确演示准入/策略/合同/审计管线的运行。
该工作提出面向平面多段腱驱动连续体机器人的统一驱动空间框架,基于能量的变曲率模型刻画空间变化的腱间距与弯曲刚度,并提供解析雅可比用于微分逆运动学与安全监测,实现实时全身碰撞规避的运动生成。该类机器人主要面向医疗等场景。
该工作将"可读性规划"(让观察者更容易从候选目标中辨识机器人真实意图)扩展至任意PDDL域,无需构建定制规划器。研究还探讨了如何通过二阶心智理论估计观察者视角,对人机协作场景有参考价值。
本日报由 AI 综合以下公开信息源自动生成:
原始内容版权归原作者所有。如有异议请联系本站。