开源1500小时双臂数据并训练VLA模型XR-2,数据扩展仍未见拐点
双臂家庭操作的公开数据长期停留在千小时以下,本工作一次性开源1500小时日常家务演示,并据此训练VLA模型XR-2。作者沿增加专家演示与DAgger式人工干预修正数据两条轴进行扩展实验,成功率随数据量稳步上升,在已探索范围内未观察到饱和拐点,数据集随论文同步发布。
优必选中标山西15亿元项目,人形机器人将下井进入煤矿作业;中国《道路交通安全法》修订草案增设自动驾驶专章,功能激活期间违法责任划归车企;MINERVA仅用0.54M参数在LIBERO达成95.1%成功率,揭示该基准或存在任务记忆化问题;法国Wandercraft签约12家Calvin-40外骨骼客户,雷诺计划18个月内部署350台
双臂家庭操作的公开数据长期停留在千小时以下,本工作一次性开源1500小时日常家务演示,并据此训练VLA模型XR-2。作者沿增加专家演示与DAgger式人工干预修正数据两条轴进行扩展实验,成功率随数据量稳步上升,在已探索范围内未观察到饱和拐点,数据集随论文同步发布。
硬件与控制解耦开发是人形机器人动作不像人的长期根源,该文提出数据驱动的形态-控制协同优化框架,并定义同时度量运动重定向保真度与动态跟踪性能的新指标。对比Bumi、K1、ToddlerBot三个基线人形全面取得SOTA,并开源88cm高的Bridge平台及配套控制策略。
VLA在有限且同质的演示数据上训练,容易学到传感器模态间的伪相关,作者称之为模态纠缠。EGR利用逐帧、逐传感器的任务相关性信号做门控并施加两个一致性约束,推理零额外开销;在带物理干扰物的双臂Kinova平台上成功率从30%升至85%,在视觉+GelSight触觉单臂平台上从55%升至70%。
世界模型让策略在想象中试错,但算力昂贵,且过长的想象rollout会累积预测误差并回馈不可靠的监督信号。WISE仅在交互相关的状态触发有界的多视角想象,并用进度与完成信号评估候选未来,同时改进π0与π0.5的表现,相比全量想象节省约80%的GPU计算时间。
机器人数据昂贵、长尾任务尤难覆盖。给定一段人类操作查询视频,RoboTok从互联网视频中检索相关演示用于灵巧手策略训练:以人中心参考系下的3D手部轨迹学习隐式运动空间,使操作行为跨相机视角、跨场景与遮挡可比较,且足够紧凑以支撑互联网级连续索引,检索相关性与下游任务成功率均优于现有机器人数据检索方法。
双环传动子公司、国内RV减速器头部厂商环动科技在最后时刻撤回科创板IPO申请,机器人核心零部件第一股就此搁浅。这一动向反映出当前资本市场对机器人供应链企业的估值与审核正趋于谨慎,减速器环节的证券化节奏被迫放缓。
优必科(UBTECH)在山西拿下15亿元大单,将人形机器人送入煤矿井下作业,成为人形机器人迄今规模最大的商业化订单之一。高危矿业场景正成为人形机器人规模化落地的先行领域。
法国外骨骼公司Wandercraft宣布签下12家Calvin-40客户,其中雷诺计划在18个月内部署350台。康复与工业辅助外骨骼正从医疗机构走向企业级规模化部署,汽车制造成为重要买单方。
修订草案新增自动驾驶专门章节,明确自动驾驶功能激活状态下发生交通违法的责任由车企承担,为L3+级系统的责任划分提供了法律框架,被视为中国自动驾驶立法的关键一步。
特斯拉Cybercab上路仅数小时,美国国家公路交通安全管理局(NHTSA)便开启调查,审查其自证符合安全标准的依据。无人驾驶Robotaxi的自认证路径与监管边界问题再度成为焦点。
LIBERO榜单已被十亿参数级VLA统治,该文反向追问基准本身需要多大容量:仅0.54M参数的策略在四套标准任务上取得95.1%平均成功率,比LeRobot报告的π0.5低2.4分,参数量少7700倍,笔记本CPU上每chunk推理仅5-9毫秒。更关键的是,任务ID置换探针仅打乱任务索引映射便使成功率降至随机水平,暗示标准LIBERO的指令条件化很大程度上是在记忆任务;在LIBERO-Plus扰动集上则滑落至46%-56%。
用VLM判断机器人任务成败正成为默认做法,但跨领域可靠性鲜有量化。该工作从14个公开来源收集2197次操作尝试(75%为自然发生失败),测试13个VLM检测器,最好的平均平衡精度仅0.77;专为失败检测微调的模型反而稳定低于通用VLM及其预训练基线。在接触密集的装配任务上得分跌破0.60,且当证据模糊时,模型系统性偏向判定为成功。
本日报由 AI 综合以下公开信息源自动生成:
原始内容版权归原作者所有。如有异议请联系本站。