一套策略驱动机械臂、人形与人手:小米提出以相机为中心的动作空间
小米具身智能团队与澳门大学绕开“每个数据集一个适配分支”的行业惯例,用相机可见的锚点运动重新定义动作,使机械臂、人形机器人与人手成为同一动作模式的不同载体。单一检查点无需任务微调即在LIBERO取得98.3%、LIBERO-Plus零样本82.0%、RoboTwin高难场景89.2%。
软银洽谈以60亿美元估值收购人形机器人公司1X控股权,在出售波士顿动力五年后重返人形赛道;小鹏发布第二代VLA,将时间维度纳入模型,同时Robotaxi获广州远程测试资质;韩国计划2030年前投资2.3万亿韩元发展全栈人形机器人;小米团队提出以相机为中心的统一动作空间,单一策略覆盖机械臂、人形机器人与人手
小米具身智能团队与澳门大学绕开“每个数据集一个适配分支”的行业惯例,用相机可见的锚点运动重新定义动作,使机械臂、人形机器人与人手成为同一动作模式的不同载体。单一检查点无需任务微调即在LIBERO取得98.3%、LIBERO-Plus零样本82.0%、RoboTwin高难场景89.2%。
该工作认为操作任务最自然的规范不是语言而是人类视频,并通过自动管线将机器人轨迹转化为语义匹配的人类视频,构建了覆盖8.6K任务的74.2K对数据集HumanGen。在RoboTwin 2.0的七个未见任务上平均成功率达47.0%,高出最强基线29.5个百分点。
StreamPI将每个(视觉观测,语言指令)对视为原子时间单元,单元内用双向注意力做跨模态融合,单元间用因果注意力保持自回归流式推理,语言指令全程充当语义锚点。在真机记忆与精细感知任务及LIBERO上超越pi0.5,并可直接继承单帧预训练权重。
现有VLA将视觉观测编码为缺乏内在几何结构的扁平2D patch token,单目深度也只提供逐像素标量而无法表达表面朝向与几何置信度。GaussVLA基于Mamba架构引入两个高斯自定义模块,为动作预测提供结构化空间推理能力。
针对动作块级触觉条件冻结在执行前时刻、实际使用“过期信息”的问题,TacForcing用流式动作专家替换标准动作专家,使动作生成能跟踪执行期间持续到达的触觉观测。在六个UniVTAC仿真任务和三个真机富接触任务上平均成功率分别达65%和69%。
作者构建51个模型×12个基准的评测矩阵,发现基准间存在显著冗余:合并两对可互换基准会使22个模型的等权平均排名变动超过3位。基于分数离散度的贪心选择显示,仅用4个基准即可保留全部12个基准78.5%的评估效用。
据报道软银正洽谈以60亿美元估值收购人形机器人公司1X的控股权。这是软银在五年前出售波士顿动力之后,重返人形机器人赛道的标志性动作。
小鹏Robotaxi获得广州远程测试资质,正式进入前排无人的道路测试阶段,标志着其自动驾驶商业化向前推进一步。
小鹏第二代VLA把时间维度纳入模型架构,能够记忆过去30秒的驾驶上下文并向前推演6秒。这一时序能力有望改善复杂交通场景下的决策连贯性。
韩国宣布计划到2030年投入2.3万亿韩元,支持覆盖软硬件全栈的人形机器人技术研发。此举被视为对该国在全球人形机器人竞争中的战略性加码。
天工Ultra在人形机器人百米决赛中以8.64秒完赛,展现了国产人形机器人运动控制能力的持续突破。智元以46枚奖牌领跑奖牌榜,成为赛事最大赢家。
Waymo基于2亿英里自动驾驶运营数据发布十条经验教训,明确指出从L2辅助驾驶“升级”到L4自动驾驶并非渐进路径,而是一座虚假的山峰——两者在技术栈、责任主体和安全验证上存在本质差异。
本日报由 AI 综合以下公开信息源自动生成:
原始内容版权归原作者所有。如有异议请联系本站。