RobotsWiki
返回日报列表
2026年9月10日#88

Physical AI 日报 #88

原文: AI综合多源生成
今日要闻

智元GE-Act 2.0将世界-动作模型联合训练数据从300小时扩至3万小时,真机零样本平均成功率由17.1%跃升至44.1%,并显现跨本体迁移能力;前深动科技副总裁刘念秋创办的PHYMI完成IDG资本领投的近1亿美元种子轮,滴滴、禾赛参投;Analog Devices宣布以13.5亿美元现金收购边缘AI芯片厂商Alif Semiconductor;小马智行在多哈上线无安全员Robotaxi,系其在中国以外首个大规模商业化部署

论文进展

GE-Act 2.0:从零开始预训练的世界-动作模型,数据扩容百倍后零样本成功率翻倍

智元机器人研究团队不再沿用现成视频生成器,生成与动作模块均从随机权重初始化,仅用操作数据训练,并以KASO只筛选与记录动作一致的未来预测作监督。联合训练数据从300小时扩至3万小时后,G1-OP真机零样本平均成功率从17.1%升至44.1%,训练数据占比不足2%的G2-90D也提升17.7个百分点,显示出跨本体迁移;技能覆盖率与零样本OOD成功率的Pearson相关系数达0.80。

world-modelpretrainingdata-scalinghumanoid
关联机器人:unitree-g1-opunitree-g2-90d

OpenWAM:把世界-动作模型预训练拆解为可控对照实验并开源全套基建

现有系统把生成主干、视觉表征、架构、信息流、推理过程与训练数据揉成一个黑盒,无法回答哪些设计真正重要。OpenWAM将设计空间拆解为可组合模块,配套统一的训练、推理、部署与评测,发布基于约6400小时第一人称人类与机器人数据预训练的OpenWAM-α,在8个仿真基准与从单臂、双臂到灵巧手的真机实验中稳居第一梯队,基础设施、评测协议、预训练权重与数据配方全部开源。

world-modelopen-sourcebenchmark

SimpleMemVLA:去掉专用记忆模块,反而在四项记忆基准上刷新纪录

该工作指出检索库、压缩器、循环状态等记忆机制都要在知道未来需要什么之前决定保留什么,其前提是分钟级历史无法直接处理,而现代VLM骨干已推翻这一假设。SimpleMemVLA彻底去掉专用记忆模块,把采样历史作为带时间戳视频直接喂给主干,让生成的子任务隐状态成为历史通往动作头的唯一通道,并复用公共前缀,延迟接近单帧VLA;在四项记忆基准上全面超越检索、压缩与循环状态方案,因果干预证实策略确实读取了历史。

vlamemorylong-horizon

TANGO:人形机器人直接输出29自由度关节动作,零样本穿越杂乱空间

把导航当作二维路径规划在人形机器人穿越杂乱房间时会失效,因为手臂位置、躯干姿态与步态需要连续协同调整。TANGO接收自然语言指令与第一人称RGB输入,直接为全身控制器预测29自由度关节动作,训练完全在仿真中完成(全局规划+运动学生成+避障编辑+RL跟踪)。零样本部署到Unitree G1后即可按语言指令穿越真实杂乱场景,无需任何真实导航数据。

locomotionnavigationhumanoidsim-to-real
关联机器人:Unitree G1

GLoRI:全局-局部交叉注意力修正世界坐标系漂移,G1真机自主完成移动操作

局部参考轨迹保留运动结构却不约束绝对空间位置,导致全局误差持续累积。GLoRI用全局-局部交叉注意力,以全局目标与位姿差特征校正局部关键点特征,在留出的HuMoTo动作上达到100%完成率与6.44 cm的g-MPJPE,并从Isaac Gym零微调迁移到MuJoCo;单一策略即可让真实Unitree G1对多种陌生物体自主完成移动操作,而此前同类系统多依赖遥操作或只能处理单一物体。

locomotionwhole-body-controlloco-manipulation
关联机器人:Unitree G1

ContextFlow:用流匹配骨干做上下文模仿学习,未见任务超ICRT 35个百分点

自回归上下文模仿需要离散化连续动作,早期预测误差沿next-token链不断复合放大,导致在未见任务配置上失败。ContextFlow把演示与观测作为条件输入流匹配模型,用Perceiver式多模态压缩器将视觉、本体感觉与动作序列蒸馏为紧凑隐表征;在LIBERO未见任务配置上平均成功率超ICRT 35个百分点,无任何微调即追平任务专用微调的π0,真机上对未见的笔帽拆卸配置取得40%成功率。

manipulationin-context-learningflow-matching

CosmoH2G:人手到夹爪的演示迁移首次覆盖翻转与旋转等空间复杂轨迹

人手演示迁移到夹爪是廉价数据来源,但现有方法多局限于平面简单任务,在涉及旋转与翻转的空间轨迹上失败。作者构建了可扩展的手-夹爪配对数据采集管线,产出覆盖1254个物体、6189条episode的数据集,空间复杂度显著高于现有基准;方法上先预测稀疏起止关键帧简化映射目标,再基于关键帧生成连续动作,并辅以抓取启发式与运动学一致性后优化来抑制累积漂移。

manipulationdataimitation-learning

融资与投资

前深动科技副总裁刘念秋创办PHYMI,完成IDG领投近1亿美元种子轮

新公司PHYMI由前自动驾驶公司深动科技(DeepRoute.ai)副总裁刘念秋创立,完成近1亿美元种子轮融资,IDG资本领投,滴滴与禾赛科技参投。自动驾驶人才、资本与传感器供应链向具身智能领域迁移的趋势进一步得到验证。

fundingembodied-aiautonomous-driving

Analog Devices以13.5亿美元现金收购边缘AI芯片商Alif Semiconductor

ADI宣布以13.5亿美元现金收购边缘AI芯片公司Alif Semiconductor,另设最高2亿美元的或有对价。Alif专注低功耗终端侧AI推理芯片,交易凸显传统模拟与嵌入式巨头正加速卡位机器人等边缘智能设备的算力入口。

chipsedge-aim-and-a

商业化落地

小马智行在多哈上线全无人Robotaxi,中国之外首个大规模商业化部署

小马智行在卡塔尔多哈启动无安全员的Robotaxi载人服务,公司称之为其在中国以外的首个大规模商业化部署。这标志着中国自动驾驶公司向中东市场的规模化出海迈出实质性一步。

robotaxiautonomous-drivingcommercialization

行业动态与政策

摩尔线程获京东云10万卡订单,用于建设国产GPU集群

国产GPU厂商摩尔线程获得京东云10万卡规模订单,用于建设国产GPU算力集群。在高端算力供给受限的背景下,国产芯片的大规模商用落地为大模型(含具身智能模型)的训练与推理提供了新的算力底座选择。

gpucomputesupply-chain

奥斯汀Q2记录47起自动驾驶车辆阻碍急救事件,NHTSA同步审查Cybercab自认证

奥斯汀市政记录显示,今年第二季度发生47起自动驾驶车辆妨碍应急响应的事件。与此同时,NHTSA正在审计特斯拉Cybercab的合规自认证流程,监管与公共安全压力正成为自动驾驶规模化扩张的关键变量。

policyregulationautonomous-drivingsafety
内容来源与版权声明

本日报由 AI 综合以下公开信息源自动生成:

  • AI综合多源生成
  • arXiv.org 开放获取论文
  • Hugging Face Daily Papers

原始内容版权归原作者所有。如有异议请联系本站