RobotsWiki
返回日报列表
2026年9月2日#80

Physical AI 日报 #80

原文: AI综合多源生成
今日要闻

Waymo同日在丹佛、圣迭戈、坦帕三城上线付费Robotaxi服务,全美车队规模突破4000辆;梅卡曼德机器人登陆港交所,市值超120亿港元;N₀-Foundation发布3万小时视触觉数据集并开源5000小时;Blind Dexterity让Unitree G1仅凭关节编码器完成蒙眼全身操作

论文进展

N₀-Foundation:3万小时视触觉数据,五分之一开源

该工作将具身操作中最难规模化采集的触觉数据推至3万小时以上,覆盖6种本体、450项任务的同步视触觉演示,其中5000小时以OpenNeoData名义开源。团队同时发布视触觉传感器、面向触觉采集的UMI改造接口、跨传感器可迁移表征模型NeoForce,以及真机与仿真双评测基准NeoReal与NeoSim;实验表明策略真正受益的是底层物理接触状态本身,而非特定传感器的信号外观。

tactiledatasetmanipulationfoundation-model

Blind Dexterity:Unitree G1蒙眼完成全身操作

不用摄像头、力矩传感器和触觉皮肤,仅靠关节编码器,策略即可让Unitree G1在被推动时稳定行走(甚至不依赖IMU反馈)、用脚停球、摸索提起行李箱并踩上任意摆放的滑板。作者认为柔顺接触下关节读数的变化本身就构成一条全身触觉通道,机器人可主动制造接触探查环境,仅凭短窗口本体感受历史即可解码物体位姿,颠覆了昂贵传感器先行的默认假设。

locomotionmanipulationproprioceptionhumanoid
关联机器人:Unitree G1

Hydra:离散潜空间规划与连续流匹配执行的导航世界动作模型

针对世界模型用于实时控制时规划器与生成模型流形不一致、候选动作必须解码回高维像素空间评分的瓶颈,Hydra将视觉状态、物理位姿与控制动作压缩进共享潜空间,经逐模态矢量量化瓶颈形成离散词表,用运动学-感知代价原地排序候选,再由条件流匹配展开为连续轨迹。在两个真机平台上,目标导向规划超越现有世界模型,闭环执行媲美乃至超过主流反应式底盘策略。

world-modelplanningnavigation

Motus2:一套权重同时充当策略、模拟器与评判者

Motus2从单一共享权重模型中暴露策略、模拟器与价值模型三类接口,首次让预测与决策形成真正闭环:策略提出候选动作块,模拟器预测视觉后果,价值模型打分,以往被丢弃的失败与次优交互如今回灌给动力学建模与价值学习。数据侧渐进构建:从大规模单目第一人称视频,到同步双目数据,再到机器人域适配,最终落地于配备双目视觉、双臂、双灵巧手与触觉的仿生平台。

world-modelvlaself-improvement

Lucida:将杂乱真实房间拆解为可单独操作的仿真资产

Lucida保持真实到仿真管线'解析-生成-摆放'的顺序,但把实例精度要求推迟到管线末端:先将视频解析为有多视图证据支撑的场景图,再为每个实例单独生成完整资产,最后交给把摆放当作多轮GUI操作的VLM策略GizmoAct自行拖拽gizmo并判断对齐。在R2S-Scene上mAP比Boxer高69%,场景F-Score从SAM3D的0.794提升至0.924。

real-to-simvlmsimulationperception

RoboPhys-3D:基于3D重建的具身世界模型综合评测基准

视频世界模型日益被用作数据引擎与模拟器,但一直缺乏统一的3D基准来验证其生成rollout是否保持底层3D场景状态、能否转化为可执行动作。RoboPhys-3D基于RoboTwin 2.0构建,覆盖50个操作任务、5000条轨迹与25000个多视角真值视频,通过让生成与真值视频经过同一3D重建管线,将重建误差与生成误差解耦,系统区分世界模型'看起来对'与'物理上对'。

benchmarkworld-modelsimulation

LightNav-0:导航任务不再需要专用预测头

LightNav-0将指令跟随、开放词汇目标搜索与视觉跟踪折叠进单个紧凑模型,通过统一token接口实现:双通道指向表征以任务、场景、本体无关的方式传递意图,残差矢量量化动作分词器将通用意图翻译回特定本体可执行的轨迹。模型在超过2000个场景、4000+小时数据上训练,在10个公开导航仿真设置中取得单目SOTA成功率,并在真机上实现零样本跨本体迁移。

navigationcross-embodimentfoundation-model

ETH苏黎世:人形机器人单杠摆荡,15次尝试成功14次

针对细薄悬空结构导致激光雷达回波稀疏的感知难题,该系统将头戴固态激光雷达原始扫描直接输入策略,用带循环记忆的注意力编码器提取几何信息,并以分阶段师生训练拼接起跳、摆荡与跳下三段专家动作。为迁移到真机,训练中显式建模了激光雷达噪声、电池电压跌落与执行器热限,并将末端执行器换成被动钩爪;三种杠距配置下15次完整尝试成功14次,摆速达0.5 m/s,同一感知骨干训练的另一策略甚至能摆过截面仅2厘米的横杠。

humanoidlocomotionsim-to-realperception

商业化落地

Waymo一日三城上线付费Robotaxi,车队突破4000辆

Waymo同日在丹佛、圣迭戈与坦帕上线付费Robotaxi服务,将全美车队规模扩大至4000辆以上。三城同开显示出其跨城市快速复制运营能力的成熟,进一步拉开与美国同行的身位差距。

autonomous-drivingrobotaxi

梅卡曼德机器人登陆港交所,市值超120亿港元

中国机器人3D视觉公司梅卡曼德在香港交易所挂牌上市,9家基石投资者合计认购1.86亿美元,市值突破120亿港元。作为具身智能上游感知层的代表性企业,其上市为机器人产业链资本市场表现提供了新的定价参照。

ipo3d-visionindustrial-robotics

行业趋势

优必选划定盈利时间表:今年四季度实现季度EBITDA转正

优必选首次给出明确盈利节点,目标今年第四季度实现季度EBITDA转正。这被视为国内人形机器人头部厂商从融资驱动走向经营性造血的关键信号,其兑现进度将成为观察人形机器人商业化成色的风向标。

humanoidbusinessprofitability

图灵奖得主Richard Sutton参与的'机器人幼儿园'落地北京石景山

一座由图灵奖得主Richard Sutton参与的'机器人幼儿园'在北京石景山区开园,探索让机器人在持续交互中自主学习成长的训练范式。该命名呼应了Sutton'经验时代'的学术主张——智能体通过与真实环境的长期互动而非静态数据集来获得能力,是强化学习路线在具身智能落地层面的标志性布局。

reinforcement-learningpolicyeducation
内容来源与版权声明

本日报由 AI 综合以下公开信息源自动生成:

  • AI综合多源生成
  • arXiv.org 开放获取论文
  • Hugging Face Daily Papers

原始内容版权归原作者所有。如有异议请联系本站