RobotsWiki
返回日报列表
2026年9月3日#81

Physical AI 日报 #81

原文: AI综合多源生成
今日要闻

World Labs 发布世界模型 Atlas,可从单张图片生成可控的一分钟 1440p 视频与 3D 输出;Uber 裁员 3300 人,将释放资金投入超 100 亿美元自动驾驶合作;宇树科技上市第 11 个交易日股价较首日腰斩,市值 2208.5 亿元;具身智能数据缺口超 99%,上半年 25 家中国数据采集公司合计融资超 170 亿元

论文进展

ZimaBlue:12 万小时人类第一人称视频将真机零样本成功率从 36.1% 提升至 77.8%

动作标注的机器人轨迹昂贵且单调,而第一人称视频廉价海量却缺乏动作标签。ZimaBlue 通过三阶段课程将视频转化为控制能力:人类与机器人第一人称视频因果预训练、基于统一动作表示的异构轨迹视频-动作中训练、目标本体特化;真机零样本评测中,训练数据扩展至 12 万小时视频使成功率从 36.1% 升至 77.8%,异步快慢双系统让轻量分支在 RTX 4090 上以 30Hz 运行。

world-modelpretrainingdata

IMPACT:世界模型的监督信号被静态背景“吞噬”

论文指出全局平均 MSE 去噪目标存在监督错配:主导画面的静态内容占据梯度,而真正决定交互质量的稀疏动态区域监督不足。IMPACT 将对被操作物体 token 的交叉注意力作为内部时空先验,构造交互图并对去噪监督重加权,无需外部表征估计器或人工标注,也不改变推理流程;在机械臂/灵巧手操作与多个 DiT 骨干上稳定超越对应 MSE 基线。

world-modelmanipulation

REFACTOR-VLA:为 VLA 构建可复用动作技能库——世界模型更大反而更差

针对 OpenVLA、π0、RT-2、RDT-1B 等单体 VLA 长时程退化且难解释的问题,该工作构建睡眠/唤醒系统:睡眠期用隐式世界模型 rollout 并按行为等价聚类动作片段,唤醒期发出类型化 λ 项交由技能库条件化的整流流解码器执行,技能抽象需通过最短描述长度与回报保持双重门槛。两个反直觉发现:世界模型从 188M 扩至 430M 参数在四个 LIBERO 套件上全面变差;而 InfoNCE 预热损失使聚类 NMI 平均高出最强基线 0.184。

vlaskill-learninglibero

Qwen-Drive-1.0:把驾驶能力打包进视觉语言基础模型而不牺牲通用能力

端到端驾驶方法通常以牺牲通用视觉语言能力为代价;Qwen-Drive-1.0 保持架构不动,外挂一个同时处理 3D 检测、语义占据预测与地图分割的 BEV 感知头,并由规划专家从共享表征生成自车轨迹。分阶段训练混合驾驶监督与通用视觉语言数据,在开环、伪闭环与闭环设定下取得有竞争力的规划表现,同时基本保留通用视觉语言能力。

autonomyvlmdriving

NegGrasp:对机器人下达“不要抓这里”的否定指令时,它偏偏抓那里

DextER 等语言驱动灵巧抓取模型在指令含否定约束(如“抓把手但避开杯身”)时系统性失败,根因是 DexGYSNet 等语料几乎不含回避类指令,模型把提到的任何部位都当作接触目标。本文不添加任何负样本训练,而在推理时用序贯蒙特卡洛结合无分类器引导导向指定部位并剪枝趋向禁区的候选,禁区位置由冻结的 3D 部位接地模型从语言读取;在 NegGrasp 基准上最强基线违规率从 57.9% 降至 17.2%。

manipulationlanguage-groundingdexterous-grasping

DroneCATS:小模型无人机能飞抵目标,却“不知道自己到了”

该工作将多模态大模型直接放入无人机控制回路,动作空间完全通过 prompt 声明,无需微调或函数调用。测试四项能力后发现鲜明反差:2B 开源小模型进入成功半径的可靠性常超前沿模型,却因过早宣布到达或不宣布而落败;多机指挥中小模型还会跨视角盲目复制同一坐标——空间感知过关,动作协议不过关。

benchmarkdronevlm

融资与投资

感知公司 Lyte 完成 1.65 亿美元 C 轮融资,投后估值 16 亿美元

机器人感知公司 Lyte 完成 1.65 亿美元 C 轮融资,投后估值达 16 亿美元,显示资本市场对具身智能感知层基础设施的持续押注。

fundingperception

具身数据缺口超 99%:上半年 25 家中国数据采集公司合计融资超 170 亿元

具身智能训练数据缺口被指超过 99%,真实世界数据采集成为产业链最热环节之一;2026 上半年已有 25 家中国数据采集公司合计融资超 170 亿元人民币,资本正密集涌入数据基建赛道。

fundingdata

商业化落地

World Labs 发布世界模型 Atlas:单图生成可控的一分钟 1440p 视频与 3D 输出

World Labs 推出世界模型 Atlas,可从单张图片生成可控的一分钟 1440p 视频,并同时输出 3D 内容。该能力进一步模糊了生成式世界模型与具身智能仿真资产之间的边界,有望降低机器人训练环境的构建成本。

world-modelcommercializationgenerative-ai

行业动态

中国专家主导的世界首部腿足机器人国际标准正式发布

由中方专家牵头制定的世界首部腿足机器人国际标准正式发布,有望为人形与四足机器人的安全、测试与互操作提供统一规范,加速产业规范化落地。

standardpolicylegged-robot

Uber 裁员 3300 人,腾出资金投入超 100 亿美元自动驾驶合作

Uber 宣布裁员 3300 人以优化成本,释放的资金将投入总额超 100 亿美元的自动驾驶合作。这一调整凸显出行平台向自动驾驶转型过程中的资源再配置力度,也反映 Robotaxi 竞赛进入重资本投入阶段。

autonomyride-hailingrestructuring

宇树科技上市第 11 个交易日股价较首日腰斩,市值 2208.5 亿元

中国四足/人形机器人厂商宇树科技上市后第 11 个交易日,股价较首日价格已腰斩,当前市值 2208.5 亿元人民币。这显示人形机器人概念在二级市场正经历估值回归,一级市场热度与二级市场定价出现明显分化。

humanoidcapital-marketsunitree
内容来源与版权声明

本日报由 AI 综合以下公开信息源自动生成:

  • AI综合多源生成
  • arXiv.org 开放获取论文
  • Hugging Face Daily Papers

原始内容版权归原作者所有。如有异议请联系本站