TrAct:以视觉轨迹作为控制与预测的中间接口
机器人动作与其本体绑定,和图像空间的变化并不对齐,这是世界模型条件信号的长期难题。TrAct让VLA模型在输出候选动作的同时生成对应视觉轨迹,由世界模型模拟每条轨迹的视觉结果,再由视觉-语言奖励模型选出最符合指令的一条执行。在π0.5基线上,LIBERO-INTEGRAL成功率从27%提升至55%,真机Franka操作从49%提升至76%,李飞飞为作者之一。
工信部将智能机器人列入六大新兴支柱产业,具身智能被命名为未来产业;Waymo计划2027年底在慕尼黑向公众开放robotaxi,首次进入欧盟市场;Generalist估值升至30亿美元,8VC领投2亿美元扩展轮;TrAct以视觉轨迹为中间接口,将真机Franka操作成功率从49%提升至76%
机器人动作与其本体绑定,和图像空间的变化并不对齐,这是世界模型条件信号的长期难题。TrAct让VLA模型在输出候选动作的同时生成对应视觉轨迹,由世界模型模拟每条轨迹的视觉结果,再由视觉-语言奖励模型选出最符合指令的一条执行。在π0.5基线上,LIBERO-INTEGRAL成功率从27%提升至55%,真机Franka操作从49%提升至76%,李飞飞为作者之一。
大型VLA模型推理延迟大,会改变环境的有效动力学,从而破坏强化学习依赖的马尔可夫假设。ARLI在异步推理框架中将已提交的动作与推理中途的观测并入状态,恢复近似马尔可夫结构;在延迟条件下标准RL完全失效,而ARLI不仅能成功微调,还匹敌甚至超过无延迟理想设置下的标准RL。
通过Self Forcing将双向教师模型蒸馏为因果少步学生模型,Cosmos-H-Dreams在单张RTX PRO 6000 Blackwell上实现约160 FPS的流式推理,可由浏览器键盘、Meta Quest或CMR Surgical的Versius手术控制台直接驱动,也支持学习策略闭环运行。团队称其为首个支持人类与策略实时控制的交互式手术世界模型,并已作为开源仿真系统发布。
平行爪夹持器与吸盘达成同一抓取目标需要不同策略,但现有VLA数据集几乎被平行爪垄断。MiGA覆盖多种机器人与五类夹持器、采集103,000条演示,并显式记录同目标下的策略分歧;配套GVLA采用多夹爪分词器与基于适配器的策略路由,在新物体与未见任务的零样本/小样本适应上超越基线。
该工作让皮肤自身决定触觉由反射还是推理处理:熟悉接触通过脉冲编码在毫秒级完成分类,不确定接触则被路由到语言引导的推理通路,由置信度决定路径选择。普渡大学Wenzhuo Wu的配发评论指出,这种基于置信度的路由设计在不可预测环境中平衡了速度与可靠性。论文于2026年8月26日在Nature Sensors在线发表。
把世界模型当作学习型仿真器,隐含假设它对任何有效动作都能产生忠实的未来——这一假设此前从未被系统检验。WorldEcho用视觉完整性与SE(3)轨迹对齐度探测发现:现有模型对专家动作表现尚可,但输入非专家轨迹后要么无视指令、要么生成视觉上不合理的结果。配套方法WorldSync通过分布覆盖、表征接地与干预效应对齐加以修复,在RoboTwin与真机上取得更高的策略迭代成功率。
具身智能基础模型公司Generalist完成2亿美元轮次扩展,估值升至30亿美元,由8VC领投,显示资本持续加注通用机器人基础模型赛道。
Waymo计划于2027年底在慕尼黑向公众开放无人驾驶出租车服务,这将是其首次进入欧盟市场,标志着美国robotaxi运营商正式挑战欧洲的监管与运营环境。
中国无人驾驶矿卡公司易控智驾的无人矿卡运营数量突破3100台,较一年前翻倍,矿山正成为自动驾驶与具身智能技术规模化落地最坚实的封闭场景之一。
Figure推出面向公众的众包数据采集应用,目前覆盖108个国家、累计上传视频达1600万条,试图以人类日常操作视频规模化地喂饱其人形机器人基础模型。
中国工业和信息化部将智能机器人列为六大新兴支柱产业之一,并将具身智能命名为未来产业,为具身智能产业链的政策支持与资源倾斜定下基调。
NVIDIA推出Jetson Orin Nano 2,推理性能翻倍的同时大幅降低功耗——同等性能下功耗下降40%,为端侧具身智能推理提供更强的边缘算力底座。
本日报由 AI 综合以下公开信息源自动生成:
原始内容版权归原作者所有。如有异议请联系本站。