HexaAnything:把任务状态与执行写成代码的自进化编程智能体
本文将编程智能体范式引入机器人领域,把任务状态、进度与失败恢复写成可检查、可修改的代码,系统HexaAnything将VLA作为感知、规划与控制工具链中的一环。在RoboCasa365上,它于未见组合任务和整体成功率上超越XR-1 VLA,且基于其执行轨迹训练的HexaModel在所有数据划分上均优于基座模型。
AMD以82亿美元全股票收购World Labs,李飞飞出任AMD执行副总裁兼首席科学家;IDC与沙利文对上半年全球人形机器人出货量的统计严重分歧:近2.5万台 vs 3.6万台;具身智能初创公司Knowin一年内完成5轮融资累计超10亿元人民币,本轮由京东系基金领投;清华大学等开源APXInf端侧推理引擎,将pi0.5推理时延降低10.7倍
本文将编程智能体范式引入机器人领域,把任务状态、进度与失败恢复写成可检查、可修改的代码,系统HexaAnything将VLA作为感知、规划与控制工具链中的一环。在RoboCasa365上,它于未见组合任务和整体成功率上超越XR-1 VLA,且基于其执行轨迹训练的HexaModel在所有数据划分上均优于基座模型。
转动魔方时部分手指需固定方块、其余手指推动目标层,接触频繁。FINGR以各指尖为参照表示魔方几何,让模型预测接触力变化与转层进度:真机300次转层成功率达99.0%(基线流策略为79.7%),配合桌面抓取与重抓,10个打乱的二阶魔方全部复原,平均用时约137秒。
作者称这是首个在真机上与人类多拍对打、并能跳跃接杀的人形拍类运动系统。方法分三层:将稀疏击球动作扩展为可执行的技能空间;高层规划器依据来球状态在线组合正手、反手等技能;再用对抗正则项约束动作的自然度。
当接触区域被遮挡时,视觉与本体感知都无法判断真实情况。Uni-VLaT在VLA中加入全身分布式触觉通路并预测未来的触觉、本体与视觉表征:5个真机任务平均成功率达75%,较无触觉基线高出43个百分点;在'拍背行走'任务上两种VLA骨干均提升85至90个百分点。
无需人类示教、策略预训练或已知物体模型:ZeroBot用图生3D模型从单视角物体图像生成完整网格,再在仿真中大规模并行强化学习。真机在抓取、推动、关节物体与多阶段任务上平均成功率87%,平均训练时间仅119秒。
采集仅使用消费级VR头显加头戴双目相机,无需外部相机或动作捕捉。加入人类示教后,GR00T N1.7平均成功率从29%升至56%,pi0.5从32%升至57%;要达到纯机器人数据训练的性能,所需机器人示教数量可减半。
中国具身智能初创公司Knowin过去一年内完成5轮融资,累计融资超10亿元人民币,本轮由京东关联基金领投。高密度的融资节奏反映出资本对具身智能通用赛道持续加注。
中国机器人臂厂商珞石(Rokae)第10000台人形机器人力控臂在山东邹城基地下线,且上半年经调整净利润转正。这标志着国产力控臂供应商正走向规模化量产与盈利。
APXInf是清华大学联合中国AI算力初创公司无问芯穹(Infinigence AI)与上海交通大学于9月15日开源的具身模型端侧推理引擎。在不改动模型的前提下,pi0.5在Thor FP8上的推理时延从278毫秒降至26毫秒(约10.7倍),LIBERO-10成功率92.2%,与参考实现的92.4%基本持平。
AMD正以全股票交易收购World Labs,交易价值82亿美元,创始人李飞飞将出任AMD执行副总裁兼首席科学家。算力巨头将世界模型与空间智能能力收归麾下,显示Physical AI已成为芯片厂商争夺的核心战场。
两家机构对上半年全球人形机器人出货量的统计严重分歧:IDC称近2.5万台,沙利文称3.6万台,差距超过40%。如此大的差异通常源于统计口径(出货vs产量、产品覆盖范围)不统一,提醒行业在引用'出货量'数据时应保持审慎。
这是一份罕见的负面结果报告:智能体观察自身失败、编写新技能并安装外部模型,进行了123轮改进,每次改动都通过自测,但目标任务'把调味料放到冰箱最上层'一次都未成功。作者结论是瓶颈不在智能体本身:分割模型认识搁板却不认识'最上层';长任务总在第一步失败,后续技能鲜被练习;评估器哪里量错了,智能体就朝着哪里优化。
本日报由 AI 综合以下公开信息源自动生成:
原始内容版权归原作者所有。如有异议请联系本站。