← 返回资讯热点
AI热点雷峰网发布时间:2026-09-23 01:46热度 196.0000

乐享以太大模型,让中国具身智能坐上定义席

从“预测”到“求解”:乐享以太大模型重塑 Physical AI 解题范式。 作者丨 幸丽娟 编辑丨 董子博 具身智能行业一直在等一个 ChatGPT 时刻。 但这个时刻,未必长得像 ChatGPT 。 决定这个时刻的,不是机器人会聊天,也不是机器人学会了几个动作,而是在不确定环境里,机器人能不能自主思考、判断和执行,在无序的事件中,持续完成任务。 过去两年,行业积累的几乎全是“能力上限”的展示:选好场景、选好时机、反复调试,再拍出一条完美的样例。 上限可以“被编辑”出来展示。真实效果如何,却少有人敢公开测。 但机器人真正进入现实世界,考验的不只是最好时能做到什么,更是环境不断变化时,它还能不能把事情做下去。 9 月 16 日傍晚。上海闵行一家烧烤店门口,乐享科技让两台机器人摆起了烧烤摊。接下来近一个小时,它们要接单、烤串、上菜。 这场直播的规则, 测的正是 机器人在 这种真实环境里的应变能力 。 没有剪辑,没有遥控,没有预设脚本。 更绝的是,观众可以实时干预:随机出题,自由改造场地布局,随手改道具摆放位置,临时打断正在进行的任务并追加需求。现场 3 桌、6 名顾客的主线任务,就是“干扰”,看机器人能不能像人一样自己“圆场子”。 而就在不久前,这家公司刚刚站在了一场舆论风暴的中心。 故事线是这样的: 7 月,乐享上线以太大模型官网并公开完整技术路线;8月26日,一段机器人协作收拾房间的10分钟一镜到底 样例,在具身圈传开。 9 月 3 日,OpenAI 上线 GPT-6 Astra 官网;三天后,首席科学家 Jakub Pachocki 发表万字长文《异星心智》。 9 月 10 日,乐享创始人郭人杰发文,三问 OpenAI:技术理念为何高度重合?概念表述为何如出一辙?官网设计为何似曾相识?他称对方“像素级搬运”“直接蒸馏”,并称法律团队已启动程序。 舆论随之分成两派。一派说这是硬实力,另一派说这是“蹭热度”、“样例造假”。 面对这些质疑声,乐享决定让 搭载 以太大 模型的机器人自己上场回应 。 于是,这场户外烧烤直播来了。 被推到台前的,还有一组更根本的追问:当计划被打破、条件被临时改写、任务被中途打断,机器人还能不能重新收敛到目标? 如果能,又凭什么能? 乐享敢把场子开放出来,就是因为 以太大模型 的架构从一开始就不是为“把预设流程跑完”设计的 。 这一点,在近一个小时的直播里看得最清楚。 01 开放环境直播: 一次可被干扰的硬核测试 炉子支起来,名为“二爷”和“五弟”的两台机器人各就各位。一台点单送餐,一台负责守炉。 整条任务链是:接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。 为了证明现场没有遥操,创始人郭人杰把摄像机带进后厨,翻转镜头拍现场人员,又掀开背景幕布,展示那个唯一能藏人的小房间——里面各种食材厨具堆得到处都是,完全没有人遥操的空间。 他在开场直言直播的仓促:“我们周日才跟烧烤店老板聊好,花几万块钱租下这块场地。” 然后,机器人的五项核心能力在这场直播中,被反复测试: 主动感知。 服务机器人在完成点单、将需求传递给烧烤机器人后,会注意顾客的等餐时间,当感知到顾客等候较久,会主动上前询问出餐进度。 更细致的一个瞬间是:在没有人开口要求的情况下,它想到吃烧烤的顾客会需要纸巾,主动把纸巾送了过去。 多模态理解。 有顾客在点单时临时提出“少放辣”。这个需求首先以语言形式进入服务机器人,它需要理解这句话的语义,同时结合视觉信息确认顾客指的是哪一份订单,然后将新要求转身传递给负责烧烤的同伴。 烧烤机器人收到调味指令后,精准识别食物位置,均匀完成撒料操作。这背后是对物体尺寸、材质、位置及相互约束关系的多模态空间理解。 流式记忆。 一个小时的直播被打散来做:3 组顾客轮流点单、多轮上菜、临时打断穿插其中。服务机器人全程没丢掉手里的任务链,能把进度推进到收尾。 更直观的一幕是:服务机器人正在给顾客点单,突然被要求“拿瓶水”。它停下点单,先去递水,再接着把单点完。整个过程没有犹豫,也没有等下一条指令。 这件事看起来简单,但对机器人来说不是。打断一次,上下文就可能被覆盖,任务状态归零,它得重新知道“我刚才在做什么”“做到哪了”“为什么做到那一步”。对于其他依赖单步观测做决策的机器人而言,这几乎是不可能完成的任务。 动力学建模。 烧烤机器人自主为食材刷涂酱汁,这个过程非常考验空间感知和力度控制,因为模型需要理解物体的物理属性,结合动力学模型输出符合物理规律的动作。 另一个更能说明问题的瞬间是翻面:机器人第一次给食材翻面时没有翻好,食材掉落炉架。第二次调整了抓取和翻转姿势,成功了。 这背后,是动力学建模在实时求解:系统不是从记忆里检索一个“标准翻面动作”,而是在当前的重心偏移、摩擦系数和夹持条件下,重新解出了一组能让动作成立的力矩参数。 持续自 进化 。 烧烤机器人翻面第一次失败、第二次调整姿势成功的瞬间,同样是模型持续自我迭代能力的直接写照。这种并不完美的过程,恰恰能让人直观地看到模型是如何通过失败反馈,自主进化,最终顺利完成任务。 这五项能力,看似在测五个不同的维度,实际上指向模型从数字世界走向物理世界的真正门槛: 机器人能不能在约束不断变化的情况下,依旧能把事情做对。 过去,这个判断靠人写规则、靠数据拟合、靠预设流程。而这场直播验证了,模型在不同的约束条件下,靠自主智能就可以把“对的动作”解出来。 这两台机器人默契完成协作任务的画面,很容易让人想到八月底那段在具身圈刷屏的视频。 10分钟,一镜到底。狭小的空间里,两台不同品牌和型号的机器人,全程自主协作收拾房间。 视频里发生了这些事,值得反复琢磨—— 一台机器人用刮水器擦玻璃,有一处怎么都擦不干净。它重复几次后停下来,判断脏东西可能在玻璃外面,于是把刮水器伸出窗外; 接着,它收拾桌面,双手被占满时,另一台主动拿起桌上的围巾挂到它脖子上,发现围巾太长,还用双手把围巾捧起来,被帮助的机器人看懂了,弯下了腰......双方通过自主协同,完成了这次物品“迁徙”; 随后,较矮的机器人要把围巾放进柜子上方隔层,可它只有 1.3 米,够不到。它找到旁边的箱子推到地上,想弯腰搬起来垫脚,却发现自己弯不下腰,于是它选择用脚踢过去; 箱子踢歪了,机器人又开始琢磨怎么把箱子回正,这时候,身高 1.7 米的另一台机器人走了过来:它似乎看出了同伴的困境,放下了手上的活,主动帮忙把围巾放到目标位置。 中途闹钟响了,两台机器人转去处理桌面和冰箱收纳任务,做完再回来接着做没做完的事,进度没被清零。 一个在室内,一个在户外;一个做家务,一个要烤串上菜。展示的却是同一件事:以太大模型可以让机器人自主思考,自主决策,并在试错中完成自我进化,以及实现跨本体协作。 这背后,还有一个更深层的追问: 它凭什么做到? 要回答这一点,得先看市面上现有的具身智能主流方案为什么做不到。 02 VLA 和 WAM ,绕不开“预测”这道坎 当前具身智能有两条主流路线:VLA 和 WAM。 2026年4月,英伟达研究科学家Jim Fan在红杉AI Ascent大会上宣告:VLA 已死,WAM 当立。这番论断将两条路线的争论推到了台前。 但无论是哪条路线,两者的底层逻辑却是同一件事:预测。 ▎ VLA 预测动作分布 从 RT-1、RT-2 到 OpenVLA,再到 Π0 系列,VLA 的思路是:把图像和语言指令编码进一个多模态主干,直接解码出动作序列。 数学上,它学的是一个条件动作分布 p(a|o,l)。给定当前观测 o 和语言指令 l,输出动作 a。 这条路的好处很直接:快。链路短,延迟低,能接高频控制;语言模型的语义能力可以直接复用,机器人“听得懂”开放词汇的指令。 但随着模型走向更加开放的真实环境,一些结构性缺陷也开始暴露。 第一个缺陷,是 语言被架空 。 ICML 2026上的一篇论文(LangForce)给这个缺陷起了一个学术名字:信息坍缩。在目标驱动的数据采集范式下,语言指令往往仅凭视觉观察就能高度预测——看到柜子就对应“开柜子”,看到瓶子就对应“拿瓶子”。指令与动作之间的条件互信息趋近于零,模型实际上忽略了语言,退化成了一个纯粹的视觉策略。 在 RoboCasa 基准上,一个完全忽略语言指令的纯视觉模型,成功率与接收完整语言指令的模型几乎相同。 这意味着,VLA 学到的不是“理解指令然后行动”,而是在特定视觉场景下匹配特定动作。它把“听懂”和“看见”悄悄合并成了同一件事。而合并的代价是:分布外的新场景、新任务,泛化会显著下滑。 第二个缺陷,是 它跳过了对环境的动力学建模 。 它不预测动作执行后世界会怎么变,只学“这个场景对应什么动作”。所以它没法回答“我把手伸出去会不会撞到窗框”这类问题,因为它压根没在算这件事。 ▎ WAM 预测未来世界状态与动作 WAM 就是为了补 VLA 的第二个缺陷来的。它采用“先预演、后动作”的推演式架构:先预测动作执行后世界状态会如何变化,再反推最优控制指令。 数学上,它学的是一个 未来状态与动作的 联合分布 p_θ(s_{t+1:t+H}, a_{t:t+H-1} | o_{≤t}, a_{<t}, l)。给定历史观测 o_{≤t}、历史动作 a_{<t} 和语言指令 l,同时输出未来 H 步的状态序列 s_{t+1:t+H} 和动作序列 a_{t:t+H-1}。 这条路补上了 VLA 缺失的物理预测。它学的是“物体被推、被抓、被丢弃时会怎样移动”,这种物理知识比语义知识更通用。 但 它依旧没有解决信息坍缩问题。 WAM 的视频预测同样绑在具体本体的相机视角上,语言指令

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。