← 返回资讯热点
AI热点雷峰网发布时间:2026-09-24 09:19热度 204.0000

SeeAct AI穆尧:具身智能终局,一定是从“被训练”走向“自我进化”|物理AI50人

机器人真正缺的,不是数据,而是经验。 作者:李秋悦 编辑:吴彤 那是具身智能最荒芜的时候。 没有成熟数据集,没有标准Benchmark,甚至没有一条被验证能走通的技术路线。 穆尧南下港大读博,开始研究具身智能。 2021年,穆尧进入HKUMMLab,成为该实验室创始人罗平教授和中国人工智能奠基人之一的汤晓鸥教授共同指导的学生。 “具身智能会是一个非常 Promising 的方向。”刚入组时导师们的这句话,穆尧一直记到今天。 四年后,这个方向的潜力,开始在穆尧自己的研究中得到印证。 穆尧主导的RoboTwin,成了中国具身智能圈的事实标准之一,GitHub斩获超过 2900 颗星,蚂蚁集团的LingBot-VA、生数科技的Motubrain都抢着在这个基准上刷新成绩。他本人入选国家级青年人才计划,成为上海交通大学长聘教轨助理教授,谷歌学术引用超过 5000 次。 2026年,穆尧做了一个更激进的选择:押注“具身自我进化”,创办SeeAct AI观行智能。他给出一个相当明确的判断: “具身的终局一定会迈向奖励驱动的自我进化。” 这个判断,和他2018年在清华读硕士时坚持的东西一脉相承。 那一年,自动驾驶行业还在把感知、规划、控制拆开做,穆尧坚持端到端Policy和奖励驱动。 后来,特斯拉FSD把整个行业收敛到了端到端,再也没人问他这是不是主流方案。 穆尧把这种坚持归结为一个词:taste。 这里我们理解不仅是技术品味,更是洞察技术发展的科学直觉。 那么穆尧为什么会有这样的直觉? 以下是左林右狸频道与穆尧的对话,在不改变原意的基础上做了部分编辑: 01 奖励驱动从未离场 左林右狸:你第一次系统接触强化学习是在什么时候? 穆尧: 2017年。 当时David Silver在YouTube上有一套很好的强化学习课程,我也系统学习了图灵奖获得者Sutton的《Reinforcement Learning》。 那个时候爆发的是围棋智能,我看到Alpha Go通过奖励驱动、自我规划、自我推演,最后能够产生超越人类的智能。我当时觉得,这可能就是人工智能皇冠上的明珠。 左林右狸:到了清华做自动驾驶以后,这种判断怎么进入你的研究? 穆尧: 2018年的时候,我比较笃信两件事情。 第一是端到端的Policy。 第二是奖励驱动,希望由神经网络来承载这个策略。 但是那个时候这个观点还比较超前。自动驾驶整体上分得比较开,感知、决策、规划、控制是分开的,甚至一个公司里面都会分成不同事业部。 我还是希望用神经网络来承Policy,希望直接由视觉反馈和奖励驱动来做这件事情。 后来做Mixed Reinforcement Learning,也是希望搭建Model-based RL和Model-free RL之间的桥。Model-free更多依赖真实数据,真实世界交互代价比较大;Model-bas

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。