← 返回资讯热点
AI热点雷峰网发布时间:2026-09-11 09:39热度 164.0000

不堆 Transformer,斯坦福吴佳俊如何用物理重新定义多模态融合?|ECCV 2026

视觉、听觉、触觉三种数据,其实是同一组物理属性在不同感官通道上的投影。 作者丨 陈淑瑜 编辑丨岑 峰 2026年9月8日,欧洲计算机视觉会议 ECCV 在瑞典马尔默召开。在 9 月 9 日的“ Embodied Multimodal Reasoning in Physical Environments(物理环境中的具身多模态推理)”专题分场上,斯坦福大学计算机科学助理教授吴佳俊发表了一场横跨视觉、声音与触觉的演讲。 这已经是吴佳俊两个月内的第三场重要演讲,而每一场的切入口都不同。 8月20日,他在德国不来梅领取了 IJCAI 2026“计算机与思想奖”,发表获奖演讲 《Building Visual and Physical Intelligence Through Code》 , 彼时他系统性阐述了如何将经典符号 AI 的几何、物理先验定义为“物理代码”,并与现代基础模型深度缝合,铺就了一条从“看懂画面”到“具身动作交互(4D)”的全新物理智能范式。 9月8日,他在 ECCV 期间的“Robotic Manipulation Research”Workshop 上转向了操作与规划 :让基础模型自动发现“原子技能”及其前置与后置条件,构成可组合的抽象,使机器人能从极少演示泛化到长程任务,并配套一系列评测基准。 而9月9日这场,他换了一个方向。前两次的路径都是“从视觉出发,往下游延伸”——先理解世界,再去规划与操作;这一次则是在感知端横向拉平: 将视觉、听觉、触觉视为同一组物理属性在不同观测通道上的投影。 举例来说,一个塑料物体,看起来像塑料,摸起来像塑料,敲起来也像塑料。 他要回答的是一个更前置、也更难的问题: 当我们几乎没有任何数据时,怎样把这三种模态融在一起? 在这场多模态感知的演讲中,吴佳俊没有沿用“把视觉、音频、触觉拼起来喂给 Transformer”的常规做法,也没有退回“先估计状态、再跑物理仿真”的经典路径,而是给出了一个更前置的答案:用同一组物理属性,为三种感官建立共同的坐标系。 吴佳俊直击当前多模态融合的痛点:进入新领域、面对从未见过的物体时,声音与触觉的数据几乎为零,真正稀缺的不是架构而是原则。 他系统性阐述了如何把几何、材质与刚度这类物理属性,既作为从视频扩散模型中蒸馏出的学习目标(PhysDreamer),又作为条件化生成模型的中间接口(WonderPlay),并进一步延伸到声音的可微分渲染(DiffImpact、RealImpact)与柔性电子皮肤(DexSkin),铺就了一条从“看懂画面”到“听出材质、摸出力度”的跨模态物理智能范式。 以下是吴佳俊在 ECCV 2026 期间发表的演讲精编稿,AI 科技评论基于其演讲内容进行了不改原意的翻译编辑: ▎ 《Physics-Grounded Multimodal Perception:从

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。