← 返回资讯热点
AI热点雷峰网发布时间:2026-09-03 10:10热度 156.0000

机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026

S²-VLA 引入信念状态和自适应动态门控,仅用2B参数、7GB显存,长程操控超越7B模型。 作者丨 张 璐 编辑丨 幸丽娟 过去一段时间,Scaling Law 在具身智能里被看得很重。为了让机械臂完成复杂的搬运、对准和组合,多数工作把视觉-语言-动作(VLA)模型做到 7B 甚至 8.5B。参数变大后,语义理解和场景识别确实更强了,但长程操控里的不稳定问题并没有随之消失。 很多大参数量 VLA 在执行到第 10 步或更后面时会出现突然失败。核心原因是累积误差放大(Cumulative Error Propagation):早期哪怕只有毫米级定位偏差,也会在后续步骤中逐步放大,最终导致抓取失败或动作中断。参数量大了,语义理解确实更强,但模型在动作后半程还是很难及时纠正偏差。 华东师范大学与上海交通大学团队提出的 S²-VLA 针对这个问题做了改进。工作由谢志鹏、韩宗益(共同一作)、赵静(通讯作者)和孙仕亮等完成。 他们没有继续堆参数,而是加了信念状态和自适应动态门控,让模型能按当前阶段调整注意力。结果是:2B 参数量的模型在 LIBERO-Long 上达到 96.4% 成功率,超过了多数 7B 甚至 8.5B 的模型。 论文链接:https://arxiv.org/pdf/2606.27872 下面我们从机制和实际表现来看它具体怎么做的。 01 静态注意力: 为什么微小偏差会一路放大 先看传统 VLA 在长程任务里常见的失败模式。 在解耦式 VLA 里,上层策略头把视觉和语言特征映射成控制指令。多数方法用的是静态特征融合(Static Fusion):视觉、语言和动作历史的权重比例,在整个任务里一直固定不变。视觉、语言语义和动作历史的权重一旦定下来,就不会随执行进度改变。 这在短任务里问题不大,但在长程序列中会暴露两个明显缺陷。 第一,早期如果出现毫米级定位偏差,模型无法及时提高视觉权重来纠偏,误差会逐步累积,最终导致任务失败。 第二,子任务切换时,缺少对高层意图的动态调整,模型容易偏离当前指令,动作中断或卡在半空。 静态融合相当于全程用同一套“注意力配比”去应对不同阶段的需求。需要精细对准时,视觉权重不够;需要切换目标时,意图权重又上不去。结果就是误差一旦出现,就很难在后续步骤里被压下去。 S²-VLA 会随阶段调整:需要精准对准时,就提高视觉权重来纠偏;到了任务切换时,再提高意图权重,把目标重新锁定。 02 核心机制: 信念状态 + 三路自适应注意力 为了实现阶段自适应的注意力分配,作者把架构分成两个主要部分: ▎ 信念状态(Belief State) 模型用一个很轻量的循环网络,实时接收上一时刻的动作历史和关节传感器反馈。 它不直接输出动作,只在内部维持一个信念状态(Belief State),用来判断“现在走到哪一步了”和“有没有出现偏差”。 这套

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。