我们让 GPT‑6 Astra、Fable 5.1 和 Sol 控制同一台机器人:谁真的把活干完了?
真实云台实测:三个模型都让机器转起来,但“完成”的标准天差地别。 作者丨 Rhea 编辑丨李娜 岑峰 云台机械臂是一个能上下左右转动的摄像头底座/支架,我用GPT‑6 Astra、Claude Fable 5.1 和 GPT‑5.6 Sol这三个顶级模型都让机器人转了起来,三个模型均完成了任务,但执行路径、验证标准和成本差异明显。 这次 GPT-6 Astra 出来之后,网上已经有很多优秀的测评案例了。如果读者已经能在其他地方看到这些,这个评测还能提供什么新的观察呢? 在纯数字环境里,写错一段代码通常可以撤回,按钮点偏了也可以重来; 但 现实世界不是这样 : 实体设备有惯性、有边界、有反馈,也有真实的风险。命令发出去,不代表动作一定到位;走什么路径、使用多快的速度、什么时候停手、要不要确认结果,都会变成模型必须自己做出的选择。 【先给大家跳段舞】 云台机械臂刚好是一个很合适的切口。 它的动作足够简单,不需要机器人专业知识也能看懂;同时,速度、路径、幅度和停顿又会被直接呈现在眼前。原本藏在模型内部的判断,会变成一段肉眼可见的运动。(剧透一下,通过云台的测评,你能一眼看出来三个模型的区别) 笔者之前搞到过一个二手的云台机器人。搞笑的是树莓派被商家扣下了,于是只能用 macmini 来驱动它,并且开始调试的时候发现这机器固件有很大问题,两个月前单纯把它复活就烧掉了快两千人民币的 token(那时候主力用的是 opus 4.8) 【不知道 opus4 .8 给发过多 少成功战报,但依然每次以“我真的错了”来结尾】 笔者一度怀疑这问题到底是个人能力的天花板,还是模型的天花板。好在后面修复是搞定了,也陆续做了一些人脸、手掌的跟随功能,但因为调试起来确实烧钱,也没什么有意思的地方,就逐渐闲置了。 总之就是小机械臂的可玩性和可能性非常诱人,但彼时的模型能力让笔者没动力继续尝试。 因此这次看到 GPT-6 Astra 各种劲爆的能力秀之后,瞬间就想起了这台半吃灰状态的云台机器人。如果当初用的不是 Opus4.8,那结局会不会不一样。 于是笔者把一台两轴云台机械臂接到了 Mac mini 上,然后把同一句话分别交给 GPT-5.6 Sol、GPT-6 Astra Pro 和 Claude Fable 5.1: “我 Mac mini 接了一个小机器人,不管你用什么方式,让它满行程转一遍。” (天知道两个月前要让这句话跑起来,我付出了啥) 雷峰网 这次笔者没有规定速度,也没有解释什么叫满行程(这是之前最大坑),也没有告诉它要不要走四个角,也没有给出成功标准。 反正就是啥也没给。因为真正想看的是: 像 之前一样不知道速度、路径、风险边界和成功标准时,顶级模型会怎么思考,能不能把事情真正搞定。 我们先把实测结论一次性放出来。 面对同一台云台、同一句测试水平与垂直满行程的模糊指令,三个
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。