拆解 Claude 5.1:38 小时不睡觉的背后,Anthropic 正在终结「模型论」
状态校验、权限路由、异步调度,撑起一套可持续执行的运行时。 作者丨 郑佳美 编辑丨岑 峰 刚刚,Anthropic 更新了 Claude 5.1,一口气推出 Fable 5.1 和 Mythos 5.1。 这两个名字看起来像两档模型,实际上底层用的是同一套模型。区别在于 Anthropic 把能力开放范围单独拆了出来: Fable 负责通用编码、知识工作和 Agent 任务,Mythos 则面向经过验证的网络安全和生命科学研究场景,允许进入更深的工具调用和专业任务。 Fable 和 Mythos 的分化,标志着 Anthropic 正式将‘智力’与‘权限’物理剥离。 这次更新里还有一个变化很明显。Ramp 的一次测试中,Fable 5.1 无人值守运行了 38 小时,中途识别出实验中的 label artifact,重新处理数据,并行启动 6 组实验,再根据返回结果继续修改后续方案。 38 小时这个数字本身并没有太多技术含义,关键在于模型在这段时间里没有沿着一开始的计划机械执行。实验条件发生变化之后,它能够修改已有判断,再继续推进任务。 这就把问题带到了长时 Agent 里更基础的一层:执行时间拉长之后,系统必须持续判断,之前留下来的信息还有多少是有效的。 01 长时 Agent 解决状态一致性 短任务里,模型看到的上下文和真实环境通常不会发生太大偏差。进入几个小时甚至几十小时以后,情况会完全不同。 代码可能已经被修改过几轮, 实验条件瞬息万变。在这次38小时的长任务中,模型急需解决状态漂移: 数据版本发生变化,早先成立的判断也可能被新结果推翻。与此同时,这些旧信息依然留在上下文中。 原有的“模型论”认为,只要上下文够长,AI 就有记忆。但Claude 5.1 彻底否定了这一点:如果不建立一套独立的、基于外部事实的状态失效机制,大模型只会守着一堆过时的“垃圾历史”一本正经地胡说八道 。 假设 Claude 在任务开始时读过某个服务,并判断接口采用同步调用。几个小时以后,它已经完成重构,接口换成新的执行路径,但最早那段分析仍然保留在 conversation history 中。如果后续推理再次引用旧结论,模型内部理解的任务状态就会开始偏离真实代码。雷峰网 这类偏差就是长任务里的 state drift。它说明单纯扩大 context window并不能解决长期执行。上下文可以保存更多历史,却不会自动处理历史信息的有效期。 所以真正稳定的 Agent 不能把聊天记录当成唯一状态来源。 代码应该重新从当前 repository 读取,实验结果应该绑定具体 run ID、数据版本和配置,任务完成情况应该进入单独的 task state。模型的自然语言记录可以保留推理过程,但代码、实验和任务进度需要有各自明确的 source of truth。雷峰网 Ramp 那次
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。