← 返回资讯热点
AI热点雷峰网发布时间:2026-10-08 15:37热度 156.0000

Claude Haiku 5.5 降本背后:操作能力暴涨,复杂编程为何仍差一截?

模型开始按任务动态分配推理,超 10 万 Token 后,输入输出单价均涨 5 倍。 作者丨 郑佳美 编辑丨岑 峰 刚刚,Anthropic 发布了 Claude Haiku 5.5。 这次升级的幅度不小,尤其是在计算机操作方面,OSWorld 2.1 评测成绩从上一代的 15.7% 提升到了 72.4%。知识工作和复杂推理能力也有明显改善,而按照 Anthropic 公布的数据,新模型的平均运行成本还下降了约 75%。 除此之外,Haiku 5.5 还加入了自适应推理机制,并支持 100 万 Token 上下文。过去,Haiku 主要用来处理摘要、分类、信息提取这些高频任务,优势一直是速度快、成本低。 这次更新后,它能处理的工作明显复杂了不少,部分评测成绩甚至已经接近 Sonnet 5.5。不过,换到复杂编程任务,两者的差距依然明显。 再看这次更新的推理机制和价格规则,Haiku 5.5 在不同任务中的表现与实际使用成本,其实还有不少细节需要拆开来看。 01 复杂编程仍有差距 Haiku 5.5 的性能增长主要体现在计算机操作、知识工作和多学科推理几个方向,其中计算机操作的变化尤其明显。雷峰网 在 OSWorld 2.1 离线子集上,Haiku 5.5 取得 72.4%,上一代只有 15.7%,Sonnet 5.5 则达到 83.9%。OSWorld 测试的是模型通过计算机界面完成长链路任务的能力,涉及界面理解、操作执行以及根据环境反馈继续完成任务。 与普通文本问答相比,计算机操作存在更多状态依赖。模型完成一次点击或者输入后,页面可能发生变化,后续动作需要根据新的界面状态决定。 如果操作失败,模型还要判断当前环境是否仍然符合任务要求。Haiku 5.5 在这一评测中的增长,说明它处理连续操作任务的能力相比上一代有了明显改善。 但 72.4% 对应的是特定测试集中的完成率,不能直接代表所有浏览器或桌面任务的实际成功率。真实业务中的动态页面、权限限制和异常状态,仍然需要在对应环境中单独测试。 知识工作方面,Haiku 5.5 在 GDPval-AA v2.1 上获得 1620 分,Haiku 4.5 为 735 分,Sonnet 5.5 为 1840 分。该评测涵盖 44 类职业的实际工作任务,涉及材料分析、信息整合和工作成果生成。 另一项 AA-Briefcase v1.1 评测中,Haiku 5.5 从上一代的 614 分提高至 1578 分。多学科推理测试 Humanity's Last Exam 的无工具成绩达到 45.9%,接入工具后为 57.4%,也明显高于上一代。 这些评测涉及的任务比普通信息提取更加复杂。模型需要理解多个信息来源之间的关系,处理材料中的限制条件,并根据已有内容形成结果。工具的引入还增加了信息获取和结果整合的环节。 不过,编程评测

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。