← 返回资讯热点
AI热点雷峰网发布时间:2026-07-02 11:22热度 182

Claude Sonnet 5 上线一日差评刷屏:打不过千问和 Minimax,性价比全面翻车

一张中文测评图把Claude Sonnet 5送上风口浪尖。 作者丨 高允毅 编辑丨 马晓宁 Claude Sonnet 5才发布了一天,网上已经吵翻天——几乎全是差评。 Anthropic把它定位为“迄今最具 Agent 能力的 Sonnet”,甚至直接说它在大量智能体任务上已经接近旗舰 Opus 4.8,价格只有Opus 的四折。 听起来,这就是来给开发者送温暖的:更强的Agent、更便宜的API、更长的上下文、更稳的安全对齐。 但剧情没有按官方剧本走。 发布不到 24 小时,一张来自 GitHub 的跑分截图开始在中文技术圈疯传。这个项目叫 LLM Benchmark Dashboard ,是个人私有题库,主要在逻辑、数学、编程、人类直觉等高难度硬核推理问题上,测模型在深度思考、长思维链(Reasoning)模式下的表现。 在这场考核中,被寄予厚望的 Sonnet 5 不仅没能碾压全场,反而暴露出一个致命弱点: 极度拉胯的性价比。 经过仔细对比,我们可以看到三个关键事实: 第一,极限分数上 Sonnet 5 丢掉了绝对统治力。 在这套硬核逻辑题里,MiniMax-M3 跑出了 61.95 的高分拔得头筹,而 Qwen3.7-Plus 也在极限分上与 Sonnet 5 死死打平。这意味着国产推理大模型在纯逻辑的较量上,已经有能力和硅谷顶流平起平坐。 第二,测试成本完全不在一个量级。 这是对比中最刺眼的地方。Sonnet 5 跑完同一套测试花了 71.96 元,而 Qwen 只要 11.71 元,MiniMax 只要 11.64 元。Sonnet 5 的账单是国产模型的 6 倍还多。 如果真按这个比例大规模调用,企业的商业落地成本根本难以承受。 第三,耗时最短,但在这里可能并不是好事。 Sonnet 5 平均耗时仅 404 秒,远快于 Qwen 的 1156 秒和 MiniMax 的 887 秒。这说明它的 Token 吐出速度确实快。 但在面对极难逻辑题时,“快”往往意味着思考不够深。显然,Sonnet 5 的思维链(CoT)堆叠得不够厚,自我纠错预算受限,导致它在真正需要“绞尽脑汁”的地方,没能靠算力把极限分拉开。 也难怪网友看完第一反应如此真实: “这不是能力不行,这是性价比不行。” 不过也要说明,这毕竟是一家个人维护的私有题库,覆盖面和命题风格都有特定偏向。它不能代表 Sonnet 5 的全部能力,但在中文开发者关心的“纯逻辑攻坚”场景下,确实暴露了一个问题:在越来越卷的推理赛道里,Sonnet 5 不再是那个“闭眼选”的答案。 01 平替 Opus?拉倒吧 Anthropic 给 Sonnet 5 设定的官方叙事,原本非常清晰:Agent 能力大升级,价格却只要旗舰的四折。 为了拉拢开发者,官方甚至直接“发糖”:2026 年 8 月 31 日前限

来源:雷峰网
说明:本站展示中文整理摘要,便于快速判断价值;完整内容和版权归原站所有。