阿里开源 Qwen3.8-27B 本地实测:性能很强,但 Agent 适配仍待补课
从部署到实测:覆盖标准部署、量化部署、Agent场景三大维度。 作者丨 吴海明 何宇轩 编辑丨李娜 岑峰 8月14日,阿里 Qwen 团队开源了 Qwen3.8-27B 模型,紧接着社区里的声音从“能不能跑”变成了“是不是新的模型斩杀线”,有人把它叫作 本地 Opus ,也有人直接给出更刺激的判断:一个 27B 开源模型,已经能在部分代码和 Agent 任务上达到顶级闭源模型的水平。那么, 一个 27B 开源模型,体验到底怎么样呢 ? 根据官方数据,27B dense、Apache 2.0、262K 原生上下文、可扩展到 100 万 token、支持视觉理解、思考默认开启,低比特量化后还能压到十几 GB 级 GGUF 文件,这说明 Qwen3.8-27B 是一个试图把代码、长上下文、多模态和 Agent 工作流一起拉到本地的开源底座。 因此,我们从适配 Agent 出发,先后测试标准化部署、量化部署和接入 Agent 框架。其中,标准部署看 vLLM、SGLang 和 Llama.cpp 谁更能榨干 GPU,将推理速度提到最快;量化部署从 2bit 测到 16bit,看文件体积、速度和质量怎么取舍;Agent 测试则把本地 Qwen3.8-27B 接入 DeepSeek Harness,并用同样本地部署的 DeepSeek-V4-Flash-0731 做对照。测试任务从组合推理、事实校验、新闻写作,一直压到论文综述和 3D 网站生成。 实测结果有点像给这波热度泼了一杯很浓的咖啡:确实醒脑,但也很苦 。 在 Agent 质量评分里,Qwen3.8-27B 最终拿到任务完成度的满分,复杂任务完成度明显更稳;标准部署下,vLLM 和 SGLang 平均吞吐都超过 40 token/s;量化部署里,3bit 到 6bit 在本轮文本任务中保持了完成度满分的质量。 可另一面也同样扎眼:Qwen 最终跑通 9 个 Agent 任务消耗了 13,995,350 token、197 次请求和 22,564.37 秒,约 6 小时 17 分钟;其中,生成 3D 网站单题就烧掉 11,533,959 token,分析日志发现,核心问题出现在复杂任务拆分归于复杂、单步目标过重、上下文反复回灌,导致大量时间消耗在和空转上。 它确实能干活,而且能把复杂任务做得更完整,但是它烧的不仅是 token,更是用户的时间。 所以,这篇文章回答了:性能比肩 Claude Opus 4.6 Max 的开源 dense 模型,放到本地工作流里到底怎么用?在哪些部署框架下跑得快,量化到几 bit 还可靠,接入 Agent 后质量优势值不值得、等待时间和本地计算成本?简单说,Qwen3.8-27B 是一个 能做事、愿意深想、但必须被严格约束 token、步骤和输出边界 的开源 Agent 底座。它让社区
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。