← 返回资讯热点
AI热点雷峰网发布时间:2026-09-01 08:36热度 228.0000

我们用 Qwen 3.8-Max 做了一个 AI 大模型宇宙:效果竟然胜过 GPT5.6?

Max长程Agent能力的背后,是精雕细琢的典范,还是算力黑洞的失控? 作者丨 李娜 编辑丨 岑峰 我让Qwen 3.8-Max从零搭建了一个3D大模型演进宇宙网站,又和GPT-5.6做了迭代对比。 (Qwen3.8-Max运行成果截图) 效果上限方面,Qwen 3.8-Max 展现了远超 GPT-5.6 的交付细节; 效率和成本代价方面,Max高完成度背后是低效,而且因为无法自主判断任务终点导致了额度耗尽中断; 适用场景方面, 追求快速迭代、低成本原型,GPT 依然是首选,但在不计成本追求极致性能的场景,Qwen 3.8-Max 提供了一个昂贵但有效的国产替代。(雷峰网) 01 2.4万亿参数之后, Max3.8为什么开始强调Agent? 8月3日,阿里正式发布Qwen 3.8-Max。 从规格看,它依然足够醒目: 2.4万亿 总参数、约 950亿 激活参数、 100万 Token上下文,覆盖文本、代码和视觉任务,并计划开放Max权重和27B小模型。榜单、规模、价格和开源,延续着Qwen过去几年的竞争路线。 (阿里Qwen3.8 max官方技术博客截图) 但到了这一代,仅靠这些已经很难解释Max的差异化。 相比Kimi K3用KDA混合线性注意力、Stable LatentMoE建立起鲜明的架构叙事, Qwen3.8-Max没有公布同等分量的新基础架构; 它的价格相较海外旗舰仍有竞争力, 却没有低到足以单独改变模型选择 ; 2.4T权重即使开放,其主要价值也更偏向云厂商、企业和研究机构,而不是普通开发者直接本地部署。当头部模型已经普遍拥有很高的基础能力,“更大、更强、更开放”正在越来越难成为一款旗舰模型独有的理由。 Qwen3.8-Max这次把更多篇幅留给了另一个方向:长程Agent。 正式版技术博客中,模型规格和榜单很快被带过,真正占据篇幅的是16天自主开发、125小时科研复现、数百轮芯片优化,以及编程、办公场景中的端到端执行项目。它们共同强调一种能力:模型能否在真实环境中调用工具、接收反馈、检查结果并继续修改,把复杂任务持续推向完成。 这也为Max找到了一个更明确的位置。它不必像中小模型那样承担普及和本地部署,而是负责抬高Qwen体系的能力上限,再由Qwen Code、办公Agent和阿里云把这种能力送进具体工作流。但是它的实际能力如何,这也是我们在后面实测中需要关注的地方。 02 Agent 能力从哪里来? Max 把训练重心放在真实环境 RL Qwen3.8-Max没有用一套新的基础架构来定义这一代,官方技术报告里显示 “ Q wen 3.8-Max 基于 Qwen 3.5 的架构基础构建”, 对Agent能力提升的主要解释,落在了真实环境中的 RL(强化学习训练) 上。 (阿里Qwen3.8 max官方技术博客截图:RL训练环境数量与能力增长曲线

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。