← 返回资讯热点
AI热点雷峰网发布时间:2026-10-08 07:20热度 244.0000

云栖大会观察:阿里怎么打下一阶段模型战?

云栖大会,解开市场对阿里大模型的三个疑惑。 作者丨胡敏 编辑丨刘伟 今年云栖大会,变化格外明显。参加过多年的人,打开主论坛议程就能感受到,和往年很不一样。 在吴泳铭发言之后,第一个登台分享的是千问大语言模型负责人刘大一恒;紧随其后的是 ATH 技术副总裁郑波,他负责视听等多模态模型。接在两场模型演讲之后,是平头哥高慧,与阿里云 CTO 李飞飞。 云栖大会,芯片和云当然重要,阿里对云的投入不会减少,芯片也依然是它绕不开的底牌。但重要的不止是芯片和云,现在站在市场聚光灯下的是 AI ,大家关心的自然也包括阿里的模型。阿里的模型往哪走、做多大、能不能打,是眼下真正牵动市场神经的问题。 那么,在云栖大会上,这些大模型负责人们究竟回答了哪些市场最为关注的问题? 01 Qwen下一代模型,规模有多大? 这是市场最直接的悬念。 此前一年多,业内对 Scaling 的质疑没停过。但到 2026 年年中,业界风向已明显调转。 Anthropic CEO Dario Amodei 在摩根士丹利会上直接定调: Scaling 没有撞墙, 2026 年还会迎来一轮激进加速。 而从各家行动来看,也的确如此。 Fable 5 被行业估算为约 4.5- 5 万亿参数, Kimi K3 总参数达到 2.8 万亿。这些数字接连落地,已经实实在在说明:各家 Scaling 不仅没有停,反而在以比过去更激进的方式加速。 回到 Qwen 本身。今年 8 月, Qwen3.8 发布,模型的参数已经达到了 2.4T 参数。这次雷峰网在云栖大会演讲上看到,刘大一恒再次给出了一张模型规划的路线图: Qwen4 系列即将到来, Qwen4 之后的 Qwen4.5 和 Qwen5 ,计划进一步迈向 5T—10T 参数。 从 72B 到 10T ,千问的 Scaling 曲线正在明显变陡。 两年前, Qwen2.5 旗舰模型的参数量还是 72B ;到 Qwen3.8 ,模型已经扩大至 2.4T ,增长了 33 倍。如果 Qwen4.5 和 Qwen5 继续迈向 5T—10T ,千问的参数规模还将在现有基础上再扩大一倍至三倍以上。 刘大一恒也再次明确了阿里的判断:基础模型的智能上限,依然离不开算力、数据和模型规模的持续投入。阿里还会继续扩大预训练计算量,沿着 Scaling Law 向上走。 但模型越大,训练和推理的账单也越高。阿里给出的解法,是一边扩大规模,一边重新设计模型架构。 Qwen3.8-Flash 已经展示了这条路线:通过稀疏注意力、线性注意力和外接记忆等新架构,它每次推理只激活 6B 参数;相比上一代,训练成本降至九分之一,百万 Token 的输入价格降至四分之一,超长上下文的预填充吞吐量提高 8.6 倍,模型能力反而继续上涨。 这意味着,阿里下一阶段的 Scaling 并不只是把模型做得更大,而是

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。