← 返回资讯热点
AI热点雷峰网发布时间:2026-09-30 07:45热度 164.0000

Kimi 和 DeepSeek,为什么出现在同一张模型架构图里?

大模型 Attention 路线变迁:从分流到重组。 作者丨李娜 编辑丨岑峰 一张大模型架构图里,同时出现了 Kimi 和 DeepSeek 的影子。 GLM-5.3-Flash项目配置文件:45层架构中,34层采用Kimi路线的KDA线性注意力,另外11层采用DeepSeek路线的KPool-DSA稀疏注意力 今年以来,大模型架构里出现了一条越来越清晰的变化:一些混合注意力架构中原本由全局Attention承担的角色,开始被Sparse Attention(稀疏注意力)接替。 要理解这个变化,得先回到 Attention 本身。 Attention解决的是一个基础问题:模型处理当前token时,能不能在越来越长的历史里,找到真正有用的信息。 大致来看,目前常见的Attention机制可以理解成三类: 全局注意力(Full / Global Attention) 直接读取完整的token历史,信息保留最充分,但计算和缓存成本也最高; 线性注意力(Linear Attention) 把历史压缩进更紧凑的状态,以降低长序列的计算成本; 稀疏注意力(Sparse Attention) 则保留更完整的历史,只选择其中一部分重要信息参与计算。过去几年出现的很多 高效注意力(Efficient Attention) ,主要就在后两种方向上继续演化。 最开始,经典 Transformer 主要使用 Full Attention,Full Attention让模型可以直接访问完整的token级历史,代价是计算和KV Cache随上下文迅速增长。连带着训练和推理成本也随之大幅增加。 过去几年,大家对 Attention 的改造,本质上都是在能力和成本之间找平衡。于是,作为折中方案的混合注意力架构逐渐流行起来:不同机制被放进同一套模型里分工,高效Attention负责降低成本,少量全局Attention保留直接访问完整历史的机会。 从不同Attention路线,看大模型公司的选择 到了今年,很多混合注意力架构里由全局Attention承担的角色,开始出现被Sparse Attention接替的迹象。 8月发布的Qwen3.8-Flash-Next就是一个很清楚的例子。它延续此前三层 Gated DeltaNet 配一层 Attention 的结构,但那一层原本负责全局精确读取的 Attention,被进一步改造成了 Qwen Sparse Attention这样的高效注意力机制。(此前,我们也对 GLM-5.3-Flash 和 Qwen3.8-Flash-Next 做过详细实测,可参见 https://mp.weixin.qq.com/s/HxJhiH0O1etsHoH_X1J5VQ ) 雷峰网 Qwen3.8-Flash-Next 架构图:每四层里,三层是 GDN,一层是 Q

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。