← 返回资讯热点
AI热点雷峰网发布时间:2026-09-10 11:00热度 196.0000

深度解读 DeepSeek V4.1 Flash 全新架构,如何成为显存杀手

KV 缓存暴降 437 倍,Agent 成本大洗牌。 作者丨高允毅 编辑丨岑 峰 刚刚 DeepSeek V4.1-Flash 上线,最值得关注的是它的全新架构。 这是一次针对长上下文场景的架构重写。过去,更强的智力往往意味着更庞大的算力,超长上下文背后是极高的硬件需求。 但DeepSeek 这次用因果编码器-解码器架构 Causal-Encoder-Decoder(CED)、第二代压缩稀疏注意力Compressed Sparse Attention 2(CSA2)和 low / high / max 三档可调推理力度旋钮,打破了这一潜规则。能让 DeepSeek V4.1-Flash 以极低的成本,在不少评测中,智力超越上一代 DeepSeek V4-Pro。 这套新架构把大模型的“记忆体积”压缩到了极致,运行时的显存占用直接砍掉了3/4,存进硬盘的长期记忆更是只占用上一代的1/8 。 这种降维式的成本削减,意味着百万 Token 级别的超长上下文,可以真正进入工业级的生产力阶段。 01 CED架构:把百万上下文“读薄”, 预填充算力砍半 要理解这次架构重写的含金量,必须先看看以往长文本 Agent 场景中,最烧钱的地方是哪里。 答案是预填充。 在智能体的真实运行中,无论是每一次工具调用的结果返回,还是每一轮多轮对话的推进,大模型都必须把全部上下文,从头到尾过一遍,生成 KV 缓存记忆,这个过程就叫预填充。 在百万级上下文场景中,单是这一步就能吃满整张GPU。 上一代 DeepSeek V4-Flash 使用混合注意力架构,只给预填充提了速,让AI“读得更快”,却没有减少“读得容量” DeepSeek V4.1-Flash采用的 CED 架构可以直接预填充算力减少一半,进而将服务器硬盘上的持久缓存成本,缩减到上一代的1/8。对于调用 API 的企业而言,这意味着原本跑一次深度复杂任务需要支付 10 元的算力账单,现在直接被降维打击到了 1 到 2 元的“平民价”级别。 这是怎么做到的? DeepSeek V4.1-Flash的神经网络一共有40层,CED 架构把40层分成了两部分。前20层,它用一套“因果编码器”把全部上下文读一遍,然后在隐状态中输出一个高度浓缩的“摘要”;后20层,它不再从头读一遍,直接通过投影矩阵,从编码器的“摘要”里生成自己需要的全局KV缓存。 这就是“先读薄”,“只捞重点”,这一招直接把预填充的计算量砍掉一半。 不过只靠“摘要”当然不够。比如写代码时,项目整体逻辑可以靠摘要理解,但在面对刚生成、需要确保绝对精准的就近内容时,就需要“滑动窗口注意力(SWA)”来盯局部细节了。 不过,这些就近的局部记忆,无法直接从编码器的摘要中复用。如果为了追求 100% 精确而将最近的上下文重新看一遍,又会算力爆炸。 为此,DeepSeek 设计了一

来源:雷峰网
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。