DeepSeek 发布 DeepSeek-V4.1-Flash:百万 token 上下文、FP4 KV 缓存与跨层注意力复用
长时程智能体已将 LLM 服务变成输入密集型工作负载。重复的预填充和百万 token 级上下文让 KV 缓存对 HBM、SSD 容量和带宽造成压力。DeepSeek AI 的新版本正是围绕这一瓶颈打造。DeepSeek-V4.1-Flash 是一款多模态混合专家(MoE)模型,主干参数 552B,另加 196B Engram 参数,并具备 100 万 token 上下文窗口。
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。