GMIF 2026:日均140万亿Token调用,正在改变SSD的能力与分工
作者 | 陈悦琳 编辑 | 包永刚 HBM热潮之外,其他存储形式也站在风口。 这是今年第五届GMIF2026全球存储器行业创新峰会释放的第一个明显信号。以全球云数据中心资本支出为例,摩根士丹利执行董事、大中华区半导体分析师颜志天指出,在未计入HBM的情况下,2026年存储占比接近五成,2027年预计进一步升至53%。 热钱涌向存储,背后是前所未有的推理需求增加。截至今年3月,中国日均Token调用量已突破140万亿。对此,三星电子副总裁、Memory事业部首席技术官Kevin Yoon做了一个简单换算:中国每天消耗的Token,是中国国家图书馆全部藏书对应Token量的20倍以上,也接近人类历史上所有出版图书总量的6倍。 面对140万亿量级的推理负载,存储要应对的不只是数据量的增长,还有不同数据在访问频率和生命周期上的巨大差异。这意味着不同存储介质需要为此补齐各自在容量、带宽、时延和耐久性上的短板。 除此之外,Solidigm亚太区销售副总裁倪锦峰还在现场提到,以前存储成本较低时,行业倾向于尽量简化存储层级;随着AI数据需求快速增长和成本压力加剧,原有的“存储金字塔”也在被进一步细分。 规模化推理下,三重压力「夹击」存储 当AI的发展阶段从训练端的模型竞赛进一步走向推理侧的规模化应用后,存储面对的压力也更为具体。倪锦峰将其概括为三个维度。 最直观的是 数据丰富度。 星河智联现场展示的车载Agent,可以用来说明AI系统如何同时处理和保存多模态数据:除了理解语音、视觉、车辆信号等不同形式的信息之外,Agent还要结合对话历史、长期记忆、用户画像以及实时变化的车身状态完成判断。 这意味着数据丰富度不只体现为数据形式和数量的增加。不同数据的来源、形态和更新频率各不相同,直接导向 第二层压力——推理复杂度 。 Arm全球存储业务负责人John Xavier Lionel对推理数据的拆解恰好解释这一维度:模型变大,会带来更多权重和运行时状态;上下文越长,需要为后续Token生成保留的KV Cache也在增加;同时服务的用户越多,系统还要为每个请求分别保留KV Cache;进入逐Token生成的Decode阶段,模型权重和KV Cache还会被反复访问。 而当推理模式从一次性问答转向持续运行的Agent时,单个任务持续时间被拉长,随着任务规模扩大,需要长期维护的上下文和运行状态也不断累积,这也引出了倪锦峰所说的第三个维度“ 运营持久性 ”。 Dify联合创始人陈璐莎判断,未来企业运行的Agent,数量可能将从个位数上升至数百个,并且能够24小时待命、执行长程任务和承担高并发请求。 这种持续运行,也对应不同的企业AI服务模式。例如并行科技提供的MaaS(Model as a Service,模型即服务)模式允许企业通过API持续调用不同模型并按Token付费。这意味着服务
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。