从「算得快」到「干得了活」:AI推理时代,CPU如何重塑算力版图
记者:郭思 编辑:包永刚 “善弈者谋势,不善弈者谋子。”这句古老的智慧,正精准地映射出当下AI产业的演进轨迹。 当行业狂热于大模型训练阶段的算力军备竞赛时,一场更为深刻的重心迁移正在悄然发生,AI已经从回答问题走向解决问题,从单纯的模型训练走向复杂的智能体推理。这种转变对底层算力架构的冲击,远比表面看起来要深远得多。 如果说训练阶段是GPU闷头计算的大兵团作战,那么推理时代则是一场需要精密调度的现代化战争。 在这场变革中,英特尔在9月22的Connection大会上给出了一个明确的判断:推理时代,CPU正从“配角”蜕变为整个系统的“控制中枢”。当AI真正开始干活,算力的定义正在被重写。 01、数字AI:当智能体规模化,CPU为何重回C位? 想要理解CPU的“逆袭”,核心是厘清智能体执行与传统模型训练的本质差异。模型训练是标准化、可并行的批量任务,核心目标是极致提升整体吞吐量;而智能体是典型的串行状态机,每一步任务执行都依赖上一步的输出结果,任意环节的微小延迟,都会沿着任务链路层层放大,最终影响整体智能体验。这也意味着,传统CPU一味追求平均吞吐的优化思路已然过时,稳定、可控、超低的端到端延迟,成为智能体规模化落地的核心硬性约束。 不仅如此,智能体场景的硬件负载矛盾愈发突出。高并发工具调用与高带宽AI推理任务需要在单芯片内混跑,二者对内存资源的需求相互冲突,叠加多租户场景下的安全隔离、资源独占需求,传统CPU架构的短板彻底暴露,架构革新与系统重构势在必行。 对于这一难题,英特尔并没有选择惯用的单点堆砌参数,而是 从系统层面重新划分数据中心的架构。 大会现场,英特尔数据中心集团副总裁、中国区总经理陈葆立表示,“未来的数据中心将被拆分为三类集群:负责智能体执行和任务编排的CPU集群、负责模型推理计算的GPU集群,以及承载长对话、文档等持续新增业务数据的存储集群。这三类集群之间的数据调度,全部由CPU完成。” 落到产品上,采用Intel 18A制程、最高拥有288个能效核的至强6+处理器配合智能体套件,单颗即可部署近千个智能体。 英特尔表示,这一优势并不是凭空想象,而是有着实测数据支撑: 在SWE-bench测试中,其单智能体性能领先竞品15%;在云端沙箱场景下,面对10分钟内批量启动上万沙箱、单沙箱延迟200ms以内的严苛要求,至强6+支持350个沙箱并发,性能约为竞品的1.46倍。结论显而易见:在智能体场景下,性能和响应速度缺一不可。 而另一方面,CPU在三个具体环节上的价值也十分突出。首先是异构数据预处理,智能体需要抓取网页、视频、PDF等素材并做文本提取,这类任务GPU并不擅长,而至强AMX加速器让向量化和重排序分别达到基准的2倍和4倍。 其次是存储调度,从HBM到DRAM再到本地SSD,成本和延迟呈反向变化,CPU作为核心调度者,联合焱融科技基于至强6和M
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。