对比 Codex,免费的 AgnesCode 也能在底层算子优化任务中打得有来有回
AgnesCode在部分芯片上跑出更高性能,免费模型完成专业级交付。 作者丨 吴海明 曹PP 编辑丨李 娜 免费的 AI Coding Agent,能不能和付费 Codex 在真实工程任务里打得有来有回? 过去一年,我们已经习惯了让 Coding Agent 写网页、做应用、修 Bug。但这一次,我们想把它往更底层推一步: 让 AI 去优化大模型自己运行时使用的算子 。 所谓“算子”,可以简单理解为 大模型运行时 反复执行的 一小段底层计算程序 。 模型每生成一个 Token,都要在 GPU 或其他 AI 芯片上执行大量矩阵计算、注意力计算和数据变换。单个算子看起来很小,但会被模型反复调用。因此,一段高频算子如果能快 10%、20%,最终就可能转化为推理速度、硬件利用率和服务成本上的实际差异。 这恰好提供了一种不同于常规 Coding Benchmark 的测试方式:如果 Agent 能够读懂任务、修改算子、适配不同芯片,并最终跑出真实的性能提升,那么它触及的已经不只是应用开发,而是 AI Infra 中一部分真正的工程工作。 为了回答这个问题,我们把 AgnesCode + Agnes 3.0 Flash 放进众智 FlagOS 开放计算全球大赛的一道算子优化题:为 DeepSeek-V3 解码阶段使用的底层算子写优化代码,并在 8 款芯片上接受赛事官方自动化评测,同时,选择 Codex + GPT-5.6 Sol 组合作为对照。两组候选者使用完全相同的环境为算子撰写优化代码,最终都提交到赛事官方的自动化评测系统进行评测。 结果很有趣: 两组选手都顺利完成了任务,Codex + GPT-5.6 Sol 用 8 分 57 秒给出结果,AgnesCode + Agnes 3.0 Flash 在中途被测试人员催促了一次后,耗时 20 分 36 秒完成任务。经过官方自动化评测后,对比 Codex 通过7款芯片的战绩,AgnesCode 略逊一筹,通过了 6 款芯片;但在双方共同通过的 5 款芯片上,AgnesCode 有 4 项加速比更高,其中在国际通用芯片 B 上达到 4.81×,高于 Codex 的 3.71×,加速比分数高出约 29.6%;昆仑芯上也只有 AgnesCode 通过测试。 这不只是一个“免费模型全面替代付费模型”的故事,还说明了另一件事:当任务边界、工具链和评测闭环足够清晰时,免费 Agent 已经可以进入底层工程任务,并交出可验收、有性能收益的产物。 Agent 时代,模型便宜只是入场券,能把任务交到终点才是分水岭。 本文真正想回答的,是当 AI 开始拧紧自己的底层螺丝,免费的 AgnesCode 距离一个可用的工程助手还有多远。(雷峰网) 01 一道题: 优化 DeepSeek-V3 底层算子 考虑到常见测试任务的数据很可能已经用于模型训练
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。