大模型能自己造 Agent 框架吗?字节 Seed 的 HarnessDev:64 项改动仅 34 项可泛化
字节跳动 Seed 联合 SUTD、佐治亚理工、M-A-P 与 TokenWave.AI 推出 HarnessDev 基准,评测模型构建的可运行 harness 而非其答案。从得分为 0 的种子出发,6 个创作者大模型在 5 个基准、2207 个任务上构建 harness,并依据执行反馈持续演进。自建 harness 在写作与机器学习实验上可媲美人类参考,但在代码和搜索任务上落后;64 项演进改动中仅 34 项在留出任务上方向一致。
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。