← 返回资讯热点
AI热点MarkTechPost发布时间:2026-10-08 08:40热度 124.0000

英伟达 PivotOPD 让多轮 AI 智能体学会从关键失误中恢复

英伟达研究人员提出 PivotOPD,这是一种在线策略蒸馏方法,用于训练多轮 LLM 智能体避免早期的关键性失误,并学会从中恢复。在 3 个智能体基准测试上,该方法对 13 个基线取得了最佳平均成绩。

来源:MarkTechPost
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。