Liquid AI 开源 Antidoom:用最终 token 偏好优化(FTPO)减少推理模型中的死亡循环
Liquid AI 开源了 Antidoom 方法,专门解决推理模型中的“死亡循环”——模型重复生成同一片段直至耗尽上下文窗口。Antidoom 通过 Final Token Preference Optimization(FTPO)识别循环起始 token,并仅对该位置进行重新训练。在 LFM2.5-2.6B 模型上,死亡循环率从 10.2% 降至 1.4%;在 Qwen3.5-4B 上从 22.9% 降至 1%。生成、检测和 FTPO 训练器均已开源。
说明:本站展示中文整理摘要,便于快速判断价值;完整内容和版权归原站所有。