Google Research发布Retrieve-for-Train(R4T):强化学习编译的扩散检索器,查询扇出快12至20倍
Google Research推出Retrieve-for-Train(R4T)搜索框架,旨在返回连贯且多样的结果集。该方法先用强化学习训练一次扇出语言模型,奖励信号包括有据性、多样性和对齐;再由该模型合成训练数据,用于训练一个5390万参数的扩散检索器。该检索器单次生成所有检索方向,比自回归扇出快12至20倍。目前尚未发布代码或模型权重。
说明:本站展示中文整理摘要,便于快速阅读;完整内容和版权归原站所有。