Google Research 提出 Retrieve-for-Train:用 RL 编译扩散模型绕过推理瓶颈,加速复杂 AI 搜索
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的 fan-out 查询并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归生成完整结果集,无需 CoT 推理 token。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的 fan-out 查询并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归生成完整结果集,无需 CoT 推理 token。