OpenAI News·· 2023-05-31精选AI 评分66
OpenAI 用过程监督提升数学推理并取得新 SOTA
Improving mathematical reasoning with process supervision
AI 导读
OpenAI 训练的模型通过奖励每一步正确的推理过程(过程监督)而非仅奖励最终答案(结果监督),在数学问题求解上取得新的 SOTA。原文指出过程监督除提升性能外,还能直接训练模型产出经人类认可的 chain-of-thought,带来对齐层面的收益。
推荐理由
原文对比了过程监督与结果监督的差异,读者可据此理解奖励每一步推理对性能和对齐的双重作用。
来源:OpenAI News · openai.com