跳到正文
原文
OpenAI News·· 2023-05-31精选AI 评分66

OpenAI 用过程监督提升数学推理并取得新 SOTA

Improving mathematical reasoning with process supervision

AI 导读

OpenAI 训练的模型通过奖励每一步正确的推理过程(过程监督)而非仅奖励最终答案(结果监督),在数学问题求解上取得新的 SOTA。原文指出过程监督除提升性能外,还能直接训练模型产出经人类认可的 chain-of-thought,带来对齐层面的收益。

推荐理由

原文对比了过程监督与结果监督的差异,读者可据此理解奖励每一步推理对性能和对齐的双重作用。

来源:OpenAI News · openai.com