OpenAI-o1替代方法火了!思考偏好优化,不限于推理任务

Tianhao Wu等提出思考偏好优化(TPO)方法,让模型在输出前进行内部“思考”,不展示过程,仅显示优化后答案;TPO能显著提升模型在推理和非推理任务的表现,通过偏好对训练模型生成更高质量回答,AlpacaEval测试中胜率比基线提升4%;TPO无需人工标注数据,能在多轮迭代中学会更简洁的思考,对Llama-3 8B等模型的性能提升效果显著。

搜索