Tianhao Wu等提出思考偏好优化(TPO)方法,让模型在输出前进行内部“思考”,不展示过程,仅显示优化后答案;TPO能显著提升模型在推理和非推理任务的表现,通过偏好对训练模型生成更高质量回答,AlpacaEval测试中胜率比基线提升4%;TPO无需人工标注数据,能在多轮迭代中学会更简洁的思考,对Llama-3 8B等模型的性能提升效果显著。
❯
搜索
扫码打开当前页
返回顶部
幸运之星即将降临……
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠
-
¥優惠使用時效:无法使用使用時效:
之前
使用時效:预期有效优惠编号:×
没有优惠可用!
