Meta发布的Multi-IF基准覆盖8种语言、4501个三轮对话任务,评估多轮对话和多语言指令遵循能力;实验显示,所有LLM在多轮对话中的表现逐轮衰减,非拉丁文字语言(如中文、俄语)准确率显著低于英语;数据集构建包括自动翻译与人工校对,强调多语言适配,并揭示了增大模型规模和自我修正能力对提升指令遵循的影响。
❯
搜索
扫码打开当前页
返回顶部
幸运之星即将降临……
点击领取今天的签到奖励!
恭喜!您今天获得了{{mission.data.mission.credit}}积分
我的优惠
-
¥優惠使用時效:无法使用使用時效:
之前
使用時效:预期有效优惠编号:×
没有优惠可用!
