Meta多轮多语言基准Multi-IF:覆盖8种语言,超4500种任务

Meta发布的Multi-IF基准覆盖8种语言、4501个三轮对话任务,评估多轮对话和多语言指令遵循能力;实验显示,所有LLM在多轮对话中的表现逐轮衰减,非拉丁文字语言(如中文、俄语)准确率显著低于英语;数据集构建包括自动翻译与人工校对,强调多语言适配,并揭示了增大模型规模和自我修正能力对提升指令遵循的影响。

搜索