OpenAI的o3模型在ARC-AGI等测试中成绩亮眼,但调用资源成本昂贵

TechCrunch发布博文,OpenAI的o3模型在ARC-AGI等测试中成绩亮眼,其具备可调整推理时间的新功能,不同计算级别影响任务执行性能,且在多个基准测试中表现卓越,如在ARC-AGI测试中高计算设置下得分87.5%、低计算设置下得分75.7%,性能是o1的三倍,在EpochAI的Frontier Math基准测试中也创造新纪录。但o3模型成本过高,根据相关测试性能图标,其高分版本每项任务使用的计算资源价值超1000美元,相比o1、o1-mini成本大幅飙升,整个ARC-AGI测试下来调用资源成本超1万美元,只有财力雄厚者才能负担,这使其更适合处理复杂问题,未来更高效、更具成本效益的AI芯片或许是降低其使用成本的关键。 

搜索