OpenAI 推出 MLE-bench:o17金封王,超人类 Kaggle 大师

OpenAI发布MLE-bench基准测试,用于评估AI Agent在机器学习工程任务中的表现;o1-preview AI模型在基准测试中表现突出,获得7枚金牌,超越了人类Kaggle大师的标准;测试结果显示,专为Kaggle设计的AIDE框架效果最佳,使o1-preview在机器学习竞赛中领先其他模型。

搜索