MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering

We introduce MLE-bench, a benchmark for measuring how well AI agents perform at machine learning engineering.

Source: OpenAI β€” Published β€” Category: Models

πŸ”— Read full article on OpenAI β†’