Evaluation directory
Browse benchmark definitions, capability categories, and model rankings.
Data as of 2026-09-08
Open any benchmark to inspect its leaderboard, scoring direction, evidence fields, and programmatic FAQ.
Benchmark | source | Category | Family | Metric | Coverage | Coverage tier | Evidence | Score eligible |
|---|
| BenchmarkMTEB English v2 Classification | sourceMTEB | Categoryclassification | FamilyMTEB English v2 | MetricOfficial leaderboard task-type mean | Coverage257 | Coverage tierfeatured | EvidenceA | Score eligibleNo |
| BenchmarkGPQA | sourceLLM Stats | Categoryphysics | FamilyGPQA | MetricScore | Coverage247 | Coverage tierfeatured | EvidenceC | Score eligibleNo |
| BenchmarkMTEB English v2 Reranking | sourceMTEB | Categoryreranking | FamilyMTEB English v2 | MetricOfficial leaderboard task-type mean | Coverage241 | Coverage tierfeatured | EvidenceA | Score eligibleNo |
| BenchmarkMTEB English v2 Clustering | sourceMTEB | Categoryclustering | FamilyMTEB English v2 | MetricOfficial leaderboard task-type mean | Coverage217 | Coverage tierfeatured | EvidenceA | Score eligibleNo |
| BenchmarkMTEB English v2 Retrieval | sourceMTEB | Categoryretrieval | FamilyMTEB English v2 | MetricOfficial leaderboard task-type mean | Coverage212 | Coverage tierfeatured | EvidenceA | Score eligibleNo |
| BenchmarkMTEB English v2 Semantic Similarity | sourceMTEB | Categorysemantic similarity | FamilyMTEB English v2 | MetricOfficial leaderboard task-type mean | Coverage211 | Coverage tierfeatured | EvidenceA | Score eligibleNo |
| BenchmarkLM Arena Text | sourceLM Arena | CategoryUnspecified | Familylm-arena-text | MetricArena Rating | Coverage210 | Coverage tierfeatured | EvidenceA | Score eligibleNo |
| BenchmarkLM Arena Text Style Control | sourceLM Arena | CategoryUnspecified | Familylm-arena-text-style-control | MetricArena Rating | Coverage210 | Coverage tierfeatured | EvidenceA | Score eligibleNo |
| BenchmarkArtificial Analysis Text To Image | sourceArtificial Analysis | Categoryoverall quality | FamilyArtificial Analysis Text To Image | MetricElo | Coverage156 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
| BenchmarkMMLU-Pro | sourceLLM Stats | Categorylanguage | FamilyMMLU-Pro | MetricScore | Coverage138 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
| BenchmarkLM Arena Text Factuality | sourceLM Arena | CategoryUnspecified | Familylm-arena-text-factuality | MetricArena Rating | Coverage121 | Coverage tierfeatured | EvidenceA | Score eligibleNo |
| BenchmarkAIME 2025 | sourceLLM Stats | Categorymath | FamilyAIME 2025 | MetricScore | Coverage119 | Coverage tierfeatured | EvidenceC | Score eligibleNo |
| BenchmarkSWE-Bench Verified | sourceLLM Stats | Categoryreasoning | FamilySWE-Bench Verified | MetricScore | Coverage113 | Coverage tierfeatured | EvidenceC | Score eligibleNo |
| BenchmarkLM Arena Vision | sourceLM Arena | CategoryUnspecified | Familylm-arena-vision | MetricArena Rating | Coverage107 | Coverage tierfeatured | EvidenceA | Score eligibleNo |
| BenchmarkLM Arena Vision Style Control | sourceLM Arena | CategoryUnspecified | Familylm-arena-vision-style-control | MetricArena Rating | Coverage107 | Coverage tierfeatured | EvidenceA | Score eligibleNo |
| BenchmarkHumanity's Last Exam | sourceLLM Stats | Categorymath | FamilyHumanity's Last Exam | MetricScore | Coverage103 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
| BenchmarkMMLU | sourceLLM Stats | Categorylanguage | FamilyMMLU | MetricScore | Coverage101 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
| BenchmarkLM Arena Webdev | sourceLM Arena | CategoryUnspecified | Familylm-arena-webdev | MetricArena Rating | Coverage97 | Coverage tierfeatured | EvidenceA | Score eligibleNo |
| BenchmarkArtificial Analysis Text To Speech | sourceArtificial Analysis | Categorynaturalness | FamilyArtificial Analysis Text To Speech | MetricElo | Coverage96 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
| BenchmarkMIEB English Multimodal | sourceMTEB | Categorymultimodal | FamilyMIEB English | MetricOfficial leaderboard task-type mean | Coverage84 | Coverage tierfeatured | EvidenceA | Score eligibleNo |
| BenchmarkArtificial Analysis Text To Video | sourceArtificial Analysis | Categoryoverall quality | FamilyArtificial Analysis Text To Video | MetricElo | Coverage81 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
| BenchmarkArtificial Analysis Image To Video | sourceArtificial Analysis | Categoryoverall quality | FamilyArtificial Analysis Image To Video | MetricElo | Coverage75 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
| BenchmarkLiveCodeBench | sourceLLM Stats | Categoryreasoning | FamilyLiveCodeBench | MetricScore | Coverage75 | Coverage tierfeatured | EvidenceC | Score eligibleNo |
| BenchmarkArtificial Analysis Image Editing | sourceArtificial Analysis | Categoryedit quality | FamilyArtificial Analysis Image Editing | MetricElo | Coverage73 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
| BenchmarkMATH | sourceLLM Stats | Categorymath | FamilyMATH | MetricScore | Coverage71 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
| BenchmarkMMMU-Pro | sourceLLM Stats | Categorymultimodal | FamilyMMMU-Pro | MetricScore | Coverage69 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
| BenchmarkIFEval | sourceLLM Stats | Categorychat | FamilyIFEval | MetricScore | Coverage68 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
| BenchmarkHumanEval | sourceLLM Stats | Categoryreasoning | FamilyHumanEval | MetricScore | Coverage66 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
| BenchmarkMMMU | sourceLLM Stats | Categorymultimodal | FamilyMMMU | MetricScore | Coverage64 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
| BenchmarkBrowseComp | sourceLLM Stats | Categoryreasoning | FamilyBrowseComp | MetricScore | Coverage63 | Coverage tierfeatured | EvidenceB | Score eligibleNo |
Benchmark and LM Arena values retain their original scales. Open a row to see its model results and scoring direction.
A quick view of benchmark breadth and current model coverage.