llmboard.aiAI model intelligence
Home

Model Rankings

OverallOpen ModelsAgentCodingReasoningMathKnowledgeInstruction FollowingTextVision
Image GenerationImage Editing
Video GenerationImage to VideoVideo Editing
Text to SpeechSpeech to Text
Embeddings

Efficiency

Chat Token PricingImage PricingVideo PricingAudio Pricing
Chat Speed & LatencyProvider Reliability

Benchmarks

GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-Pro
All Benchmarks

Tools

Model Directory

Scoring & Data

Scoring & Data
1224 models729 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll Benchmarks
llmboard.aiCopyright 2026 llmboard.ai

Evaluation directory

AI Benchmarks

Browse benchmark definitions, capability categories, and model rankings.

Data as of 2026-09-08

Benchmarks729
Categories42
Score eligible0
With model coverage729

All benchmarks

Open any benchmark to inspect its leaderboard, scoring direction, evidence fields, and programmatic FAQ.

30 of 729 rows
Columns

Show columns

Sort by
Benchmark
source
Category
Family
Metric
Coverage
Coverage tier
Evidence
Score eligible
BenchmarkMTEB English v2 ClassificationsourceMTEBCategoryclassificationFamilyMTEB English v2MetricOfficial leaderboard task-type meanCoverage257Coverage tierfeaturedEvidenceAScore eligibleNo
BenchmarkGPQAsourceLLM StatsCategoryphysicsFamilyGPQAMetricScoreCoverage247Coverage tierfeaturedEvidenceCScore eligibleNo
BenchmarkMTEB English v2 RerankingsourceMTEBCategoryrerankingFamilyMTEB English v2MetricOfficial leaderboard task-type meanCoverage241Coverage tierfeaturedEvidenceAScore eligibleNo
BenchmarkMTEB English v2 ClusteringsourceMTEBCategoryclusteringFamilyMTEB English v2MetricOfficial leaderboard task-type meanCoverage217Coverage tierfeaturedEvidenceAScore eligibleNo
BenchmarkMTEB English v2 RetrievalsourceMTEBCategoryretrievalFamilyMTEB English v2MetricOfficial leaderboard task-type meanCoverage212Coverage tierfeaturedEvidenceAScore eligibleNo
BenchmarkMTEB English v2 Semantic SimilaritysourceMTEBCategorysemantic similarityFamilyMTEB English v2MetricOfficial leaderboard task-type meanCoverage211Coverage tierfeaturedEvidenceAScore eligibleNo
BenchmarkLM Arena TextsourceLM ArenaCategoryUnspecifiedFamilylm-arena-textMetricArena RatingCoverage210Coverage tierfeaturedEvidenceAScore eligibleNo
BenchmarkLM Arena Text Style ControlsourceLM ArenaCategoryUnspecifiedFamilylm-arena-text-style-controlMetricArena RatingCoverage210Coverage tierfeaturedEvidenceAScore eligibleNo
BenchmarkArtificial Analysis Text To ImagesourceArtificial AnalysisCategoryoverall qualityFamilyArtificial Analysis Text To ImageMetricEloCoverage156Coverage tierfeaturedEvidenceBScore eligibleNo
BenchmarkMMLU-ProsourceLLM StatsCategorylanguageFamilyMMLU-ProMetricScoreCoverage138Coverage tierfeaturedEvidenceBScore eligibleNo
BenchmarkLM Arena Text FactualitysourceLM ArenaCategoryUnspecifiedFamilylm-arena-text-factualityMetricArena RatingCoverage121Coverage tierfeaturedEvidenceAScore eligibleNo
BenchmarkAIME 2025sourceLLM StatsCategorymathFamilyAIME 2025MetricScoreCoverage119Coverage tierfeaturedEvidenceCScore eligibleNo
BenchmarkSWE-Bench VerifiedsourceLLM StatsCategoryreasoningFamilySWE-Bench VerifiedMetricScoreCoverage113Coverage tierfeaturedEvidenceCScore eligibleNo
BenchmarkLM Arena VisionsourceLM ArenaCategoryUnspecifiedFamilylm-arena-visionMetricArena RatingCoverage107Coverage tierfeaturedEvidenceAScore eligibleNo
BenchmarkLM Arena Vision Style ControlsourceLM ArenaCategoryUnspecifiedFamilylm-arena-vision-style-controlMetricArena RatingCoverage107Coverage tierfeaturedEvidenceAScore eligibleNo
BenchmarkHumanity's Last ExamsourceLLM StatsCategorymathFamilyHumanity's Last ExamMetricScoreCoverage103Coverage tierfeaturedEvidenceBScore eligibleNo
BenchmarkMMLUsourceLLM StatsCategorylanguageFamilyMMLUMetricScoreCoverage101Coverage tierfeaturedEvidenceBScore eligibleNo
BenchmarkLM Arena WebdevsourceLM ArenaCategoryUnspecifiedFamilylm-arena-webdevMetricArena RatingCoverage97Coverage tierfeaturedEvidenceAScore eligibleNo
BenchmarkArtificial Analysis Text To SpeechsourceArtificial AnalysisCategorynaturalnessFamilyArtificial Analysis Text To SpeechMetricEloCoverage96Coverage tierfeaturedEvidenceBScore eligibleNo
BenchmarkMIEB English MultimodalsourceMTEBCategorymultimodalFamilyMIEB EnglishMetricOfficial leaderboard task-type meanCoverage84Coverage tierfeaturedEvidenceAScore eligibleNo
BenchmarkArtificial Analysis Text To VideosourceArtificial AnalysisCategoryoverall qualityFamilyArtificial Analysis Text To VideoMetricEloCoverage81Coverage tierfeaturedEvidenceBScore eligibleNo
BenchmarkArtificial Analysis Image To VideosourceArtificial AnalysisCategoryoverall qualityFamilyArtificial Analysis Image To VideoMetricEloCoverage75Coverage tierfeaturedEvidenceBScore eligibleNo
BenchmarkLiveCodeBenchsourceLLM StatsCategoryreasoningFamilyLiveCodeBenchMetricScoreCoverage75Coverage tierfeaturedEvidenceCScore eligibleNo
BenchmarkArtificial Analysis Image EditingsourceArtificial AnalysisCategoryedit qualityFamilyArtificial Analysis Image EditingMetricEloCoverage73Coverage tierfeaturedEvidenceBScore eligibleNo
BenchmarkMATHsourceLLM StatsCategorymathFamilyMATHMetricScoreCoverage71Coverage tierfeaturedEvidenceBScore eligibleNo
BenchmarkMMMU-ProsourceLLM StatsCategorymultimodalFamilyMMMU-ProMetricScoreCoverage69Coverage tierfeaturedEvidenceBScore eligibleNo
BenchmarkIFEvalsourceLLM StatsCategorychatFamilyIFEvalMetricScoreCoverage68Coverage tierfeaturedEvidenceBScore eligibleNo
BenchmarkHumanEvalsourceLLM StatsCategoryreasoningFamilyHumanEvalMetricScoreCoverage66Coverage tierfeaturedEvidenceBScore eligibleNo
BenchmarkMMMUsourceLLM StatsCategorymultimodalFamilyMMMUMetricScoreCoverage64Coverage tierfeaturedEvidenceBScore eligibleNo
BenchmarkBrowseCompsourceLLM StatsCategoryreasoningFamilyBrowseCompMetricScoreCoverage63Coverage tierfeaturedEvidenceBScore eligibleNo

Benchmark and LM Arena values retain their original scales. Open a row to see its model results and scoring direction.

Benchmark highlights

A quick view of benchmark breadth and current model coverage.

Largest categoryreasoning168 benchmarks
Scoring inputs0Eligible benchmark definitions
Total benchmarks729Benchmark and LM Arena values retain their original scales. Open a row to see its model results and scoring direction.
Highest model coverageMTEB English v2 Classification257 models