llmboard.aiAI model intelligence
Home

Model Rankings

OverallOpen ModelsAgentCodingReasoningMathKnowledgeInstruction FollowingTextVision
Image GenerationImage Editing
Video GenerationImage to VideoVideo Editing
Text to SpeechSpeech to Text
Embeddings

Efficiency

Chat Token PricingImage PricingVideo PricingAudio Pricing
Chat Speed & LatencyProvider Reliability

Benchmarks

GPQAMMLU-ProAIME 2025SWE-Bench VerifiedMMLUHumanity's Last ExamLiveCodeBenchMATHHumanEvalMMMU-Pro
All Benchmarks

Tools

Model Directory

Scoring & Data

Scoring & Data
1224 models729 benchmarks

Leaderboard Center

Overall RankingCodingCore BenchmarksPrice & ValueRuntime Performance

Modalities

All ModelsImage GenerationImage EditingVideo GenerationImage-to-VideoVideo EditingText-to-SpeechSpeech-to-TextEmbeddings

Data & Methods

Scoring MethodAll Benchmarks
llmboard.aiCopyright 2026 llmboard.ai

xAI model product

Grok 4.20 Beta Reasoning

20 model family, released on March 9, 2026.

Updated Sep 8, 2026. Default version: Grok-4.20 Beta Reasoning

LLMBoard Score55.4Grok-4.20 Beta Reasoning
Coverage0%1 benchmark families
Context window2MTokens
Official input priceN/AOfficial price unavailable

On this page

  • Capability
  • Benchmarks
  • Arena
  • Pricing
  • Runtime
  • Specification
  • Versions
  • Similar models
  • About
  • FAQ

Grok 4.20 Beta Reasoning Capability Profile

This profile uses the model's current scored version. Arena ratings and prices are shown separately.

Grok-4.20 Beta Reasoning LLMBoard score breakdown

Grok 4.20 Beta Reasoning Benchmark Results

Benchmark scores for Grok-4.20 Beta Reasoning.

9 rows
Columns

Show columns

Sort by
Benchmark
Score
Rank
Participants
Percentile
Evidence
Evaluated
BenchmarkFinance Agent v2Score28.49%Rank25Participants26Percentile4.00%EvidenceBEvaluatedSep 8, 2026
BenchmarkLM Arena Document Style ControlScore1,439.71 ratingRank26Participants33Percentile21.88%EvidenceAEvaluatedJul 30, 2026
BenchmarkLM Arena DocumentScore1,413.91 ratingRank29Participants33Percentile12.50%EvidenceAEvaluatedJul 30, 2026
BenchmarkLM Arena Text Style ControlScore1,471.72 ratingRank29Participants210Percentile86.60%EvidenceAEvaluatedSep 2, 2026
BenchmarkLM Arena Vision Style ControlScore1,255.85 ratingRank30Participants107Percentile72.64%EvidenceAEvaluatedAug 27, 2026
BenchmarkLM Arena VisionScore1,263.10 ratingRank32Participants107Percentile70.75%EvidenceAEvaluatedAug 27, 2026
BenchmarkLM Arena TextScore1,450.95 ratingRank34Participants210Percentile84.21%EvidenceAEvaluatedSep 2, 2026
BenchmarkLM Arena Text FactualityScore1,455.26 ratingRank37Participants121Percentile70.00%EvidenceAEvaluatedSep 2, 2026
BenchmarkLM Arena WebdevScore1,373.66 ratingRank67Participants97Percentile31.25%EvidenceAEvaluatedSep 5, 2026

Grok 4.20 Beta Reasoning Arena Results

Preference and agent-evaluation results for the default version.

30 of 100 rows
Columns

Show columns

Sort by
Arena
Category
Rank
Rating / score
Votes
Observations
Result date
ArenavisionCategoryentity recognitionRank08Rating / score1,279.81Votes145ObservationsN/AResult dateAug 27, 2026
Arenavision style controlCategoryentity recognitionRank08Rating / score1,244.24Votes145ObservationsN/AResult dateAug 27, 2026
Arenatext factualityCategoryfrenchRank13Rating / score1,497.83Votes1,650ObservationsN/AResult dateSep 2, 2026
Arenatext style controlCategoryfrenchRank15Rating / score1,503.10Votes2,116ObservationsN/AResult dateSep 2, 2026
Arenavision style controlCategorycreative writing visionRank15Rating / score1,265.87Votes1,584ObservationsN/AResult dateAug 27, 2026
Arenatext factualityCategoryjapaneseRank17Rating / score1,421.83Votes464ObservationsN/AResult dateSep 2, 2026
Arenatext factualityCategorykoreanRank17Rating / score1,412.76Votes625ObservationsN/AResult dateSep 2, 2026
ArenavisionCategorycreative writing visionRank17Rating / score1,277.81Votes1,584ObservationsN/AResult dateAug 27, 2026
ArenavisionCategoryhumorRank19Rating / score1,279.55Votes921ObservationsN/AResult dateAug 27, 2026
Arenavision style controlCategoryhumorRank20Rating / score1,263.48Votes921ObservationsN/AResult dateAug 27, 2026
Arenatext factualityCategoryrussianRank22Rating / score1,471.28Votes5,216ObservationsN/AResult dateSep 2, 2026
Arenatext style controlCategoryrussianRank22Rating / score1,481.41Votes6,664ObservationsN/AResult dateSep 2, 2026
Arenatext factualityCategorygermanRank23Rating / score1,412.55Votes567ObservationsN/AResult dateSep 2, 2026
Arenatext factualityCategoryindustry medicine and healthcareRank23Rating / score1,488.65Votes3,588ObservationsN/AResult dateSep 2, 2026
Arenatext style controlCategorykoreanRank23Rating / score1,433.66Votes1,029ObservationsN/AResult dateSep 2, 2026
ArenatextCategoryfrenchRank24Rating / score1,476.47Votes2,116ObservationsN/AResult dateSep 2, 2026
Arenatext style controlCategoryindustry entertainment and sports and mediaRank24Rating / score1,448.14Votes13,583ObservationsN/AResult dateSep 2, 2026
Arenatext style controlCategoryindustry medicine and healthcareRank25Rating / score1,487.21Votes4,562ObservationsN/AResult dateSep 2, 2026
Arenadocument style controlCategoryoverallRank26Rating / score1,439.71Votes18,666ObservationsN/AResult dateJul 30, 2026
Arenatext factualityCategorypolishRank26Rating / score1,425.50Votes823ObservationsN/AResult dateSep 2, 2026
Arenatext style controlCategorypolishRank26Rating / score1,472.14Votes1,224ObservationsN/AResult dateSep 2, 2026
ArenatextCategoryrussianRank27Rating / score1,460.30Votes6,664ObservationsN/AResult dateSep 2, 2026
Arenatext factualityCategorymathRank27Rating / score1,458.11Votes2,700ObservationsN/AResult dateSep 2, 2026
Arenatext style controlCategorymulti turnRank27Rating / score1,479.92Votes11,425ObservationsN/AResult dateSep 2, 2026
Arenatext style controlCategorynon englishRank27Rating / score1,461.78Votes33,588ObservationsN/AResult dateSep 2, 2026
ArenatextCategorykoreanRank28Rating / score1,416.01Votes1,029ObservationsN/AResult dateSep 2, 2026
ArenatextCategorypolishRank28Rating / score1,450.06Votes1,224ObservationsN/AResult dateSep 2, 2026
Arenatext style controlCategoryenglishRank28Rating / score1,477.70Votes28,663ObservationsN/AResult dateSep 2, 2026
Arenatext style controlCategoryspanishRank28Rating / score1,462.59Votes2,003ObservationsN/AResult dateSep 2, 2026
ArenadocumentCategoryoverallRank29Rating / score1,413.91Votes18,666ObservationsN/AResult dateJul 30, 2026

Grok 4.20 Beta Reasoning Pricing

Official vendor API pricing appears first, followed by individual provider offers.

Official API
N/A
Official provider
N/A
Lowest third-party
From $1.25 input, $2.5 output per 1M via Vercel AI Gateway
Tracked offerings
2
2 rows
Columns

Show columns

Sort by
Provider
Provider model ID
Region
Input / 1M
Output / 1M
Context
Updated
ProviderVercel AI GatewayProvider model IDspacexai/grok-4.20-reasoning-betaRegionglobalInput / 1M$1.25Output / 1M$2.5Context2MUpdatedSep 8, 2026
Provider302.AIProvider model IDgrok-4.20-beta-0309-reasoningRegionglobalInput / 1M$2Output / 1M$6Context2MUpdatedSep 8, 2026

Official prices use only the vendor's configured official Provider and positive standard USD PAYG rates. Third-party offers remain explicitly labeled.

Grok 4.20 Beta Reasoning Runtime Performance

Provider-specific output speed and catalog latency for Grok-4.20 Beta Reasoning. Runtime does not affect the capability score.

No runtime data

No provider-specific speed or latency record is linked to the default version yet.

Output Speed is generated output tokens received per second. Catalog latency is reported separately from observed provider TTFT.

Grok 4.20 Beta Reasoning Specifications

Technical details for the model's default version.

Version
Grok-4.20 Beta Reasoning
Released
Mar 9, 2026
Knowledge cutoff
Unknown
Parameters
N/A
Context window
2M
Max output
30K
Inputs
image, text
Outputs
text
Open weights
No
License
Proprietary

Grok 4.20 Beta Reasoning Versions

Available versions of this model. The score column identifies the version used in the overall ranking.

1 row
Columns

Show columns

Sort by
Version
Released
LLMBoard
Parameters
Context
Max output
Open weights
License
VersionGrok-4.20 Beta ReasoningReleasedMar 9, 2026LLMBoard55.41ParametersN/AContext2MMax output30KOpen weightsNoLicenseProprietary

Models similar to Grok 4.20 Beta Reasoning

Recommendations prioritize the same model type and family, then the closest LLMBoard score.

#87-0.20
XA

Grok 4

xAI

55.21 LLMBoard

Details
#93-2.11
XA

Grok 3

xAI

53.30 LLMBoard

Details
#97-3.09
XA

Grok 4 Fast

xAI

52.32 LLMBoard

Details
#112-7.40
XA

Grok 4.1 Thinking

xAI

48.01 LLMBoard

Details
#113-7.44
XA

Grok 3 Mini

xAI

47.97 LLMBoard

Details
#54+11.77
XA

Grok 4 Heavy

xAI

67.18 LLMBoard

Details

What is Grok 4.20 Beta Reasoning?

Key information about Grok 4.20 Beta Reasoning and its available data.

20 Beta Reasoning is a large language model from xAI that uses thinking tokens for chain-of-thought reasoning and has a 2 million token context window.

Data as of 2026-09-08.

FAQ

Common questions about Grok 4.20 Beta Reasoning.

When was Grok 4.20 Beta Reasoning released?

Grok 4.20 Beta Reasoning's default version was released on Mar 9, 2026.

How much does Grok 4.20 Beta Reasoning cost?

No official standard PAYG price is currently available for Grok 4.20 Beta Reasoning. The lowest tracked third-party offer starts at $1.25 input and $2.5 output via Vercel AI Gateway.

Who created Grok 4.20 Beta Reasoning?

Grok 4.20 Beta Reasoning was created by xAI.

What is the context window for Grok 4.20 Beta Reasoning?

The default version has a 2M token context window.

Is Grok 4.20 Beta Reasoning open weight?

No. The default version is not marked as having publicly available weights.

How many API providers offer Grok 4.20 Beta Reasoning?

2 provider offerings are linked to the default version.

Browse runtime rankings