Arena benchmark
LM Arena Agent Tool Hallucination model ratings and results.
Updated Aug 17, 2026. Data as of 2026-08-17
Models are ordered by their Arena rank.
Rank | Model | Organization | Rating / score | Votes | Observations | Result date |
|---|
| Rank01 | ModelOP | Organizationopenai | Rating / score0.0 | VotesN/A | Observations693.8K | Result date |
| Rank02 | ModelMA | Organizationmoonshot | Rating / score0.0 | VotesN/A | Observations2.3M | Result date |
| Rank03 | ModelOP | Organizationopenai | Rating / score0.0 | VotesN/A | Observations1.5M | Result date |
| Rank04 | ModelOP | Organizationopenai | Rating / score0.0 | VotesN/A | Observations2.9M | Result date |
| Rank05 | ModelXA | Organizationxai | Rating / score0.0 | VotesN/A | Observations1.3M | Result date |
| Rank06 | ModelZA | Organizationzai | Rating / score0.0 | VotesN/A | Observations2.2M | Result date |
| Rank07 | ModelOP | Organizationopenai | Rating / score0.0 | VotesN/A | Observations1.5M | Result date |
| Rank09 | ModelOP | Organizationopenai | Rating / score0.0 | VotesN/A | Observations496.9K | Result date |
| Rank10 | ModelMA | Organizationmoonshot | Rating / score0.0 | VotesN/A | Observations297.2K | Result date |
| Rank11 | ModelMA | Organizationmoonshot | Rating / score0.0 | VotesN/A | Observations375.3K | Result date |
| Rank12 | ModelAN | Organizationanthropic | Rating / score0.0 | VotesN/A | Observations853.8K | Result date |
| Rank13 | ModelAN | Organizationanthropic | Rating / score0.0 | VotesN/A | Observations1.2M | Result date |
| Rank14 | ModelDE | Organizationdeepseek | Rating / score0.0 | VotesN/A | Observations3M | Result date |
| Rank16 | ModelME | Organizationmeta | Rating / score0.0 | VotesN/A | Observations2.3M | Result date |
| Rank18 | ModelAN | Organizationanthropic | Rating / score0.0 | VotesN/A | Observations1.7M | Result date |
| Rank20 | ModelAN | Organizationanthropic | Rating / score0.0 | VotesN/A | Observations1.3M | Result date |
| Rank21 | ModelXA | Organizationxai | Rating / score0.0 | VotesN/A | Observations1.1M | Result date |
| Rank24 | ModelAN | Organizationanthropic | Rating / score0.0 | VotesN/A | Observations1.2M | Result date |
| Rank26 | ModelAN | Organizationanthropic | Rating / score0.0 | VotesN/A | Observations2.3M | Result date |
| Rank27 | ModelMI | Organizationminimax | Rating / score0.0 | VotesN/A | Observations608.1K | Result date |
| Rank28 | ModelXA | Organizationxai | Rating / score0.0 | VotesN/A | Observations5.2M | Result date |
| Rank29 | ModelGO | Organizationgoogle | Rating / score0.0 | VotesN/A | Observations2.2M | Result date |
| Rank30 | ModelMI | Organizationminimax | Rating / score0.0 | VotesN/A | Observations1.9M | Result date |
| Rank31 | ModelAC | Organizationalibaba | Rating / score0.0 | VotesN/A | Observations1.2M | Result date |
| Rank32 | ModelTHInklingThinkingmachines | Organizationthinky | Rating / score0.0 | VotesN/A | Observations1.2M | Result date |
| Rank33 | ModelNV | Organizationnvidia | Rating / score0.0 | VotesN/A | Observations142.5K | Result date |
| Rank34 | ModelUP | Organizationupstage | Rating / score0.0 | VotesN/A | Observations151K | Result date |
| Rank35 | ModelGO | Organizationgoogle | Rating / score0.0 | VotesN/A | Observations460.9K | Result date |
| Rank36 | ModelDE | Organizationdeepseek | Rating / score0.0 | VotesN/A | Observations1.3M | Result date |
| Rank38 | ModelAC | Organizationalibaba | Rating / score0.0 | VotesN/A | Observations645.6K | Result date |
| Rank39 | ModelAC | Organizationalibaba | Rating / score0.0 | VotesN/A | Observations533.2K | Result date |
| Rank40 | ModelXI | Organizationxiaomi | Rating / score0.0 | VotesN/A | Observations1.2M | Result date |
| Rank41 | ModelGO | Organizationgoogle | Rating / score-0.0 | VotesN/A | Observations481.3K | Result date |
| Rank42 | ModelZA | Organizationzai | Rating / score-0.0 | VotesN/A | Observations3M | Result date |
| Rank43 | ModelGO | Organizationgoogle | Rating / score-0.0 | VotesN/A | Observations1.6M | Result date |
| Rank45 | ModelTE | Organizationtencent | Rating / score-0.0 | VotesN/A | Observations583.7K | Result date |
| Rank46 | ModelDE | Organizationdeepseek | Rating / score-0.0 | VotesN/A | Observations1.1M | Result date |
| Rank47 | ModelMA | Organizationmistral | Rating / score-0.0 | VotesN/A | Observations153.8K | Result date |
| Rank48 | ModelAN | Organizationanthropic | Rating / score-0.3 | VotesN/A | Observations1.3M | Result date |
| Rank49 | ModelGO | Organizationgoogle | Rating / score-0.3 | VotesN/A | Observations592.7K | Result date |
A closer view of the leading model ratings.
The first five models in this source ranking, with price and output speed included when a canonical model match is available.
Ranking basisThis agent tool hallucination AI model leaderboard uses the source agent score and Arena rank. The leaderboard ranking keeps matched price and speed data separate from benchmark evidence.
Selection summary
GPT-5.6 Terra currently leads Agent Tool Hallucination at 0.01. The best AI model for this use case may change when price, speed and independent benchmark capability are considered.
Use this leaderboard with the supporting benchmark results and coverage details above. A leaderboard position summarizes the selected ranking signal; it does not replace workload-specific testing.
What Agent Tool Hallucination measures and how to read its results.
Agent Tool Hallucination reports agent score values and currently defines 1 evaluation category.
Arena results are preference or task-outcome signals. They are not automatically equivalent to capability benchmark scores.
Common questions about Agent Tool Hallucination.
GPT-5.6 Terra is currently ranked first.
This Arena reports agent score values across 1 configured evaluation category.
No. Arena results remain a separate preference or task-outcome signal.
40 model results are currently shown.