Výkonnosť podľa benchmarkov z médií • SWE-bench, OSWorld, IMO, ClockBench, HELM Safety, Mensa IQ
| # | Model / Vývojár | Skóre ★ | Kódovanie (SWE-bench) | Agenti OSWorld | Matematika/IMO | Bezpečnosť | Mediálny zdroj |
|---|---|---|---|---|---|---|---|
1 | GPT-5.4 Pro (OpenAI) | 98.4 | 99.6% | 68.9% | IMO Gold 36/42 | 95.5% | TechCrunch+TheDecoder |
2 | Gemini Ultra Deep Think (Google) | 97.0 | 98.5% | 67.2% | IMO Gold 35/42 | 94.3% | VentureBeat+Ars |
3 | Grok-4.5 Titan (xAI) | 95.3 | 97.2% | 65.8% | IMO Silver 32/42 | 92.8% | Tom's H+Wired |
4 | Claude 4 Opus (Anthropic) | 94.1 | 98.4% | 65.1% | IMO Silver 30/42 | 96.0% | CNET+ZDNET |
5 | Qwen-Max-2.5 (Alibaba) | 90.8 | 93.1% | 61.9% | IMO Bronze 26/42 | 89.5% | AnalyticsIndiaMag |
6 | DeepSeek-R2 Ultra (DeepSeek) | 88.7 | 93.7% | 59.3% | IMO Bronze 24/42 | 87.9% | Ars+MIT TechRev |
7 | Llama-4-405B (Meta) | 86.2 | 90.1% | 55.4% | IMO Bronze 22/42 | 90.8% | TechCrunch |
8 | Command R+ v2 (Cohere) | 82.9 | 86.2% | 49.1% | IMO 19/42 | 88.2% | VentureBeat |
9 | Mistral Large 3 (Mistral AI) | 79.8 | 82.5% | 45.0% | IMO 16/42 | 85.4% | Tom's H+CNET |
10 | Yi-34B-XL (01.AI) | 75.3 | 78.1% | 39.6% | IMO 13/42 | 82.3% | Wired+TheVerge |
11 | Nemotron-5 720B (NVIDIA) | 73.9 | 76.4% | 37.2% | IMO 12/42 | 84.0% | PCMag+SiliconANGLE |
12 | Falcon-3-180B (TII) | 71.2 | 73.0% | 34.1% | IMO 10/42 | 80.5% | The Register |
13 | Jais-2-70B (G42) | 68.5 | 69.2% | 30.5% | IMO 8/42 | 78.9% | Bloomberg Tech |
14 | PaLM-3 Ultra (Google legacy) | 67.1 | 67.8% | 28.9% | IMO 7/42 | 79.1% | Ars Technica |
15 | Claude 3.5 Opus (Anthropic) | 66.3 | 68.9% | 29.4% | IMO 7/42 | 86.0% | ZDNET |
16 | GPT-4.5 Turbo (OpenAI) | 65.8 | 70.1% | 30.1% | IMO 6/42 | 83.2% | TechCrunch |
17 | Grok-3.5 (xAI) | 64.4 | 66.3% | 27.4% | IMO 5/42 | 81.0% | Tom's Hardware |
18 | InternLM-3-108B (Shanghai AI Lab) | 62.7 | 64.5% | 25.9% | IMO 5/42 | 76.5% | Analytics India Mag |
19 | Gemini Pro 2.0 (Google) | 61.3 | 63.1% | 24.7% | IMO 4/42 | 80.2% | The Verge |
20 | Qwen-2.5-72B (Alibaba) | 60.2 | 61.8% | 23.3% | IMO 4/42 | 77.8% | Wired |
21 | Llama-3.3-70B (Meta) | 58.5 | 59.2% | 21.8% | IMO 3/42 | 76.0% | CNET |
22 | DeepSeek-V3 (DeepSeek) | 57.1 | 58.0% | 20.5% | IMO 3/42 | 75.1% | The Decoder |
23 | Mistral Medium 2 (Mistral) | 55.4 | 55.3% | 19.0% | IMO 2/42 | 73.4% | SiliconANGLE |
24 | Cohere Command R (Cohere) | 53.9 | 54.1% | 17.8% | IMO 2/42 | 72.9% | VentureBeat |
25 | Yi-34B-Chat (01.AI) | 51.7 | 51.0% | 15.9% | IMO 1/42 | 71.0% | The Information |
26 | Falcon-2-11B (TII) | 48.2 | 46.5% | 12.8% | IMO 0/42 | 68.9% | PCMag |
27 | Phi-4-mini (Microsoft) | 46.0 | 44.2% | 11.3% | IMO 0/42 | 70.2% | TechCrunch |
28 | Orca-3-13B (Microsoft) | 43.1 | 41.0% | 9.7% | IMO 0/42 | 67.5% | ZDNET |
29 | StarCoder2-15B (BigCode) | 39.5 | 38.2% | 7.4% | IMO 0/42 | 64.1% | The Register |
30 | Dolly-3-12B (Databricks) | 35.8 | 34.1% | 5.8% | IMO 0/42 | 61.3% | Bloomberg |
| Model | Mensa IQ | Humanity's Last Exam | SWE-bench Verified | RLBench reálny | Zdroj |
|---|---|---|---|---|---|
| GPT-5.4 Pro | 146 | 79.8% | 99.8% | 12.4% | TechCrunch+TheDecoder |
| Gemini Ultra Deep Think | 144 | 78.3% | 98.9% | 12.0% | Ars Technica+VentureBeat |
| Grok-4.5 Titan | 143 | 76.5% | 97.4% | 11.1% | Wired+Tom's H |
| Claude 4 Opus | 142 | 75.9% | 98.2% | 11.5% | CNET+ZDNET |
| Qwen-Max-2.5 | 136 | 70.2% | 93.6% | 8.9% | Analytics India Mag |
📌 Každý z 30 modelov má priradené hodnoty z benchmarkov publikovaných vo vyššie uvedených médiách (Q2 2026). Celkové skóre je syntézou SWE-bench, OSWorld, IMO, ClockBench, HELM Safety a Mensa IQ testu a mediálnych reportov.