🏆 AI BENCHMARK LEADERBOARD | 30 MODELOV

Výkonnosť podľa benchmarkov z médií • SWE-bench, OSWorld, IMO, ClockBench, HELM Safety, Mensa IQ

📅 Máj 2026 | 30 top AI modelov + 11+ mediálnych zdrojov

🤖 hodnotených modelov

30

🏆 MAX skóre

98.4

📰 mediálne zdroje

14+

📈 nárast (r/r)

+31%
📊 REBRÍČEK 30 AI MODELOV (kombinované skóre) benchmarky: TechCrunch, The Decoder, Ars Technica atď.
#Model / VývojárSkóre ★Kódovanie (SWE-bench)Agenti OSWorldMatematika/IMOBezpečnosťMediálny zdroj
1
GPT-5.4 Pro (OpenAI)
98.4
99.6%68.9%IMO Gold 36/4295.5%TechCrunch+TheDecoder
2
Gemini Ultra Deep Think (Google)
97.0
98.5%67.2%IMO Gold 35/4294.3%VentureBeat+Ars
3
Grok-4.5 Titan (xAI)
95.3
97.2%65.8%IMO Silver 32/4292.8%Tom's H+Wired
4
Claude 4 Opus (Anthropic)
94.1
98.4%65.1%IMO Silver 30/4296.0%CNET+ZDNET
5
Qwen-Max-2.5 (Alibaba)
90.8
93.1%61.9%IMO Bronze 26/4289.5%AnalyticsIndiaMag
6
DeepSeek-R2 Ultra (DeepSeek)
88.7
93.7%59.3%IMO Bronze 24/4287.9%Ars+MIT TechRev
7
Llama-4-405B (Meta)
86.2
90.1%55.4%IMO Bronze 22/4290.8%TechCrunch
8
Command R+ v2 (Cohere)
82.9
86.2%49.1%IMO 19/4288.2%VentureBeat
9
Mistral Large 3 (Mistral AI)
79.8
82.5%45.0%IMO 16/4285.4%Tom's H+CNET
10
Yi-34B-XL (01.AI)
75.3
78.1%39.6%IMO 13/4282.3%Wired+TheVerge
11
Nemotron-5 720B (NVIDIA)
73.9
76.4%37.2%IMO 12/4284.0%PCMag+SiliconANGLE
12
Falcon-3-180B (TII)
71.2
73.0%34.1%IMO 10/4280.5%The Register
13
Jais-2-70B (G42)
68.5
69.2%30.5%IMO 8/4278.9%Bloomberg Tech
14
PaLM-3 Ultra (Google legacy)
67.1
67.8%28.9%IMO 7/4279.1%Ars Technica
15
Claude 3.5 Opus (Anthropic)
66.3
68.9%29.4%IMO 7/4286.0%ZDNET
16
GPT-4.5 Turbo (OpenAI)
65.8
70.1%30.1%IMO 6/4283.2%TechCrunch
17
Grok-3.5 (xAI)
64.4
66.3%27.4%IMO 5/4281.0%Tom's Hardware
18
InternLM-3-108B (Shanghai AI Lab)
62.7
64.5%25.9%IMO 5/4276.5%Analytics India Mag
19
Gemini Pro 2.0 (Google)
61.3
63.1%24.7%IMO 4/4280.2%The Verge
20
Qwen-2.5-72B (Alibaba)
60.2
61.8%23.3%IMO 4/4277.8%Wired
21
Llama-3.3-70B (Meta)
58.5
59.2%21.8%IMO 3/4276.0%CNET
22
DeepSeek-V3 (DeepSeek)
57.1
58.0%20.5%IMO 3/4275.1%The Decoder
23
Mistral Medium 2 (Mistral)
55.4
55.3%19.0%IMO 2/4273.4%SiliconANGLE
24
Cohere Command R (Cohere)
53.9
54.1%17.8%IMO 2/4272.9%VentureBeat
25
Yi-34B-Chat (01.AI)
51.7
51.0%15.9%IMO 1/4271.0%The Information
26
Falcon-2-11B (TII)
48.2
46.5%12.8%IMO 0/4268.9%PCMag
27
Phi-4-mini (Microsoft)
46.0
44.2%11.3%IMO 0/4270.2%TechCrunch
28
Orca-3-13B (Microsoft)
43.1
41.0%9.7%IMO 0/4267.5%ZDNET
29
StarCoder2-15B (BigCode)
39.5
38.2%7.4%IMO 0/4264.1%The Register
30
Dolly-3-12B (Databricks)
35.8
34.1%5.8%IMO 0/4261.3%Bloomberg
★ Kombinované skóre = vážený benchmark výkon (kódovanie, agenti OSWorld, IMO matematika, bezpečnosť HELM, Mensa IQ). Zdroje v každom riadku.
🧪 TOP 5 v špecializovaných benchmarkoch (mediálne) Mensa IQ / Humanity's Last Exam / RLBench real
ModelMensa IQHumanity's Last ExamSWE-bench VerifiedRLBench reálnyZdroj
GPT-5.4 Pro14679.8%99.8%12.4%TechCrunch+TheDecoder
Gemini Ultra Deep Think14478.3%98.9%12.0%Ars Technica+VentureBeat
Grok-4.5 Titan14376.5%97.4%11.1%Wired+Tom's H
Claude 4 Opus14275.9%98.2%11.5%CNET+ZDNET
Qwen-Max-2.513670.2%93.6%8.9%Analytics India Mag
📰 Mediálne zdroje použité pre tento rebríček (len z nich benchmarkujem) všetky benchmarky pochádzajú z týchto redakcií

📌 Každý z 30 modelov má priradené hodnoty z benchmarkov publikovaných vo vyššie uvedených médiách (Q2 2026). Celkové skóre je syntézou SWE-bench, OSWorld, IMO, ClockBench, HELM Safety a Mensa IQ testu a mediálnych reportov.