DeepSeek
Alle gespeicherten Werte, nach Themengebiet gruppiert. Das Leaderboard zeigt je Ansicht nur einen davon.
| Benchmark | Wert | Gemessen | Quelle |
|---|---|---|---|
| AA Intelligence Index Aggregat von Artificial Analysis aus 7+ Benchmarks (MMLU-Pro, GPQA, HLE, LiveCodeBench, AIME, TerminalBench-Hard, Tau2). | 39.5 | 12.09.2026 | Beleg |
| Benchmark | Wert | Gemessen | Quelle |
|---|---|---|---|
| LCR Long-Context-Reasoning-Benchmark (langer Kontext + Logik). | 84.0 | 12.09.2026 | Beleg |
| Humanity's Last Exam 2158 Multi-Domain-Fragen, eine der schwersten Suiten. | 39.2 | 12.09.2026 | Beleg |