BenchMIRT untersucht die Zuverlässigkeit und Aussagekraft gängiger Large-Language-Model-Benchmarks. Die Forschung stellt in Frage, ob etablierte Test-Suites wie MMLU oder HellaSwag wirklich die Fähigkeiten von KI-Modellen akkurat abbilden oder nur bestimmte, enge Aspekte messen. Das Thema ist relevant für alle, die KI-Modelle bewerten oder vergleichen möchten – vom Forscher bis zum Unternehmen, das das beste Modell für seine Aufgaben suchen muss. Ein wichtiger Beitrag zur kritischen Reflexion über KI-Bewertung.