Zweifel an SWE-Bench Pro: OpenAI attackiert populäres Coding-Benchmark

Separating signal from noise in coding evaluations
7/10 OpenAI Blog 08.07.2026 Benchmarks & Evals Coding-Modelle Research

OpenAI hat eine kritische Analyse des weit verbreiteten SWE-Bench-Pro-Benchmarks veröffentlicht, die systematische Probleme bei der Bewertung von KI-Coding-Modellen offenlegt. Das Benchmark wird von der Industrie standardmäßig zur Evaluierung von Code-Generatoren verwendet – seine Zuverlässigkeit zu hinterfragen hat daher erhebliche Auswirkungen auf die Glaubwürdigkeit bisheriger Modell-Vergleiche. Der Fund wirft grundsätzliche Fragen auf, wie akkurat wir derzeit Fortschritte bei KI-Systemen messen können, und könnte zu strengeren Evaluierungs-Standards führen.

Zum Originalartikel