OpenAI hat eine kritische Analyse des weit verbreiteten SWE-Bench-Pro-Benchmarks veröffentlicht, die systematische Probleme bei der Bewertung von KI-Coding-Modellen offenlegt. Das Benchmark wird von der Industrie standardmäßig zur Evaluierung von Code-Generatoren verwendet – seine Zuverlässigkeit zu hinterfragen hat daher erhebliche Auswirkungen auf die Glaubwürdigkeit bisheriger Modell-Vergleiche. Der Fund wirft grundsätzliche Fragen auf, wie akkurat wir derzeit Fortschritte bei KI-Systemen messen können, und könnte zu strengeren Evaluierungs-Standards führen.