Das britische AI Security Institute hat in einer Studie über sieben Benchmarks enthüllt, dass Standard-Evaluierungen die Fähigkeiten von Agenten-Modellen systematisch unterschätzen, weil sie das Rechenbudget künstlich begrenzen. Bei Software-Engineering-Aufgaben stieg die Erfolgsrate um bis zu 25 Prozent, wenn das Token-Budget verzehnfacht wurde – neuere Modelle profitieren überproportional von dieser zusätzlichen Rechenzeit. Dies bedeutet: Der wahre technische Fortschritt an der KI-Frontier ist etwa 60 Prozent steiler als die bisherigen Messungen suggerierten. Die Erkenntnis hat Implikationen für die Bewertung von KI-Sicherheitsrisiken und das echte Leistungspotenzial von Agenten-Systemen.