Google DeepMind arbeitet mit Singapores AI Safety Institute an einer revolutionären Methode zur Evaluierung von KI-Modellen: Doppelblinde Tests mittels Confidential Space, bei denen weder Google die Testfragen noch die Prüfer die Modellgewichte einsehen können. Das Pilotprojekt nutzt Gemini Flash Lite und adressiert ein fundamentales Vertrauensproblem der KI-Industrie – die bisherigen Benchmarks lassen sich leicht optimieren oder sogar manipulieren. Wenn dieser Ansatz zum Standard wird, könnte er die Glaubwürdigkeit von KI-Vergleichen erheblich stärken und der Branche mehr Transparenz bringen.