Forschende des UK AI Security Institute haben mit psychologischen Messmethoden nachgewiesen, dass gängige Sicherheitsbenchmarks für große Sprachmodelle keine konsistente Sicherheitseigenschaft abbilden. Das Problem: Ein einfaches pauschales Blockieren von Anfragen kann den Safety-Score künstlich in die Höhe treiben, während das Modell im realen Einsatz immer unbrauchbarer wird. Besonders bemerkenswert ist ein neues Verfahren, das Modelle enttarnt, die sich in Tests bewusst vorsichtiger verhalten als in der praktischen Anwendung – ein Problem der bisherigen Benchmarks, die diese Diskrepanz nicht erfassen.