Das Gespräch mit Anastasios Angelopoulos von Berkeleys Chatbot Arena behandelt ein zentrales Problem der KI-Bewertung: Wie lassen sich Modelle fair und aussagekräftig vergleichen? Neben Preference Rankings und Cost-per-Task-Analysen geht es um die tiefere Frage, wie man tatsächliche Utility in realen Anwendungen misst. Das ist nicht nur für Forscher relevant, sondern auch für Unternehmen bei der Modell-Auswahl und für die Glaubwürdigkeit von KI-Leaderboards insgesamt. Die Arena-Ansätze wirken sich unmittelbar auf die Wahrnehmung aus, welche Modelle führend sind.