Wissenschaftler der Princeton University haben mit CEO-Bench einen neuen Benchmark entwickelt, der KI-Agenten eine zentrale Aufgabe stellt: Ein fiktives Software-Startup über 500 simulierte Tage erfolgreich zu leiten. Das Ergebnis ist ernüchternd: Die meisten aktuellen Sprachmodelle führen das virtuelle Unternehmen in den Bankrott, während eine einfache regelbasierte Strategie ohne KI-Einsatz die meisten KI-Systeme noch schlägt. Das zeigt, dass Sprachmodelle trotz ihrer Fähigkeiten bei komplexen, langfristigen Entscheidungsprozessen mit vielen Variablen noch deutlich unsicher sind. Der Benchmark beleuchtet eine wichtige Lücke zwischen den versprochenen Fähigkeiten von KI-Agenten und ihrer realen Leistung in wirtschaftlichen Szenarien.