PerceptionBench: Multimodale KI-Modelle bei Bildverständnis deutlich schwächer als vermutet

Neuer Benchmark bestätigt: KI-Modelle sehen weiterhin schlecht
6/10 The Decoder (DE) 15.08.2026 Benchmarks & Evals Frontier-Modelle Multimodal Research

Moonshot AI hat mit PerceptionBench einen Benchmark entwickelt, der speziell misst, wie gut multimodale KI-Modelle Bilder verstehen können – isoliert von logischen Denkprozessen. Die Ergebnisse sind ernüchternd: Selbst Frontier-Modelle wie GPT-5.6 Sol erreichen keine 60 Prozent Genauigkeit bei dieser Aufgabe. Das deutet darauf hin, dass viele vermeintliche Fehler beim logischen Reasoning tatsächlich ihre Wurzel im unzureichenden Bildverständnis haben. Dies ist ein wichtiger Befund für die weitere Entwicklung multimodaler Systeme.

Zum Originalartikel