Moonshot AI hat mit PerceptionBench einen Benchmark entwickelt, der speziell misst, wie gut multimodale KI-Modelle Bilder verstehen können – isoliert von logischen Denkprozessen. Die Ergebnisse sind ernüchternd: Selbst Frontier-Modelle wie GPT-5.6 Sol erreichen keine 60 Prozent Genauigkeit bei dieser Aufgabe. Das deutet darauf hin, dass viele vermeintliche Fehler beim logischen Reasoning tatsächlich ihre Wurzel im unzureichenden Bildverständnis haben. Dies ist ein wichtiger Befund für die weitere Entwicklung multimodaler Systeme.