Ein Benchmark-Test offenbart eine Schwachstelle von DeepSeeks Frontier-Modell: Das System versagt bei der Lösung von Rubik's-Würfel-Rätseln, einem gängigen Test für räumliches Reasoning und logisches Denken. Dies deutet auf Lücken bei komplexen räumlichen Abstraktionen hin, die selbst modernere KI-Systeme noch nicht zuverlässig bewältigen. Der Test liefert Einblicke in die tatsächlichen Grenzen von Large Language Models jenseits von Sprachaufgaben.