Nvidia bringt seinen Inferenz-Chip Groq 3 LPX in die Vollproduktion und meldet beeindruckende Geschwindigkeitsgewinne: Bei Gemma 4 31B erreicht der Chip 3.400 Token pro Sekunde – viermal mehr als Cerebras. Allerdings relativiert sich dieser Vorsprung beim Ressourcen-Vergleich: Während Cerebras sein Ergebnis mit nur ein bis zwei Beschleunigern erreicht, benötigt Nvidia mindestens 64 Beschleuniger für diese Leistung. Die zentrale offene Frage bleibt, wie Nvidias Architektur bei großen Mixture-of-Experts-Modellen effizient skaliert und ob der Speed-Vorsprung die Hardware-Kosten rechtfertigt.