Nvidia startet Groq-Inferenzchip: Neue Rekorde beim KI-Agent-Speed

Nvidia bringt Groq-Inferenzchip in Produktion und meldet Rekordgeschwindigkeit für KI-Agenten
6/10 The Decoder (DE) 25.08.2026 Agenten & Tool-Use Frontier-Modelle Infrastruktur

Nvidia bringt seinen Inferenz-Chip Groq 3 LPX in die Vollproduktion und meldet beeindruckende Geschwindigkeitsgewinne: Bei Gemma 4 31B erreicht der Chip 3.400 Token pro Sekunde – viermal mehr als Cerebras. Allerdings relativiert sich dieser Vorsprung beim Ressourcen-Vergleich: Während Cerebras sein Ergebnis mit nur ein bis zwei Beschleunigern erreicht, benötigt Nvidia mindestens 64 Beschleuniger für diese Leistung. Die zentrale offene Frage bleibt, wie Nvidias Architektur bei großen Mixture-of-Experts-Modellen effizient skaliert und ob der Speed-Vorsprung die Hardware-Kosten rechtfertigt.

Zum Originalartikel