Google Deepmind stellt DiffusionGemma vor, eine Neuinterpretation des bestehenden Gemma-4-Modells als Diffusionsmodell. Statt sequenziell Token für Token zu generieren (wie klassische LLMs), erzeugt es 256 Tokens parallel und erreicht dabei etwa 1.500 Tokens pro Sekunde – ein massiver Geschwindigkeitsvorteil. Das Besondere: Der Umbau benötigte weniger als zehn Prozent des ursprünglichen Trainingsbudgets. Allerdings zeigt sich in Benchmarks ein Trade-off: Während die Geschwindigkeit beeindruckend ist, bleibt die Qualität hinter dem autoregressiven Ausgangsmodell zurück, besonders bei Reasoning-aufgaben. Das Modell demonstriert einen innovativen Forschungsansatz zur Parallelisierung von Text-Generierung.