Greedy Decoding ist die einfachste Erzeugungs-Strategie: in jedem Schritt immer das wahrscheinlichste nächste Token nehmen.
Nach jeder Vorhersage wählt das Modell stets das Token mit der höchsten Wahrscheinlichkeit und fährt fort. Keine Zufallskomponente, keine Alternativen — dieselbe Eingabe liefert stets dieselbe Ausgabe.
Das ist schnell und reproduzierbar, gut für Aufgaben mit einer klar richtigen Antwort. Aber es kann in eintönigen oder sich wiederholenden Formulierungen enden, weil es nie einen kreativeren, lokal unwahrscheinlicheren Weg einschlägt.
Greedy ist der Spezialfall des Sampling bei Temperatur 0. Gründlicher, aber teurer ist die Beam Search, die mehrere Wege zugleich prüft.