Eine neue „Quantization-Aware Healing"-Methode zeigt, dass aggressive Komprimierung von KI-Modellen nicht automatisch zu Leistungseinbußen führt. Das Verfahren erzeugt ein 4-Bit-Modell, das sein vollpräzisions-Original tatsächlich übertrifft – ein kontraintuitives und praktisch bedeutsames Ergebnis. Dies könnte die Deployment-Kosten und Energieeffizienz von großen Sprachmodellen erheblich verbessern und ihre Verfügbarkeit auf Edge-Geräten erweitern. Die Entdeckung deutet darauf hin, dass intelligente Komprimierungstechniken noch viel stärker genutzt werden könnten als bisher.