AMD hat das kanadische Startup Taalas akquiriert, das eine innovative Technologie entwickelt hat: Statt KI-Modelle in Software zu laden, werden die Modellgewichte direkt in spezialisierte Inferenz-Chips „gebrannt". Ein Demo-Chip erreichte damit beeindruckende 16.000 Tokens pro Sekunde pro Nutzer beim Llama 3.1-8B Modell – deutlich schneller als Software-basierte Lösungen. Der Trade-off ist erheblich: jeder Chip funktioniert nur mit einem einzigen Modell. Google arbeitet Berichten zufolge an einem ähnlichen Ansatz für sein Gemini-Modell. Dies zeigt, wie Hardware-Hersteller zunehmend spezialisierte KI-Chips entwickeln und dabei den laufenden Rüstungswettbewerb um Inferenz-Geschwindigkeit intensivieren.