96 Artikel
Enterprise GPT-Live-1: Natürliche Sprachgespräche jetzt in der OpenAI-API verfügbar

OpenAI integriert sein Voice-Modell GPT-Live-1 in die API: Echtzeit-Duplexgespräche, bessere Befehlsverständigung, Custom Voices und Telefonie-Support.

10.09.2026 · OpenAI Blog
Frontier-Modelle Suno stellt v6 vor: Neue KI-Musikmodelle mit Majors, alte Versionen verschwinden

Suno launcht drei neue Musikmodell-Varianten in v6, entwickelt mit Warner, BMG und Believe – doch Universal und Sony klagen weiter, während Suno über die Trainingsdaten schweigt.

09.09.2026 · The Decoder (DE)
Frontier-Modelle Woche KI-Updates: Meta Muse Spark, World Labs Atlas und Gemini 3.8 Flash

Drei bedeutende Produktreleases in einer Woche: Meta stellt Muse Spark vor, World Labs zeigt Atlas, Google bringt Gemini 3.8 Flash.

09.09.2026 · The Sequence
Multimodal ChatGPT Images 2.5: Mehr Kontrolle über generierte Bilder

OpenAI stellt ChatGPT Images 2.5 vor, ein Update für bessere Kontrolle über die Bildgenerierung aus Ideen, Skizzen und Referenzfotos.

08.09.2026 · OpenAI Blog
Frontier-Modelle Qwen-Drive-1.0: Alibabas KI-Auto erkennt die Welt, erklärt aber nicht immer warum

Alibabas neues Fahrerassistenz-KI-Modell verbindet Umwelterfassung und Fahrtplanung, doch seine Begründungen für Manöver stimmen nicht immer.

07.09.2026 · The Decoder (DE)
Frontier-Modelle Google liefert hochauflösende stündliche Wettervorhersagen mit KI statt Physik-Modellen

Google Research und DeepMind präsentieren WeatherNext 3: ein KI-Modell, das aus Satellitendaten lernt und Vorhersagen mit 5-km-Auflösung in stündlichen Intervallen liefert – fünfmal detaillierter als der Vorgänger.

06.09.2026 · The Decoder (DE)
Dev-Tools Google integriert KI-Musikgenerierung Lyria 3.5 in Gemini

Google bringt sein Musikgenerierungsmodell Lyria 3.5 direkt in die Gemini-App und API – mit verbessertem Gesang, reicheren Arrangements und Zugang über mehrere Google-Plattformen.

06.09.2026 · The Decoder (DE)
Agenten & Tool-Use Meta stellt Echtzeit-Sprachmodell für ständig zuhörende KI-Assistenten vor

Metas „Muse Voice Transcribe" transkribiert Sprache in Echtzeit mit Sprecher-Unterscheidung und könnte die Basis für Assistenten bilden, die dauerhaft über Kameras wie der Meta-Brille mithören.

06.09.2026 · The Decoder (DE)
Frontier-Modelle OpenAI präsentiert GPT-6 Astra für Entwickler

OpenAI stellt das neue Flaggschiff-Modell GPT-6 Astra vor, das mit verbessertem Prompt-Verständnis und besonders starken Fähigkeiten beim Generieren von 3D-Modellen punktet.

05.09.2026 · Simon Willison
Architektur-Innovation NeoMME: Ein effizienter multimodal-nativer mehrsprachiger Encoder

Ein neues Modell kombiniert Multimodal-Verarbeitung mit nativer Mehrsprachigkeit und optimierter Effizienz für globale Anwendungen.

03.09.2026 · HuggingFace Blog
Dev-Tools Legora sichtet 41 Dokumente in Minuten mit GPT-6 Astra

Ein Finanz-Audit-Workflow zeigt, wie GPT-6 Astra in Minutenschnelle Dokumentenprüfungen bewältigt und dabei versteckte Fehler zuverlässig erkennt.

03.09.2026 · OpenAI Blog
Frontier-Modelle World Labs stellt Atlas vor: Weltmodell für 3D-Szenen aus wenigen Bildern

World Labs hat mit Atlas ein Weltmodell präsentiert, das aus wenigen Bildern dreidimensionale Szenen rekonstruieren und generieren kann – ein Schritt weg von spezialisierten 3D-Modellen.

02.09.2026 · The Decoder (DE)
Dev-Tools BreezeTTS2: Lokale Sprachsynthese in Echtzeit

BreezeTTS2 ist ein Open-Weights-Modell mit 3 Milliarden Parametern, das hochwertige Text-zu-Sprache vollständig lokal und in Echtzeit auf Consumer-Hardware ausführt.

31.08.2026 · Sam Witteveen (YT)
Agenten & Tool-Use Rime Labs: Voice Agents erreichen endlich Reife

Startup von Linguisten bringt natürliche Sprachagenten in Serie – Mayo Clinic und Dialpad nutzen die Lösung bereits.

28.08.2026 · Cole Medin (YT)
Frontier-Modelle Gemini Omni 1.1 Flash: Google macht KI-Videogenerierung günstiger und flexibler

Google verbessert sein Videomodell mit längerer Kontexterkennung und schnellerer Draft-Generierung – Videos lassen sich jetzt konsistenter und schneller erstellen.

27.08.2026 · The Decoder (DE)
Frontier-Modelle Google präsentiert Gemini 3.5 Transcribe: Spracherkennung in 85+ Sprachen mit Echtzeit-Optimierung

Googles neues Sprachmodell Gemini 3.5 Transcribe transkribiert in über 85 Sprachen, filtert Füllwörter in Echtzeit und senkt die Latenz um 70 Prozent gegenüber dem Vorgänger.

27.08.2026 · The Decoder (DE)
Frontier-Modelle Qwen3.8-Flash-Next: Chinas nächstes Frontier-Modell zeigt sich

Alibaba stellt mit Qwen3.8-Flash-Next ein offenes Multimodal-MoE-Modell vor, das die Architektur von Qwen4 ankündigt – mit nur 6B aktiven Parametern bei 125B Gesamtgröße.

26.08.2026 · Simon Willison
Frontier-Modelle Alibabas Wan3.0: Videogenerierung aus Text und Dokumenten

Alibaba präsentiert Wan3.0, das aus Text, Bildern und PDFs Videos bis 30 Sekunden Länge generiert – ein Schlag gegen OpenAI und Runway, während der Konzern Millarden in KI-Entwicklung investiert.

24.08.2026 · The Decoder (DE)
Multimodal RayNeo iO: KI-Brille ohne Kamera und Mikrofon

Der chinesische Hersteller RayNeo präsentiert eine neue AR-Brille, die KI-Notizen und Informationen ins Sichtfeld projiziert – bewusst ohne Kamera und Lautsprecher.

22.08.2026 · The Decoder (DE)
Agenten & Tool-Use DeepSeek bringt experimentelles Multimodal-Modell für intelligente Agenten

DeepSeek veröffentlicht V4-Flash-Vision-Exp, ein experimentelles Modell, das Bildverstehen mit Textfähigkeiten kombiniert und bei Agent-Benchmarks mit Claudes Opus 4.8 konkurriert.

21.08.2026 · The Decoder (DE)