28 Artikel · 2026-08
Dev-Tools BreezeTTS2: Lokale Sprachsynthese in Echtzeit

BreezeTTS2 ist ein Open-Weights-Modell mit 3 Milliarden Parametern, das hochwertige Text-zu-Sprache vollständig lokal und in Echtzeit auf Consumer-Hardware ausführt.

31.08.2026 · Sam Witteveen (YT)
Agenten & Tool-Use Rime Labs: Voice Agents erreichen endlich Reife

Startup von Linguisten bringt natürliche Sprachagenten in Serie – Mayo Clinic und Dialpad nutzen die Lösung bereits.

28.08.2026 · Cole Medin (YT)
Frontier-Modelle Gemini Omni 1.1 Flash: Google macht KI-Videogenerierung günstiger und flexibler

Google verbessert sein Videomodell mit längerer Kontexterkennung und schnellerer Draft-Generierung – Videos lassen sich jetzt konsistenter und schneller erstellen.

27.08.2026 · The Decoder (DE)
Frontier-Modelle Google präsentiert Gemini 3.5 Transcribe: Spracherkennung in 85+ Sprachen mit Echtzeit-Optimierung

Googles neues Sprachmodell Gemini 3.5 Transcribe transkribiert in über 85 Sprachen, filtert Füllwörter in Echtzeit und senkt die Latenz um 70 Prozent gegenüber dem Vorgänger.

27.08.2026 · The Decoder (DE)
Frontier-Modelle Qwen3.8-Flash-Next: Chinas nächstes Frontier-Modell zeigt sich

Alibaba stellt mit Qwen3.8-Flash-Next ein offenes Multimodal-MoE-Modell vor, das die Architektur von Qwen4 ankündigt – mit nur 6B aktiven Parametern bei 125B Gesamtgröße.

26.08.2026 · Simon Willison
Frontier-Modelle Alibabas Wan3.0: Videogenerierung aus Text und Dokumenten

Alibaba präsentiert Wan3.0, das aus Text, Bildern und PDFs Videos bis 30 Sekunden Länge generiert – ein Schlag gegen OpenAI und Runway, während der Konzern Millarden in KI-Entwicklung investiert.

24.08.2026 · The Decoder (DE)
Multimodal RayNeo iO: KI-Brille ohne Kamera und Mikrofon

Der chinesische Hersteller RayNeo präsentiert eine neue AR-Brille, die KI-Notizen und Informationen ins Sichtfeld projiziert – bewusst ohne Kamera und Lautsprecher.

22.08.2026 · The Decoder (DE)
Agenten & Tool-Use DeepSeek bringt experimentelles Multimodal-Modell für intelligente Agenten

DeepSeek veröffentlicht V4-Flash-Vision-Exp, ein experimentelles Modell, das Bildverstehen mit Textfähigkeiten kombiniert und bei Agent-Benchmarks mit Claudes Opus 4.8 konkurriert.

21.08.2026 · The Decoder (DE)
Dev-Tools Adobe Firefly: KI-Tools für Musik, Sprache und Sound sind jetzt für alle da

Adobe stellt seine generativen Audio-Tools in Firefly allen Nutzern zur Verfügung und integriert zusätzlich externe Modelle wie Googles Gemini, Runway und Kling.

20.08.2026 · The Decoder (DE)
Enterprise Vom Demos zum Geschäftszweig: KI-Video erobert Hollywood

Während Sora den Hype nicht erfüllte, entsteht um Studios wie Netflix und Start-ups wie Higgsfield ein echter KI-Videoproduktions-Markt mit Milliarden-Bewertungen.

17.08.2026 · The Decoder (DE)
Benchmarks & Evals PerceptionBench: Multimodale KI-Modelle bei Bildverständnis deutlich schwächer als vermutet

Ein neuer Benchmark von Moonshot AI zeigt, dass kein Frontier-Modell 60 Prozent Genauigkeit beim reinen Bildlesen erreicht – viele vermeintliche Reasoning-Fehler entstehen bereits beim Sehen.

15.08.2026 · The Decoder (DE)
Dev-Tools Suno Studio 2.0: Musikproduktion als Chat mit der eigenen KI-Band

Suno baut seine KI-Musikplattform mit Studio 2.0 massiv aus: Chat-Interface für Instrumente, MIDI-Import und 32-Bit-Export für Bezahl-Abos – doch das widerspricht Sunos gerade angekündigten Download-Limits.

13.08.2026 · The Decoder (DE)
Enterprise Brustkrebserkennung: KI-Tools enttäuschen Radiologen in der Praxis

Eine Umfrage unter US-Radiologen zeigt: FDA-zugelassene KI-Tools zur Brustkrebserkennung erreichen in der Klinik nicht die erwarteten Verbesserungen.

12.08.2026 · The Decoder (DE)
Dev-Tools Seedance 2.5 im Praxis-Test: Das leistungsstärkste KI-Videomodell im detaillierten Check

Ein Creator hat 1000 Dollar in Seedance 2.5 investiert und testet das Video-Modell systematisch – mit konkreten Prompts und Erkenntnissen zum effizienten Umgang mit Credits.

12.08.2026 · Julian Ivanov (YT)
Infrastruktur LFM2.5-VL-3B: Schnelleres und besseres Sehen für Edge-Geräte

Ein neues 3-Milliarden-Parameter-Modell für Vision-Aufgaben bringt erweiterte Fähigkeiten auf ressourcenschwache Geräte.

12.08.2026 · HuggingFace Blog
Architektur-Innovation The Sequence Knowledge #911: Diffusions- und Multimodal-Modelle verdichten

Eine technische Analyse zu Kompression, räumlicher Optimierung und Ausrichtung von Diffusions- und Multimodal-Modellen.

11.08.2026 · The Sequence
Agenten & Tool-Use Meta stellt Muse Glimmer vor: offenes Agenten-Modell mit 30 Milliarden Parametern

Meta veröffentlicht Muse Glimmer, ein 30-Milliarden-Parameter-Modell unter Apache-2.0-Lizenz, das speziell für agentenbasierte Aufgaben, zuverlässiges Tool-Use und mehrstufiges Reasoning optimiert ist.

10.08.2026 · Simon Willison
Agenten & Tool-Use Meta stellt Muse Glimmer vor: Open-Weights-Modell für lokale Agenten-Tasks

Meta bringt mit Muse Glimmer ein 30-Milliarden-Parameter-Modell unter Apache-2.0-Lizenz zurück ins Spiel – optimiert für agentenbasierte Aufgabenvollendung, zuverlässige Tool-Nutzung und mehrstufiges Reasoning.

10.08.2026 · Simon Willison
Agenten & Tool-Use NVIDIA Magpie: Open-Source-TTS für schnelle mehrsprachige Voice-Agenten

NVIDIA stellt Magpie TTS mit offenen Gewichten bereit – ein Text-to-Speech-Modell für latenzarme, mehrsprachige Voice-Agenten mit vollständiger Deployment-Kontrolle.

10.08.2026 · HuggingFace Blog
Agenten & Tool-Use Meta startet Muse Glimmer: lokale KI mit Agenten-Fähigkeiten und Open Source

Meta bringt mit Muse Glimmer ein neues multimodales KI-Modell an den Start, das lokal läuft, agentic-Funktionen bietet und als Open Source verfügbar ist.

10.08.2026 · HuggingFace Blog