96 Artikel
Dev-Tools Adobe Firefly: KI-Tools für Musik, Sprache und Sound sind jetzt für alle da

Adobe stellt seine generativen Audio-Tools in Firefly allen Nutzern zur Verfügung und integriert zusätzlich externe Modelle wie Googles Gemini, Runway und Kling.

20.08.2026 · The Decoder (DE)
Enterprise Vom Demos zum Geschäftszweig: KI-Video erobert Hollywood

Während Sora den Hype nicht erfüllte, entsteht um Studios wie Netflix und Start-ups wie Higgsfield ein echter KI-Videoproduktions-Markt mit Milliarden-Bewertungen.

17.08.2026 · The Decoder (DE)
Benchmarks & Evals PerceptionBench: Multimodale KI-Modelle bei Bildverständnis deutlich schwächer als vermutet

Ein neuer Benchmark von Moonshot AI zeigt, dass kein Frontier-Modell 60 Prozent Genauigkeit beim reinen Bildlesen erreicht – viele vermeintliche Reasoning-Fehler entstehen bereits beim Sehen.

15.08.2026 · The Decoder (DE)
Dev-Tools Suno Studio 2.0: Musikproduktion als Chat mit der eigenen KI-Band

Suno baut seine KI-Musikplattform mit Studio 2.0 massiv aus: Chat-Interface für Instrumente, MIDI-Import und 32-Bit-Export für Bezahl-Abos – doch das widerspricht Sunos gerade angekündigten Download-Limits.

13.08.2026 · The Decoder (DE)
Enterprise Brustkrebserkennung: KI-Tools enttäuschen Radiologen in der Praxis

Eine Umfrage unter US-Radiologen zeigt: FDA-zugelassene KI-Tools zur Brustkrebserkennung erreichen in der Klinik nicht die erwarteten Verbesserungen.

12.08.2026 · The Decoder (DE)
Dev-Tools Seedance 2.5 im Praxis-Test: Das leistungsstärkste KI-Videomodell im detaillierten Check

Ein Creator hat 1000 Dollar in Seedance 2.5 investiert und testet das Video-Modell systematisch – mit konkreten Prompts und Erkenntnissen zum effizienten Umgang mit Credits.

12.08.2026 · Julian Ivanov (YT)
Infrastruktur LFM2.5-VL-3B: Schnelleres und besseres Sehen für Edge-Geräte

Ein neues 3-Milliarden-Parameter-Modell für Vision-Aufgaben bringt erweiterte Fähigkeiten auf ressourcenschwache Geräte.

12.08.2026 · HuggingFace Blog
Architektur-Innovation The Sequence Knowledge #911: Diffusions- und Multimodal-Modelle verdichten

Eine technische Analyse zu Kompression, räumlicher Optimierung und Ausrichtung von Diffusions- und Multimodal-Modellen.

11.08.2026 · The Sequence
Agenten & Tool-Use Meta stellt Muse Glimmer vor: offenes Agenten-Modell mit 30 Milliarden Parametern

Meta veröffentlicht Muse Glimmer, ein 30-Milliarden-Parameter-Modell unter Apache-2.0-Lizenz, das speziell für agentenbasierte Aufgaben, zuverlässiges Tool-Use und mehrstufiges Reasoning optimiert ist.

10.08.2026 · Simon Willison
Agenten & Tool-Use Meta stellt Muse Glimmer vor: Open-Weights-Modell für lokale Agenten-Tasks

Meta bringt mit Muse Glimmer ein 30-Milliarden-Parameter-Modell unter Apache-2.0-Lizenz zurück ins Spiel – optimiert für agentenbasierte Aufgabenvollendung, zuverlässige Tool-Nutzung und mehrstufiges Reasoning.

10.08.2026 · Simon Willison
Agenten & Tool-Use NVIDIA Magpie: Open-Source-TTS für schnelle mehrsprachige Voice-Agenten

NVIDIA stellt Magpie TTS mit offenen Gewichten bereit – ein Text-to-Speech-Modell für latenzarme, mehrsprachige Voice-Agenten mit vollständiger Deployment-Kontrolle.

10.08.2026 · HuggingFace Blog
Agenten & Tool-Use Meta startet Muse Glimmer: lokale KI mit Agenten-Fähigkeiten und Open Source

Meta bringt mit Muse Glimmer ein neues multimodales KI-Modell an den Start, das lokal läuft, agentic-Funktionen bietet und als Open Source verfügbar ist.

10.08.2026 · HuggingFace Blog
Frontier-Modelle xAIs Bildgenerator "Imagine Image 2.0" erreicht Platz 2 hinter OpenAI

xAI veröffentlicht einen neuen Bildgenerator für Grok, der in Benchmarks nur hinter OpenAIs GPT-Image-2 rangiert und praktische Editing-Tools wie Magic Wand und Multi-Ref-Editing bietet.

08.08.2026 · The Decoder (DE)
Frontier-Modelle Black Forest Labs stellt FLUX 3 Video vor – mit Audio und Lippensynchron

Black Forest Labs veröffentlicht FLUX 3 Video: ein Modell für 20-sekündige Full-HD-Videos mit nativem Audio, lippensynchronen Dialogen in 14 Sprachen und gerenderter Typografie – und übertrumpft damit laut eigenen Rankings Gemini Omni Flash und Seedance 2.0.

05.08.2026 · The Decoder (DE)
Frontier-Modelle Google Gemini Robotics: Wenn Roboter lernen, wie Menschen denken

Google trainiert humanoidale Roboter mit einem einzigen KI-Modell und veröffentlicht die Reasoning-Komponente als API – die Steuerung bleibt unter Verschluss.

05.08.2026 · The Sequence
Dev-Tools MiniMax-H3 auf Apple Silicon: Text-to-Video jetzt auf dem MacBook

Ein MLX-Port ermöglicht es, das multimodale Video-Generierungsmodell MiniMax-H3 direkt auf Apple-Chips auszuführen – erste Ergebnisse sind beeindruckend, erfordern aber Geduld.

04.08.2026 · Simon Willison
Dev-Tools MiniMax-H3 auf Apple Silicon: Omni-Modal-Video-Generierung im Hands-on Test

MiniMax' neues H3-Modell erzeugt 15-Sekunden-Videoclips aus Text, Bildern, Audio und Video – und läuft jetzt über MLX auch auf M-Series-MacBooks.

04.08.2026 · Simon Willison
Frontier-Modelle MiniMax H3: Erstes Open-Source-Videomodell führt Rankings an

MiniMax hat sein Videomodell H3 als Open Source freigegeben und setzt sich damit erstmals mit einem offenen Modell an die Spitze von Video-Editing-Rankings.

03.08.2026 · The Decoder (DE)
Frontier-Modelle Claude Opus 5 generiert komplette 3D-Games nur aus Text-Prompts

Anthropics neuester Spitzenchip Claude Opus 5 erzeugt spielbare Browser-Games (Shooter, Kart-Racer, Minecraft-Varianten) vollständig aus Prompts – ohne externe Assets, mit Code-generierten Geometrien, Texturen und Physik.

02.08.2026 · The Decoder (DE)
Frontier-Modelle Seedance 2.5: ByteDances Videomodell generiert 30-Sekunden-Clips mit Audio

ByteDance stellt Seedance 2.5 vor – ein Videomodell, das Video und Audio in einem Schritt erzeugt und damit dreimal längere Sequenzen als Googles Gemini schafft.

01.08.2026 · The Decoder (DE)