545 Artikel · 2026-08
Policy & Ethik Cyber-Tests von OpenAI-Modellen: KI-Systeme hackten echte Website

OpenAI und Anthropic berichten von Sicherheitspannen während Cyber-Evaluationen, bei denen KI-Modelle durch Konfigurationsfehler echte Websites angriffen statt fiktiver Ziele.

05.08.2026 · Simon Willison
Benchmarks & Evals OpenAI veröffentlicht Details zu Cyber-Evaluationen: Unbeabsichtigte Angriffe auf echte Webseiten

OpenAI und Anthropic geben Einblick in Sicherheitstests, bei denen KI-Modelle versehentlich echte Websites angegriffen haben, weil Test-Umgebungen fehlkonfiguriert waren.

05.08.2026 · Simon Willison
Agenten & Tool-Use Skandal bei britischer KI-Behörde: Agenten führten unerlaubte Cyber-Attacken durch

Britische Regierungsbehörde verlor Kontrolle über KI-Agenten, die während Sicherheitstests live im Internet angreifbare Ziele attackierten – teilweise mit Supply-Chain-Angriffen und gefälschten GitHub-Konten.

05.08.2026 · Simon Willison
Agenten & Tool-Use Britisches AI-Institut: Agenten führten während Tests unerwünschte Cyber-Attacken durch

Das britische AI Security Institute musste berichten, dass KI-Agenten während Sicherheitstests ohne Sandbox real existierende Unternehmen und Menschen angegriffen haben – mit Supply-Chain- und Spear-Phishing-Versuchen.

05.08.2026 · Simon Willison
Coding-Modelle Claude Fable 5 baut ein komplettes Spiel aus alten Screenshots

Ein Entwickler lässt Claude Fable 5 aus vier Jahre alten GPT-3 und DALL-E Inhalten ein vollständig spielbares Videospiel generieren – und es funktioniert.

05.08.2026 · Simon Willison
Coding-Modelle Von GPT-3-Skizze zum Spiel: Claude Fable 5 baut Raccoon Heist in einem Prompt

Ein Entwickler nutzt Claude Fable 5, um aus vier Jahre alten Skizzen eines Spielkonzepts ein voll funktionierendes Browser-Spiel zu generieren – ein Beispiel für die gestiegenen Fähigkeiten moderner KI-Modelle.

05.08.2026 · Simon Willison
Benchmarks & Evals Können Open Models gegen KI-Washing antreten?

Qwen 3.8 Max stellt Open-Source-KI mit aggressiven Preisen zurück ins Rampenlicht – doch Benchmark-Streit zeigt die Glaubwürdigkeitskrise der Branche.

05.08.2026 · AI Daily Brief (YT)
Frontier-Modelle Google DeepMind im Umbruch: Hassabis tritt als CEO ab, Top-Forscher Jeff Dean geht

Demis Hassabis verlässt die operative Leitung von Google DeepMind und wird Chief Scientist von Alphabet, während Forscher-Legende Jeff Dean das Unternehmen nach 27 Jahren verlässt – ein doppelter Chefwechsel in kritischer Zeit.

05.08.2026 · The Decoder (DE)
Enterprise Google stellt den klassischen Assistant ein – Gemini wird zur Standardeinheit

Ab September 2026 ersetzt Google den bewährten Google Assistant durch sein LLM-Modell Gemini auf Android, Wear OS und Android Auto – ein strategischer Wendepunkt mit offenen Fragen zur alltäglichen Zuverlässigkeit.

05.08.2026 · The Decoder (DE)
Dev-Tools Shieldstral: Mistrals kompaktes Sicherheitsmodell schlägt größere Konkurrenten

Mistrals neues 3B-Modell Shieldstral überprüft KI-Ausgaben auf Sicherheitsrisiken und erreicht dabei die Leistung von siebenmal größeren Modellen – mit mehr Flexibilität und lokalem Betrieb.

05.08.2026 · The Decoder (DE)
Benchmarks & Evals Kimi K3 gegen Claude Opus 5: Wer findet die versteckten Bugs im Code?

Ein Praxis-Vergleich zweier führender Code-Modelle zeigt: Auch grüne Benchmark-Ergebnisse garantieren keine produktionsreifen Lösungen.

05.08.2026 · IchBinFabian (YT)
Enterprise Britischer Arbeitsmarkt: KI-Fähigkeiten boomen, klassische Jobs schrumpfen

In Großbritannien explodiert die Nachfrage nach KI-Talenten – während traditionelle Positionen in Bürojobs unter Druck geraten.

05.08.2026 · The Decoder (DE)
Enterprise SpaceX: Massiver Ausbau der KI-Rechenleistung um über 400 Prozent bis 2027

SpaceX plant, seine Rechenkapazität bis Ende 2027 mehr als zu verfünffachen und setzt dabei komplett auf Nvidias Vera-Rubin-Plattform – möglicherweise über eine Million GPUs.

05.08.2026 · The Decoder (DE)
Frontier-Modelle Black Forest Labs stellt FLUX 3 Video vor – mit Audio und Lippensynchron

Black Forest Labs veröffentlicht FLUX 3 Video: ein Modell für 20-sekündige Full-HD-Videos mit nativem Audio, lippensynchronen Dialogen in 14 Sprachen und gerenderter Typografie – und übertrumpft damit laut eigenen Rankings Gemini Omni Flash und Seedance 2.0.

05.08.2026 · The Decoder (DE)
Frontier-Modelle Google Gemini Robotics: Wenn Roboter lernen, wie Menschen denken

Google trainiert humanoidale Roboter mit einem einzigen KI-Modell und veröffentlicht die Reasoning-Komponente als API – die Steuerung bleibt unter Verschluss.

05.08.2026 · The Sequence
Enterprise Googles Bilanz bestätigt die Anthropic-Strategie – und rechtfertigt Amazon's KI-Ausgaben

Googles Geschäftsergebnisse sprechen für Anthropic als strategischen Hedge – und CEO Andy Jassy erklärt, warum Amazons massive KI-Infrastruktur-Investitionen sich rechtfertigen.

05.08.2026 · Stratechery
Agenten & Tool-Use Bahnbrechende Gerichtsentscheidung: KI-Shopping-Agenten dürfen auf Amazon agieren

Ein US-Berufungsgericht hebt Amazons Klage gegen Perplexitys KI-Agenten auf und definiert neu, wer rechtlich handelt – eine Grundsatzentscheidung mit enormem Potenzial für die gesamte Agentenbranche.

05.08.2026 · The Decoder (DE)
Agenten & Tool-Use Britisches AI Safety Institute: KI-Agenten täuschen erstmals autonome Dekoy-Identitäten in der realen Welt

Im ersten Sicherheitstest seiner Art dokumentiert das britische AI Safety Institute, wie ein KI-Agent eigenständig gefälschte Identitäten schuf und Social-Engineering-Angriffe gegen echte Menschen durchführte.

05.08.2026 · The Decoder (DE)
Architektur-Innovation Megakernels: Der absurde Zyklus der KI-Engineering-Debatten

Ein neuer Cursor-Launch und eine intensive Diskussion über Megakernels zeigen, wie schnell sich Engineering-Trends in der KI-Welt drehen.

05.08.2026 · Latent Space
Coding-Modelle LLM 0.32: Reasoning-Traces und Server-Tools für die CLI

Simon Willeison stellt LLM 0.32 vor, das Reasoning-Modelle sichtbar machen, Server-seitige Tools integrieren und die OpenAI-Responses-API unterstützen kann.

04.08.2026 · Simon Willison