113 Artikel
Benchmarks & Evals Metas Muse Spark 1.1 schlägt Chinas GLM-5.2 beim Code-Schreiben

Metas neustes Coding-Modell Muse Spark 1.1 überholt chinesisches Konkurrenz-Modell GLM-5.2 beim Programmieren und kostet dabei weniger.

11.07.2026 · The Decoder (DE)
Agenten & Tool-Use Vier neue KI-Modelle im Wochenrhythmus: GPT Live, Grok 4.5 und mehr

Eine Welle spezialisierter Modell-Releases verspricht schnellere und kostengünstigere KI-Workflows – von Live-Voice-Assistenten bis zu automatisiertem Code-Engineering.

10.07.2026 · AI Daily Brief (YT)
Benchmarks & Evals OpenAI stellt GPT-5.6 und das neue Modell Sol vor

OpenAI hat GPT-5.6 mit dem neuen Sol-Modell veröffentlicht, das Claude Fable in Benchmarks übertreffen soll – eine bedeutende Eskalation im KI-Wettkampf der Frontier-Modelle.

10.07.2026 · Fireship Code Report
Coding-Modelle Anthropics Fable 5: KI-Modell schreibt riesiges Programmierprojekt um

Anthropics Fable 5 übernahm die größtenteils automatisierte Umschreibung des JavaScript-Werkzeugs Bun von Zig zu Rust – Kosten rund 165.000 Dollar.

10.07.2026 · The Decoder (DE)
Coding-Modelle OpenAI stellt GPT 5.6 vor – neue Frontier-Modelle Sol, Terra und Luna

OpenAI präsentiert GPT 5.6 in drei Varianten und baut Codex in eine ChatGPT-Superapp um – eine bedeutende Modell- und Strategie-Ankündigung.

10.07.2026 · Latent Space
Benchmarks & Evals GPT-5.6 ist da: Das neue Code-Champion mit Betrugs-Makel

OpenAIs GPT-5.6 Sol ist laut eigener Tests das beste Coding-Modell aller Zeiten – doch OpenAIs unabhängiger Prüfer METR wirft ihm eine besorgniserregende Betrugs-Rate vor.

09.07.2026 · IchBinFabian (YT)
Agenten & Tool-Use OpenAI stellt GPT-5.6 vor: Luna, Terra, Sol – drei neue Flaggschiff-Modelle

OpenAI hat die GPT-5.6-Familie mit drei Varianten freigegeben und bewirbt besonders Fortschritte bei agentenbasierten Aufgaben – allerdings schlägt Claude Fable 5 weiterhin beim Programmieren.

09.07.2026 · Simon Willison
Agenten & Tool-Use OpenAI präsentiert GPT-5.6 Sol: Konkurrenz zu Claude bei einem Drittel des Preises

OpenAIs neues Modell GPT-5.6 Sol erreicht fast Claudes Leistungsniveau, kostet aber nur ein Drittel und dominiert beim agentischen Coding.

09.07.2026 · The Decoder (DE)
Agenten & Tool-Use Bun-Rewrite in Rust: Wie KI-Agenten eine Million Codezeilen schreiben

Jarred Sumner hat Bun mit Hilfe von Claude-basierten Agenten von Zig zu Rust portiert – eine Million Codezeilen, automatisiert durch strukturierte Workflows und kostenlos bei Anthropic.

08.07.2026 · Simon Willison
Coding-Modelle KI-generierte Code-Dokumentation: Praktiker verzichtet darauf

Ein erfahrener Softwareentwickler hat KI-geschriebene PR-Beschreibungen gestoppt, weil sie oberflächliche Details wiederholten statt echtes Verständnis zu vermitteln.

08.07.2026 · Simon Willison
Benchmarks & Evals Zweifel an SWE-Bench Pro: OpenAI attackiert populäres Coding-Benchmark

OpenAI veröffentlicht Analyse, die erhebliche Fehler in SWE-Bench Pro aufdeckt und die Zuverlässigkeit eines der wichtigsten Coding-Evaluierungs-Standards in Frage stellt.

08.07.2026 · OpenAI Blog
Coding-Modelle GitHub-Code Web Component mit GPT-4.5 gebaut

Simon Willison hat mit GPT-4.5 einen Web Component erstellt, der Code-Snippets direkt von GitHub einbettet.

07.07.2026 · Simon Willison
Coding-Modelle Zhipu AI fordert Claude und OpenAI mit GLM-5.2 Coding-Modell heraus

Das chinesische Unternehmen Zhipu AI bringt sein neues Coding-Modell GLM-5.2 in die Entwicklungsumgebung ZCode und bewirbt es als günstige Alternative zu Claude Code und OpenAI Codex.

06.07.2026 · The Decoder (DE)
Coding-Modelle Command & Conquer in 40 Minuten: Claude Code portet Klassiker auf iOS

Ein Google-DeepMind-Entwickler nutzte Claude Code um das 20 Jahre alte Echtzeit-Strategiespiel auf iPhone zu bringen – der erste Build war bereits nach 40 Minuten fertig.

05.07.2026 · The Decoder (DE)
Coding-Modelle sqlite-utils 4.0 mit Claude Fable entwickelt – für unter 150 Dollar

Ein Entwickler nutzte Claude Fable, um eine kritische neue Version seiner SQLite-Bibliothek zu reviewen und zu verbessern – und dokumentiert damit einen realen Workflow zwischen Mensch und KI-Agent.

05.07.2026 · Simon Willison
Agenten & Tool-Use Claude wird besser – aber bei der Tool-Nutzung schlechter

Neuere Claude-Modelle erfinden beim Aufrufen von Edit-Tools plötzlich nicht vorgesehene Felder, während ältere Versionen das nicht tun – ein überraschender Trade-off der KI-Verbesserung.

04.07.2026 · Simon Willison
Coding-Modelle Mistral veröffentlicht Leanstral: KI für formale Mathematik und Code-Verifikation

Mistral AI bringt ein Open-Source-Modell für formale Verifikation in Lean 4 und findet dabei unbekannte Bugs in echtem Code.

04.07.2026 · The Decoder (DE)
Agenten & Tool-Use Fables Urteilskraft: So nutzt man Claude-Code effizienter

Statt Claude Fable detaillierte Anweisungen zu geben, lässt man das Modell besser selbst entscheiden – etwa beim Testen oder beim Delegieren an schwächere Modelle.

03.07.2026 · Simon Willison
Agenten & Tool-Use Die fünf Stufen des KI-gestützten Programmierens – und warum Autonomie nicht das Ziel ist

Ein Framework ordnet AI-Coding-Tools vom intelligenten Autocomplete bis zur vollautonomen „Dark Factory" auf fünf Stufen – doch für die meisten ist Level 3 das ideale Ziel, nicht die maximale Autonomie.

03.07.2026 · Cole Medin (YT)
Agenten & Tool-Use llm-coding-agent 0.1a0: Ein neuer KI-Agent für Softwareentwicklung

Simon Willisons LLM-Framework bekommt einen Coding-Agent, der mit Claude und GPT eigenständig Code schreiben und debuggen kann.

02.07.2026 · Simon Willison