47 Artikel · 2026-07
Benchmarks & Evals Mira Muratis Thinking Machines: Inkling Small schlägt Größe mit Effizienz

Das neue Open-Weights-Reasoning-Modell Inkling Small ist ein Drittel kleiner als sein Vorgänger, übertrifft ihn aber bei Coding- und Reasoning-Aufgaben.

31.07.2026 · The Decoder (DE)
Agenten & Tool-Use ThinkingCap: Qwen-basiertes Coding-Modell für den lokalen Einsatz

Ein Fine-Tune von Qwens 27B-Modell, das mit erweitertem Chain-of-Thought-Reasoning für Coding-Aufgaben optimiert wurde.

30.07.2026 · Sam Witteveen (YT)
Agenten & Tool-Use Fünf KI-Engineering-Trends, die alle verstehen sollten

OpenAI entwickelt einen tragbaren Sprachassistenten, während sich KI-Engineering fundamental verschiebt – von klassischen IDEs zu Coding-Agenten und Workflows mit menschlicher Kontrolle.

29.07.2026 · AI Daily Brief (YT)
Coding-Modelle OpenAI veröffentlicht Codex Security CLI als Open-Source-Tool

OpenAI stellt das Sicherheits-Tool Codex Security CLI als Open Source bereit, das automatisch Schwachstellen in Code aufspürt und behebt – ein direkter Schachzug gegen Anthropic und eine Antwort auf KI-gestützte Cyberattacken.

29.07.2026 · The Decoder (DE)
Coding-Modelle Laguna: Poolsides 118-Milliarden-Parameter-Modell schlägt zehnmal größere Systeme

Poolsides neues Coding-Modell mit 118 Milliarden Parametern übertrifft Systeme, die zehnmal so groß sind – nicht wegen seiner Architektur, sondern durch clevere Trainings- und Optimierungstechniken.

29.07.2026 · The Sequence
Agenten & Tool-Use Agentengestützte KI modernisiert die Wissenschaft

KI-Coding-Agenten beschleunigen Softwareentwicklung und wissenschaftliche Entdeckungen in Genomik und darüber hinaus.

28.07.2026 · OpenAI Blog
Agenten & Tool-Use Cursors Agenten-Schwarm mit Planer-Arbeiter-Architektur schlägt alte Version deutlich

Cursors neue Agenten-Schwarm-Architektur mit getrennten Planer- und Arbeiter-Rollen meistert komplexe Coding-Aufgaben wie SQLite-Neubau in Rust fehlerlos, wo das alte System an Merge-Konflikten scheiterte.

26.07.2026 · The Decoder (DE)
Coding-Modelle Ruff v0.16.0: Python-Linter mit drastisch erweiterten Standardregeln

Astral hat Ruff mit 413 statt 59 Standardregeln ausgestattet – und macht dabei die Arbeit für KI-Agenten leichter.

25.07.2026 · Simon Willison
Benchmarks & Evals Claude Opus 5: Anthropics neues Top-Modell überzeugt bei Performance und Preis

Anthropics Claude Opus 5 führt die KI-Benchmark-Rankings an und unterbietet dabei Konkurrenz-Modelle deutlich im Preis, besonders im Coding- und Analytics-Bereich.

25.07.2026 · The Decoder (DE)
Benchmarks & Evals Kimi K3: Begeisterte Benchmarks, ernüchternde Praxis

Ein praktischer Test zeigt: Das chinesische Spitzenmodell Kimi K3 glänzt zwar in Benchmarks, scheitert in der Realität aber bei anspruchsvollen Engineering-Aufgaben häufiger als geschlossen entwickelte Konkurrenten.

24.07.2026 · Cole Medin (YT)
Coding-Modelle Laguna S 2.1: Poolside zeigt, dass Ausdauer beim Coden wichtiger ist als Größe

Ein neues Coding-Modell des Startups Poolside beweist, dass intelligenteres Verhalten statt mehr Parameter bessere Ergebnisse bringt – sogar bei einem alten Mathe-Problem.

23.07.2026 · The Decoder (DE)
Coding-Modelle Moonshots Kimi K3 erreicht 2,8 Billionen Parameter

Moonshot hat mit Kimi K3 ein riesiges Open-Weight-Modell mit 2,8 Billionen Parametern veröffentlicht – die Frage ist, ob es auch liefert.

22.07.2026 · Fireship Code Report
Coding-Modelle Cisco stellt spezialisierte Open-Source-Modelle für Code-Sicherheit vor

Cisco veröffentlicht zwei kleine, offene KI-Modelle, die Schwachstellen im Code 150-mal kosteneffektiver als große KI-Agenten aufdecken.

22.07.2026 · The Decoder (DE)
Agenten & Tool-Use Wie Anthropic mit Claude Code arbeitet: Ein Einblick hinter die Kulissen

Anthropic-Teams berichten, wie KI-Coding-Agenten ihren Arbeitsalltag transformieren und welche Best Practices sich beim Einsatz von Claude durchgesetzt haben.

21.07.2026 · Simon Willison
Agenten & Tool-Use Anthropic im Gespräch: Wie Claude Code und Claude Tag im täglichen Einsatz funktionieren

Bei der AI Engineer World's Fair erzählten Anthropic-Ingenieure, wie Claude Code und die neue Slack-Integration Claude Tag ihre interne Produktentwicklung transformieren und welche Sicherheits- und Design-Ansätze dahinterstecken.

21.07.2026 · Simon Willison
Agenten & Tool-Use Reverse-Engineering wird zur Nebensache: Warum KI-Agenten das Wirtschaftlichkeitsproblem lösen

Coding-Agenten machen die Reverse-Programmierung von Smart-Home-Geräten plötzlich wirtschaftlich sinnvoll – weil die Kosten für Trial-and-Error und spätere Wartung kollabiert sind.

20.07.2026 · Simon Willison
Agenten & Tool-Use Modell-Fusion statt Modell-Wahl: Das neue Agentic-Engineering-Paradigma

Statt sich für ein KI-Modell zu entscheiden, sollten Entwickler mehrere Modelle kombinieren – eine alte Idee, die nun als „Model Fusion" neu vermarktet wird.

20.07.2026 · IndyDevDan (YT)
Benchmarks & Evals Moonshots Kimi K3 dominiert Frontend-Code, scheitert aber bei komplexer Mathematik

Chinas Kimi K3 schlägt Claude und GPT beim Code-Schreiben, zeigt aber massive Schwächen bei mathematischen Problemen.

19.07.2026 · The Decoder (DE)
Agenten & Tool-Use GPT-5.6: Kritischer Bug löscht versehentlich Benutzerverzeichnisse

OpenAI untersucht Berichte über unerwartete Dateilöschungen in GPT-5.6, wenn Codex ohne Sandbox-Schutz läuft und die $HOME-Variable überschrieben wird.

16.07.2026 · Simon Willison
Coding-Modelle Wie Codex zu OpenAIs kreativem Werkzeug wurde

OpenAIs internes Creative Team nutzt Codex zur Entwicklung eigener KI-Tools, schnelleren Ideenfindung und prototyping mit kontextbewusstem KI-Support.

16.07.2026 · OpenAI Blog