MirrorCode-Benchmark: Claude programmiert eigenständig 16.000 Zeilen Code

19 Tage ohne menschliche Hilfe: KI-Benchmark MirrorCode lässt Modelle tagelang autonom programmieren
6/10 The Decoder (DE) 26.06.2026 Benchmarks & Evals Coding-Modelle Frontier-Modelle Research

Epoch AI hat mit MirrorCode einen Benchmark entwickelt, der misst, ob LLMs ganze Programme von Grund auf neu programmieren können – ohne Zugang zum Original-Quellcode. Claude Opus 4.7 führt die Tests mit 56 Prozent Lösungsquote an und bewies dabei beeindruckende Eigenständigkeit: Ein 16.000-Zeilen-Toolkit wurde in nur 14 Stunden reimplementiert. Die Ergebnisse zeigen aber auch Grenzen auf – bei den schwierigsten Aufgaben scheitern alle getesteten Modelle bislang. Dieser Benchmark illustriert sowohl die Fortschritte im autonomen Coding als auch die noch vorhandenen Lücken bei komplexen Softwareentwicklungs-Szenarien.

Zum Originalartikel