Epoch AI hat mit MirrorCode einen Benchmark entwickelt, der misst, ob LLMs ganze Programme von Grund auf neu programmieren können – ohne Zugang zum Original-Quellcode. Claude Opus 4.7 führt die Tests mit 56 Prozent Lösungsquote an und bewies dabei beeindruckende Eigenständigkeit: Ein 16.000-Zeilen-Toolkit wurde in nur 14 Stunden reimplementiert. Die Ergebnisse zeigen aber auch Grenzen auf – bei den schwierigsten Aufgaben scheitern alle getesteten Modelle bislang. Dieser Benchmark illustriert sowohl die Fortschritte im autonomen Coding als auch die noch vorhandenen Lücken bei komplexen Softwareentwicklungs-Szenarien.