Der YouTuber Fabian vergleicht das chinesische Open-Weights-Modell Kimi K3 direkt mit Anthropics Claude Opus 5 in einem realen Code-Review-Szenario. Beide Modelle müssen sieben versteckte Fehler in einem echten Pull Request aus einem Python-Repository finden – doch trotz ähnlicher Benchmark-Erfolge erweist sich das Ergebnis ernüchternd: Beide bestehen zwar den formalen Test mit 6 von 6, Claude findet immerhin einen zusätzlichen Bug, aber letztlich enthalten beide finalen Patches weiterhin kritische, datenverlust-gefährliche Fehler. Der Test illustriert eine zentrale Erkenntnis: Grüne Modellberichte und Arena-Platzierungen sind kein Beweis für echte Code-Sicherheit im Produktiveinsatz.