Kimi K3 wird derzeit als das beste Open-Source-Modell gefeiert und schlägt laut Leaderboards sogar Claude Opus. Ein Entwickler hat das jedoch mit Millionen Tokens bei realen Coding-Tasks geprüft und kommt zu einem differenzierteren Urteil: Zwar zeigt K3 teilweise beeindruckende Ausgaben, aber Open-Weight-Modelle haben systematische Zuverlässigkeitsprobleme, die Benchmarks nicht erfassen. Wertvoller Wakeup-Call gegen Benchmark-Hype und gleichzeitig praktischer Leitfaden für realistische Modell-Evaluierung.