Der deutsche KI-Entwickler Fabian testet DeepSeek V4 Flash, Chinas neuestes Open-Source-Sprachmodell mit 304 Milliarden Parametern (davon aktiv 13 Milliarden), gegen Anthropics Claude Code. Das Ergebnis ist eindeutig beim Preis – 4 Cent gegen 3,34 Euro – doch beim Praxistest generierte Flash 1.608 Codezeilen, Claude nur 720, ohne dass klar ist, ob das auf höhere Qualität oder bloß Ineffizienz hindeutet. Der Test verdeutlicht, dass Benchmarks oft täuschen und Quantisierung große Auswirkungen auf echte Performance hat. Für KI-Programmierer stellt sich damit die Frage neu: Lohnt sich der Abo-Wechsel zu günstigen Alternativen wirklich, oder zahlt man bei Billiganbietern in anderer Währung?