OCR-Qualität für alte Bücher: Das Effizienz-Problem beim KI-Training

Alte OCR-Texte lassen Sprachmodelle nur mit 30 Prozent der Effizienz lernen – das FineBooks-Projekt will das ändern
6/10 The Decoder (DE) 10.08.2026 Infrastruktur Open Source Research

Hugging Face und EleutherAI haben untersucht, wie OCR-Fehler bei der Digitalisierung historischer Bücher die Trainingsqualität von Sprachmodellen beeinflussen. Das beste getestete Modell (dots.mocr) erreicht zwar 97,6 Prozent Zeichengenauigkeit und ist kostengünstig, doch selbst diese Quote reicht aus, um die Lerneffizienz von LLMs um etwa 70 Prozent zu senken. Das FineBooks-Projekt adressiert damit ein praktisches Problem beim Aufbau großer KI-Trainingsdatensätze aus digitalisiertem Kulturerbe – ein Bottleneck, der bislang wenig öffentliche Aufmerksamkeit erhalten hat.

Zum Originalartikel