Hugging Face und EleutherAI haben untersucht, wie OCR-Fehler bei der Digitalisierung historischer Bücher die Trainingsqualität von Sprachmodellen beeinflussen. Das beste getestete Modell (dots.mocr) erreicht zwar 97,6 Prozent Zeichengenauigkeit und ist kostengünstig, doch selbst diese Quote reicht aus, um die Lerneffizienz von LLMs um etwa 70 Prozent zu senken. Das FineBooks-Projekt adressiert damit ein praktisches Problem beim Aufbau großer KI-Trainingsdatensätze aus digitalisiertem Kulturerbe – ein Bottleneck, der bislang wenig öffentliche Aufmerksamkeit erhalten hat.