Transcription automatique très précise de documents manuscrits structurés : approches robustes et interprétables
| Auteur / Autrice : | Natalia Bottaioli gonzález |
| Direction : | Gabriele Facciolo |
| Type : | Projet de thèse |
| Discipline(s) : | Mathématiques aux interfaces |
| Date : | Inscription en doctorat le 01/10/2024 |
| Etablissement(s) : | université Paris-Saclay |
| Ecole(s) doctorale(s) : | École doctorale de mathématiques Hadamard |
| Partenaire(s) de recherche : | Laboratoire : Centre Borelli |
| Equipe de recherche : Traitement des images et du signal | |
| Référent : Ecole Normale Supérieure Paris-Saclay |
Mots clés
Résumé
La préservation du patrimoine culturel est une préoccupation mondiale, et l'UNESCO a lancé des politiques de numérisation des documents historiques afin de réduire le risque de dégradation. Cette tendance à la numérisation s'étend aux registres de population, rendant des données précieuses accessibles aux généalogistes, aux historiens et aux chercheurs. De nombreux gouvernements d'Amérique latine et des Caraïbes numérisent leurs archives d'état civil et établissent des index en transcrivant certains des champs clés des documents. Il en résulte de grandes bases de données d'images de textes manuscrits partiellement transcrits. L'objectif principal de ce projet est d'exploiter ces données pour développer des outils de transcription complète et exacte de documents officiels manuscrits structurés, tels que les registres de naissances et de décès. L'approche proposée comprend l'utilisation de techniques de reconnaissance de texte manuscrit (handwritten text recognition, HTR) pour reconnaître l'auteur du document et transcrire le texte avec précision, dans le but d'assurer l'exactitude à travers différents formats de documents dans une même langue. Le processus d'HTR relève de la reconnaissance automatique de texte (automatic text recognition, ATR) et se concentre sur la reconstitution de la structure de document ainsi que la conversion d'image en texte. Les méthodes traditionnelles, qui consistent en des heuristiques de segmentation, d'extraction de caractéristiques et de classification, ont atteint un plafond en précision. Récemment, l'apprentissage profond a révolutionné le domaine, en particulier par les modèles basés sur l'attention. Cependant, les réseaux neuronaux profonds à haute performance nécessitent de grandes bases de données annotées et manquent en interprétabilité, ce qui entrave les efforts visant à améliorer leur précision. Le projet aborde ces questions en traitant conjointement un ensemble de documents similaires, grâce à des techniques de traitement d'images et en exploitant les similarités de structure (par exemple, les registres d'état civil d'un certain type) ou de style d'écriture (par exemple, les registres d'état civil créés par le même fonctionnaire), pour construire une chaîne d'apprentissage profond interprétable et capable d'exploiter les bases de données disponibles de registres d'état civil partiellement annotés. La méthode proposée commence par le prétraitement des données afin de les débruiter et de réduire leur variabilité par les normalisations géométrique et dynamique de l'image. Ensuite, des réseaux neuronaux légers sont entraînés sur un ensemble d'apprentissage réduit par les méthodes développées à l'étape précédente. Pour chaque document, une première interprétation partielle est obtenue par ces réseaux neuronaux légers. Par la suite, l'analyse d'image classique est introduite dans une 'boucle vertueuse' sur chaque résultat fiable afin de créer un modèle de l'écriture manuscrite de chaque auteur à partir de l'interprétation partielle obtenue précédemment, pour atteindre un modèle bayésien précis de chaque caractère. Enfin, il sera obtenu une version de chaque document où tous les endroits nécessitant une vérification manuelle sont identifiés par leur probabilité d'erreur calculée par la méthode bayésienne. En résumé, ce projet vise à créer des outils de transcription exacte pour les documents manuscrits structurés. Il s'aligne sur les efforts mondiaux visant à préserver le patrimoine culturel, en mettant des données précieuses à disponibilité des chercheurs. L'approche proposée s'appuie sur des techniques d'apprentissage profond dans le domaine de l'ATR et combine le traitement d'image, le prétraitement des données et les méthodes bayésiennes pour des transcriptions précises.