Thèse soutenue

Évaluation automatique de textes rédigés par des humains et générés par des machines

FR  |  
EN
Auteur / Autrice : Yanzhu Guo
Direction : Chloé Clavel
Type : Thèse de doctorat
Discipline(s) : Informatique, données, IA
Date : Soutenance le 20/06/2025
Etablissement(s) : Institut polytechnique de Paris
Ecole(s) doctorale(s) : École doctorale de l'Institut polytechnique de Paris
Partenaire(s) de recherche : Laboratoire : Laboratoire d'informatique de l'École polytechnique (Palaiseau ; 1988-....) - Laboratoire d'informatique de l'École polytechnique [Palaiseau] / LIX
Jury : Président / Présidente : Thierry Poibeau
Examinateurs / Examinatrices : Chloé Clavel, Anders Søgaard, Alexandre Allauzen, Maxime Peyrard, Fabian Suchanek, Antoine Bosselut
Rapporteurs / Rapporteuses : Anders Søgaard, Alexandre Allauzen
DOI : 10.70675/222da373z9601z4573z8050z15adb4c4a3ff

Résumé

FR  |  
EN

Avec l'expansion rapide du contenu numérique, l'évaluation automatique de l'information textuelle est devenue de plus en plus essentielle. Cette thèse aborde le défi d’évaluer et d’améliorer la qualité des textes, qu’ils soient rédigés par des humains ou générés par des modèles. Pour les textes rédigés par des humains, nous développons un système d’extraction d’arguments afin d’évaluer la justification des évaluations scientifiques par les pairs, offrant ainsi un aperçu de la qualité du processus de relecture dans les conférences de TAL au cours des dernières années. De plus, nous analysons la factualité des jeux de données de résumé abstratif et proposons une approche d'affinement des données qui améliore les performances des modèles tout en réduisant les coûts computationnels. Pour les textes générés par des modèles, cette thèse explore des aspects encore peu étudiés, tels que la diversité et la naturalité linguistique. Nous introduisons un ensemble de métriques permettant de mesurer la diversité linguistique et menons une évaluation systématique sur des modèles de langage de pointe, en examinant comment les choix de développement et de déploiement influencent la diversité de leurs sorties. Nous étudions également l'impact de l'entraînement des modèles sur des données synthétiques générées par des modèles antérieurs, démontrant que les boucles d'entraînement récursives entraînent une diminution progressive de la diversité. Enfin, nous analysons la naturalité des modèles de langage multilingues, mettant en évidence un biais centré sur l'anglais et proposant une méthode d’alignement pour y remédier. Ces contributions font progresser les méthodologies d’évaluation de la génération de langage naturel et apportent un éclairage sur l’interaction entre les métriques d’évaluation, la qualité des jeux de données et les performances des modèles de langage.