Évaluation automatique de textes rédigés par des humains et générés par des machines
| Auteur / Autrice : | Yanzhu Guo |
| Direction : | Chloé Clavel |
| Type : | Thèse de doctorat |
| Discipline(s) : | Informatique, données, IA |
| Date : | Soutenance le 20/06/2025 |
| Etablissement(s) : | Institut polytechnique de Paris |
| Ecole(s) doctorale(s) : | École doctorale de l'Institut polytechnique de Paris |
| Partenaire(s) de recherche : | Laboratoire : Laboratoire d'informatique de l'École polytechnique (Palaiseau ; 1988-....) - Laboratoire d'informatique de l'École polytechnique [Palaiseau] / LIX |
| Jury : | Président / Présidente : Thierry Poibeau |
| Examinateurs / Examinatrices : Chloé Clavel, Anders Søgaard, Alexandre Allauzen, Maxime Peyrard, Fabian Suchanek, Antoine Bosselut | |
| Rapporteurs / Rapporteuses : Anders Søgaard, Alexandre Allauzen | |
| DOI : | 10.70675/222da373z9601z4573z8050z15adb4c4a3ff |
Résumé
Avec l'expansion rapide du contenu numérique, l'évaluation automatique de l'information textuelle est devenue de plus en plus essentielle. Cette thèse aborde le défi d’évaluer et d’améliorer la qualité des textes, qu’ils soient rédigés par des humains ou générés par des modèles. Pour les textes rédigés par des humains, nous développons un système d’extraction d’arguments afin d’évaluer la justification des évaluations scientifiques par les pairs, offrant ainsi un aperçu de la qualité du processus de relecture dans les conférences de TAL au cours des dernières années. De plus, nous analysons la factualité des jeux de données de résumé abstratif et proposons une approche d'affinement des données qui améliore les performances des modèles tout en réduisant les coûts computationnels. Pour les textes générés par des modèles, cette thèse explore des aspects encore peu étudiés, tels que la diversité et la naturalité linguistique. Nous introduisons un ensemble de métriques permettant de mesurer la diversité linguistique et menons une évaluation systématique sur des modèles de langage de pointe, en examinant comment les choix de développement et de déploiement influencent la diversité de leurs sorties. Nous étudions également l'impact de l'entraînement des modèles sur des données synthétiques générées par des modèles antérieurs, démontrant que les boucles d'entraînement récursives entraînent une diminution progressive de la diversité. Enfin, nous analysons la naturalité des modèles de langage multilingues, mettant en évidence un biais centré sur l'anglais et proposant une méthode d’alignement pour y remédier. Ces contributions font progresser les méthodologies d’évaluation de la génération de langage naturel et apportent un éclairage sur l’interaction entre les métriques d’évaluation, la qualité des jeux de données et les performances des modèles de langage.