Amélioration des représentations pour la modélisation du langage
| Auteur / Autrice : | Nathan Godey |
| Direction : | Benoît Sagot, Eric Villemonte de la Clergerie |
| Type : | Thèse de doctorat |
| Discipline(s) : | Sciences et technologies de l'information et de la communication |
| Date : | Soutenance le 20/12/2024 |
| Etablissement(s) : | Sorbonne université |
| Ecole(s) doctorale(s) : | École doctorale Informatique, télécommunications et électronique de Paris (1992-....) |
| Partenaire(s) de recherche : | Laboratoire : Institut national de recherche en informatique et en automatique (France). Centre de recherche de Paris (Paris) (2016-....) |
| Jury : | Président / Présidente : Claire Gardent |
| Examinateurs / Examinatrices : Louis Martin, Caio Corro | |
| Rapporteurs / Rapporteuses : Antske Fokkens, Ivan Titov | |
| DOI : | 10.70675/b6a15d0ez15bez43e5za967z16a069e0a8bb |
Résumé
Le domaine du traitement automatique du langage a récemment connu un changement de paradigme majeur qui a conduit à des améliorations remarquables par rapport aux capacités perçues des systèmes résultants. Ce changement, à savoir l'avènement des systèmes génératifs en lieu et place des systèmes prédictifs, a induit un changement profond dans les objectifs implicites des systèmes linguistiques basés sur l'apprentissage profond : alors que l'objectif des anciennes méthodes était d'extraire des caractéristiques pertinentes à partir d'énoncés textuels en utilisant l'auto-supervision, nous essayons aujourd'hui de maximiser la performance générative des modèles linguistiques sur d'énormes volumes d'échantillons de textes diversifiés. Dans cette thèse, nous explorons les propriétés de haut niveau des caractéristiques (ou représentations) qui sont extraites par ces modèles de langue, et nous tirons parti de ces propriétés pour améliorer ces systèmes et quantifier leurs limites. Ce travail comporte deux volets : nous nous concentrons d'abord sur les apprentissages résultant de l'analyse des représentations dans les modèles de langues pré-entraînés, puis nous suggérons et mettons en œuvre de nouveaux biais inductifs ainsi que des approches d'entraînement basées sur nos observations. Nous constatons que les représentations intermédiaires des modèles de langage auto-supervisés sont affectées par plusieurs formes de biais. Tout d'abord, elles souffrent de biais inhérents aux données qui peuvent être attribués à des considérations socioculturelles, comme nous le démontrons en sondant les connaissances géographiques dans ces caractéristiques. En outre, nous montrons que ces espaces de représentation peuvent être déformés par la nature particulière du langage, surtout lorsque la dimensionnalité de l'espace des représentations est faible. Nous continuons à montrer que les biais inductifs tels que l'auto-attention peuvent également induire des distorsions similaires qui se produisent indépendamment de la modalité cible. Ainsi, l'analyse des représentations nous aide à identifier les limitations qui proviennent de différents aspects des modèles linguistiques, des données d'entraînement à l'architecture. Le prisme de l'apprentissage par représentation peut non seulement nous aider à identifier les limites des modèles de langue, mais il peut également conduire à des améliorations substantielles pour ces systèmes, notamment en termes d'efficacité. Sur la base des mécanismes que nous avons identifiés, nous proposons des alternatives à l'approche classique de maximisation de la vraisemblance du prochain mot. Nous concevons une nouvelle couche différentiable qui effectue la segmentation du texte afin d'optimiser la tokenisation conjointement au reste du système, ce qui conduit à une modélisation efficace au niveau des caractères et à des modèles robustes. Nous mettons également en œuvre un objectif contrastif qui atténue simultanément le biais de représentation induit par la fréquence des tokens et le phénomène de dégénérescence, en régularisant implicitement les espaces latents. Cet objectif permet d'améliorer considérablement l'efficacité et les performances des modèles. Enfin, nous explorons un schéma de compression différentiable pour les modèles de langage génératifs, ouvrant la voie à des mécanismes d'attention efficaces en termes de mémoire. Dans l'ensemble, notre travail prouve la pertinence de l'analyse de la représentation dans le contexte de l'amélioration des modèles de langue, à la fois comme moyen d'identifier les limites des approches classiques et comme moyen d'améliorer leur efficacité.