Garder la trace, mettre de l'ordre et relier les points : modéliser la variation et l'ambiguïté des expressions polylexicales
| Auteur / Autrice : | Caroline Pasquer |
| Direction : | Agata Savary, Jean-Yves Antoine |
| Type : | Thèse de doctorat |
| Discipline(s) : | Informatique |
| Date : | Soutenance le 13/11/2019 |
| Etablissement(s) : | Tours |
| Ecole(s) doctorale(s) : | École doctorale Mathématiques, Informatique, Physique Théorique et Ingénierie des Systèmes (Centre-Val de Loire ; 2012-....) |
| Partenaire(s) de recherche : | Equipe de recherche : Laboratoire d'Informatique Fondamentale et Appliquée de Tours (2012-...) |
| Laboratoire : École polytechnique universitaire (Tours) | |
| Jury : | Président / Présidente : Gaël Dias |
| Examinateurs / Examinatrices : Carlos Eduardo Ramisch | |
| Rapporteurs / Rapporteuses : Béatrice Daille, Laura Kallmeyer | |
| DOI : | 10.70675/ac742392zfc14z40c1za99azd88e8fb61756 |
Mots clés
Mots clés contrôlés
Mots clés libres
Résumé
L’identification automatique d’expressions polylexicales (EP) est un pré-requis pour de nombreuses applications de traitement automatique des langues. Cette tâche représente un défi car les EP, et en particulier les verbales (EPV) telles que 'casser sa pipe' (signifiant 'mourir'), ont des formes de surface très variables ('cassera-t-il un jour sa pipe ?'). Cependant, comparée à des constructions libres, cette variabilité est généralement plus restreinte (p. ex. certains noms non modifiables par un adjectif), d’où des profils de variabilité distincts. On se penche ici sur un sous-problème de l’identification d’EPV, à savoir l’identification d’occurrences d’EPV vues dans d’autres contextes, quelque soit leur forme de surface, ce qui nécessite de prendre en compte l’ambiguïté pour éviter des lectures littérales ('casser sa vieille pipe') ou des co-occurrences fortuites ('casser le tuyau de sa pipe'). On considère pour cela deux approches : la première se fonde sur une mesure de la variabilité des EPV indépendante de la langue. La seconde consiste à modéliser le problème comme une tâche de classification d’après des traits pertinents pour la variabilité morpho-syntaxique des EPV, ce qui nous a conduit à développer un système (VarIDE), qui a participé à la compétition PARSEME d’identification automatique d’EPV en 2018.