Méthodes efficaces à grande échelle pour l'acquisition, la recherche et la compréhension des données tabulaires ouvertes
| Auteur / Autrice : | Antoine Gauquier |
| Direction : | Pierre Senellart, Ioana Manolescu |
| Type : | Projet de thèse |
| Discipline(s) : | Informatique |
| Date : | Inscription en doctorat le 01/09/2023 |
| Etablissement(s) : | Université Paris sciences et lettres |
| Ecole(s) doctorale(s) : | École doctorale Sciences mathématiques de Paris centre (Paris ; 2000-....) |
| Partenaire(s) de recherche : | Laboratoire : DIENS - Département d'informatique de l'École normale supérieure |
| Equipe de recherche : VALDA | |
| établissement opérateur d'inscription : École normale supérieure - PSL (ENS-PSL) |
Résumé
L'objectif est de développer des modèles, algorithmes, et un système capable de construire automatiquement des entrepôts riches de données multimodales. Un tel entrepôt pourra contenir des documents non-structurés (principalement sous forme textuelle, en français ou en anglais), semi-structurés (documents PDF, pages ou sites Web, données extraites de réseaux sociaux, etc.) et structurés (jeux de données tabulés ou présentés sous forme de cubes d'agrégation, aux formats CSV, OpenDocument, etc.). La thèse porte sur : l'acquisition de données depuis des sources de données hétérogènes, l'analyse de ces données pour en extraire des informations structurées et pour relier les données entre elles, et enfin la construction automatique et l'exploitation d'un entrepôt de données pour stocker et interroger ces données dans leur variété. Chacune de ces étapes s'appuiera en particulier sur des méthodes modernes d'intelligence artificielle (p. ex., renforcement pour l'acquisition de contenus ; apprentissage profond, potentiellement avec auto-attention pour l'analyse de contenu texte ou image, etc.). Deux applications sont visées : les théorèmes mathématiques, extraits de la littérature scientifique ; et le journalisme de données statistiques. Une première originalité de notre approche est de considérer les documents, quand cela est pertinent, de manière multimodale (données numériques, texte, image, informations de style ). La multimodalité est un sujet d'actualité en apprentissage, avec par exemple le développement de modèles tels LayoutLM permettant d'analyser de manière jointe le texte et un rendu graphique d'un document, ou encore l'intégration au modèle de langage GPT-4 de la possibilité de combiner prompts textuel et visuel. Notons que l'existence de grands modèles de langues comme GPT-4 ou LLaMA ne résout pas tous les problèmes qui nous intéressent : ils ne sont pas adaptés à toutes les tâches, manquent de traçabilité des résultats et d'informations sur leur fiabilité, ne passent actuellement pas à l'échelle et demandent des ressources de calcul importantes y compris pour l'inférence. Une seconde originalité de ce sujet est de considérer la chaîne complète de traitement, de l'acquisition à l'exploitation de l'entrepôt de données. Ces différentes étapes ne sont pas ainsi vues comme indépendantes, mais peuvent avoir un impact l'une sur l'autre (ainsi, les éléments extraits peuvent servir à alimenter la manière dont on acquiert de nouveaux éléments ; les requêtes effectuées sur l'entrepôt peuvent conduire à y ajouter de nouvelles données et à lancer de nouvelles acquisitions). Nous souhaitons également conserver tout au long de cette chaîne de traitement des informations sur la traçabilité ou provenance de l'information (d'où vient telle information, par quel outil a-t-elle été produite, suite à quelle succession de décisions, etc.) et sur son incertitude (à quel point une information est fiable, en fonction de la fiabilité estimée des sources et outils qui l'ont produite). La thèse est co-encadrée entre Pierre Senellart (équipe Valda, DI ENS & Inria Paris) et Ioana Manolescu (équipe CEDAR, Inria Saclay & LIX). Ils sont des chercheurs dans le domaine de la gestion et de la science des données, utilisant fréquemment des techniques d'intelligence artificielle (apprentissages statistique et profond, traitement du langage et des images, raisonnement) dans leurs recherches. Pierre Senellart apporte sa compétence dans les aspects fondamentaux et pratiques de la gestion de l'incertitude et de la provenance des données, de l'acquisition et de l'extraction d'informations, et la première application aux théorèmes mathématiques, via son projet TheoremKB. Ioana Manolescu apporte son expertise dans les aspects systèmes de la gestion de données complexes et hétérogènes, dans l'extraction d'information à partir de documents non-structurés ou semi-structurés, ainsi que la seconde application au journalisme de données, via son projet SourcesSay.