Arbres de décisions dynamiques et embedding de graphes basés sur les communautés : contributions à l'apprentissage automatique interprétable
| Auteur / Autrice : | Gabriel Damay |
| Direction : | Mauro Sozio |
| Type : | Thèse de doctorat |
| Discipline(s) : | Mathématiques et informatique |
| Date : | Soutenance le 19/12/2024 |
| Etablissement(s) : | Institut polytechnique de Paris |
| Ecole(s) doctorale(s) : | École doctorale de l'Institut polytechnique de Paris |
| Partenaire(s) de recherche : | Laboratoire : Laboratoire Traitement et communication de l'information (Paris ; 2003-....) - Laboratoire de Traitement et Communication de l'Information |
| Etablissement opérateur d'inscription : Télécom Paris (Palaiseau, Essonne ; 1878-....) | |
| Jury : | Président / Présidente : Jesse Read |
| Examinateurs / Examinatrices : Jesse Read, Matthieu Latapy, Marc Lelarge, Fragkiskos Malliaros, Vincent Labatut, Marine Le Morvan | |
| Rapporteurs / Rapporteuses : Matthieu Latapy, Marc Lelarge | |
| DOI : | 10.70675/c638d274z701fz475cz9dc8zd27e8721eee9 |
Résumé
L'apprentissage automatique est le domaine des sciences informatiques dont le but est de créer des modèles et des solutions à partir de données sans savoir exactement les instructions qui dirigent intrinsèquement ces modèles. Ce domaine a obtenu des résultats impressionnants mais il est l'objet le sujet d'inquiétudes en raison notamment de l'impossibilité de comprendre et d'auditer les modèles qu'il produit. L'apprentissage automatique interprétable propose une solution à ces inquiétudes en créant des modèles qui sont interprétables de façon inhérante. Cette thèse contribue à l'apprentissage automatique interprétable de deux façons.Tout d'abord, nous étudions les arbres de décision. Il s'agit d'un groupe de méthodes d'apprentissage automatique très connu et qui est interprétable par la façon même dont il est conçu. Cependant, les données réelles sont souvent dynamiques et peu d'algorithmes existent pour maintenir un arbre de décision quand des données peuvent à la fois être ajoutées et supprimées de l'ensemble d'entrainement. Nous proposons un nouvel algorithme nommé FuDyADT pour résoudre ce problème.Ensuite, quand les données sont représentées sous forme de graphe, une technique d'apprentissage automatique très commune, nommée ''embedding'', consiste à projeter les données sur un espace vectoriel. Ce type de méthodes est cependant non-interprétable en général. Nous proposons un nouvel algorithme d'embedding appelé Parfaite, qui est basé sur la factorisation de la matrice de PageRank personnalisé. Cet algorithme est conçu pour que ses résultats soient interprétables.Nous étudions chacun de ces algorithmes sur un plan à la fois théorique et expérimental. Nous montrons que FuDyADT est au minimum comparable aux algorithmes à l'état de l'art dans les conditions habituelles, tout en étant également capable de fonctionner dans des contextes inhabituels comme dans le cas où des données sont supprimés ou dans le cas où certaines des données sont numériques. Quant à Parfaite, il produit des dimensions d'embedding qui sont alignées avec les communautés du graphe, et qui sont donc interprétables.