Thèse soutenue

Avancées en apprentissage auto-supervisé : applications aux neurosciences et efficacité statistique

FR  |  
EN
Auteur / Autrice : L'Émir Omar Chéhab
Direction : Alexandre GramfortAapo Hyvärinen
Type : Thèse de doctorat
Discipline(s) : Informatique mathématique
Date : Soutenance le 24/11/2023
Etablissement(s) : université Paris-Saclay
Ecole(s) doctorale(s) : École doctorale Sciences et technologies de l'information et de la communication (Orsay, Essonne ; 2015-....)
Partenaire(s) de recherche : Laboratoire : Institut national de recherche en informatique et en automatique (France). Unité de recherche (Saclay, Ile-de-France)
Référent : Université Paris-Saclay. Faculté des sciences d’Orsay (Essonne ; 2020-....)
graduate school : Université Paris-Saclay. Graduate School Informatique et sciences du numérique (2020-….)
Jury : Président / Présidente : Nicolas Chopin
Examinateurs / Examinatrices : Patrick Gallinari, Anna Korba, Lauri Parkkonen
Rapporteurs / Rapporteuses : Patrick Gallinari, Michael Gutmann
DOI : 10.70675/23fd9b0dzeca2z4b4dzbdbdz5da8dd23c44c

Résumé

FR  |  
EN

L'apprentissage auto-supervisé a gagné en popularité en tant que méthode d'apprentissage à partir de données non annotées. Il s'agit essentiellement de créer puis de résoudre un problème de prédiction qui utilise les données; par exemple, de retrouver l'ordre de données qui ont été mélangées. Ces dernières années, cette approche a été utilisée avec succès pour entraîner des réseaux de neurones qui extraient des représentations utiles des données, le tout sans aucune annotation. Cependant, notre compréhension de ce qui est appris et de la qualité de cet apprentissage est limitée. Ce document éclaire ces deux aspects de l'apprentissage auto-supervisé.Empiriquement, nous évaluons ce qui est appris en résolvant des tâches auto-supervisés. Nous spécialisons des tâches de prédiction lorsque les données sont des enregistrements d'activité cérébrale, par magnétoencéphalographie (MEG) ou électroencephalographie (EEG). Ces tâches partagent un objectif commun: reconnaître la structure temporelle dans les ondes cérébrales. Nos résultats montrent que les représentations apprises en résolvant ces tâches-là comprennent des informations neurophysiologiques, cognitives et cliniques, interprétables.Théoriquement, nous explorons également la question de la qualité de l'appretissage, spécifiquement pour les tâches de prédiction qui peuvent s'écrire comme un problème de classification binaire. Nous poursuivons une trâme de recherche qui utilise des problèmes de classification binaire pour faire de l'inférence statistique, alors que cela peut nécessiter de sacrifier une notion d'efficacité statistique pour une autre notion d'efficacité computationnelle. Nos contributions visent à améliorer l'efficacité statistique. Nous analysons théoriquement l'erreur d'estimation statistique et trouvons des situations lorsque qu'elle peut rigoureusement être réduite. Spécifiquement, nous caractérisons des hyperparametres optimaux de la tâche de classification binaire et prouvons également que la populaire heuristique de ''recuit'' peut rendre l'estimation plus efficace, même en grandes dimensions.