Thèse soutenue

Apprentissage automatique de représentations profondes pour l’analyse du mouvement humain

FR  |  
EN
Auteur / Autrice : Natalia Neverova
Direction : Christian Wolf
Type : Thèse de doctorat
Discipline(s) : Informatique
Date : Soutenance le 08/04/2016
Etablissement(s) : Lyon
Ecole(s) doctorale(s) : École doctorale InfoMaths (Lyon ; 2009-....)
Partenaire(s) de recherche : établissement opérateur d'inscription : Institut national des sciences appliquées (Lyon ; 1957-....)
Laboratoire : Laboratoire d'InfoRmatique en Images et Systèmes d'information (Villeurbanne - Ecully, Rhône ; 2003-....) - Laboratoire d'InfoRmatique en Image et Systèmes d'information / LIRIS
Jury : Président / Présidente : Cordelia Schmid
Examinateurs / Examinatrices : Christian Wolf, Cordelia Schmid, Frédéric Jurie, Jean-Marc Odobez, Atilla Baskurt, Horst Bischof, Graham W. Taylor, Nicolas Thome
Rapporteurs / Rapporteuses : Frédéric Jurie, Jean-Marc Odobez
DOI : 10.70675/a8cda552zdc96z48c1z979bzac140403e58f

Résumé

FR  |  
EN

L'objectif de ce travail est de développer des méthodes avancées d'apprentissage pour l’analyse et l'interprétation automatique du mouvement humain à partir de sources d'information diverses, telles que les images, les vidéos, les cartes de profondeur, les données de type “MoCap” (capture de mouvement), les signaux audio et les données issues de capteurs inertiels. A cet effet, nous proposons plusieurs modèles neuronaux et des algorithmes d’entrainement associés pour l’apprentissage supervisé et semi-supervisé de caractéristiques. Nous proposons des approches de modélisation des dépendances temporelles, et nous montrons leur efficacité sur un ensemble de tâches fondamentales, comprenant la détection, la classification, l’estimation de paramètres et la vérification des utilisateurs (la biométrie). En explorant différentes stratégies de fusion, nous montrons que la fusion des modalités à plusieurs échelles spatiales et temporelles conduit à une augmentation significative des taux de reconnaissance, ce qui permet au modèle de compenser les erreurs des classifieurs individuels et le bruit dans les différents canaux. En outre, la technique proposée assure la robustesse du classifieur face à la perte éventuelle d’un ou de plusieurs canaux. Dans un deuxième temps nous abordons le problème de l’estimation de la posture de la main en présentant une nouvelle méthode de régression à partir d’images de profondeur. Dernièrement, dans le cadre d’un projet séparé (mais lié thématiquement), nous explorons des modèles temporels pour l'authentification automatique des utilisateurs de smartphones à partir de leurs habitudes de tenir, de bouger et de déplacer leurs téléphones. Dans ce contexte, les données sont acquises par des capteurs inertiels embraqués dans les appareils mobiles.