Fusion d'informations pour la compréhesion de scènes
| Auteur / Autrice : | Philippe Xu |
| Direction : | Franck Davoine, Thierry Denoeux |
| Type : | Thèse de doctorat |
| Discipline(s) : | Technologies de l'Information et des Systèmes |
| Date : | Soutenance le 28/11/2014 |
| Etablissement(s) : | Compiègne |
| Ecole(s) doctorale(s) : | École doctorale Sciences pour l'ingénieur (Compiègne) |
| Partenaire(s) de recherche : | Laboratoire : Heuristique et Diagnostic des Systèmes Complexes / HEUDIASYC |
| DOI : | 10.70675/5fa07080z5144z4e03zae9cz0062b37efb2c |
Mots clés
Mots clés contrôlés
Résumé
La compréhension d'image est un problème majeur de la robotique moderne, la vision par ordinateur et l'apprentissage automatique. En particulier, dans le cas des systèmes avancés d'aide à la conduite, la compréhension de scènes routières est très importante. Afin de pouvoir reconnaître le grand nombre d’objets pouvant être présents dans la scène, plusieurs capteurs et algorithmes de classification doivent être utilisés. Afin de pouvoir profiter au mieux des méthodes existantes, nous traitons le problème de la compréhension de scènes comme un problème de fusion d'informations. La combinaison d'une grande variété de modules de détection, qui peuvent traiter des classes d'objets différentes et utiliser des représentations distinctes, est faites au niveau d'une image. Nous considérons la compréhension d'image à deux niveaux : la détection d'objets et la segmentation sémantique. La théorie des fonctions de croyance est utilisée afin de modéliser et combiner les sorties de ces modules de détection. Nous mettons l'accent sur la nécessité d'avoir un cadre de fusion suffisamment flexible afin de pouvoir inclure facilement de nouvelles classes d'objets, de nouveaux capteurs et de nouveaux algorithmes de détection d'objets. Dans cette thèse, nous proposons une méthode générale permettant de transformer les sorties d’algorithmes d'apprentissage automatique en fonctions de croyance. Nous étudions, ensuite, la combinaison de détecteurs de piétons en utilisant les données Caltech Pedestrian Detection Benchmark. Enfin, les données du KITTI Vision Benchmark Suite sont utilisées pour valider notre approche dans le cadre d'une fusion multimodale d'informations pour de la segmentation sémantique.