Estimation multimodale du mouvement et de la profondeur basée sur les évènements pour l'analyse de scène
| Auteur / Autrice : | Vincent Brebion |
| Direction : | Franck Davoine, Julien Moreau |
| Type : | Thèse de doctorat |
| Discipline(s) : | Sciences et Technologies de l'Information et des Systèmes : Unité de recherche Heudyasic (UMR-7253) |
| Date : | Soutenance le 11/01/2024 |
| Etablissement(s) : | Compiègne |
| Ecole(s) doctorale(s) : | École doctorale Sciences pour l'ingénieur (Compiègne) |
| Partenaire(s) de recherche : | Laboratoire : Heuristique et Diagnostic des Systèmes Complexes [Compiègne] / Heudiasyc |
| DOI : | 10.70675/7a5d0e4bz24baz4c91zb537z26ffa5fbaf2c |
Mots clés
Mots clés contrôlés
Résumé
Grâce à leurs propriétés uniques en termes d’asynchronisme et d’indépendance aux conditions de luminosités, les caméras à évènements ouvrent aujourd’hui de nouvelles portes dans le monde de la perception. Elles rendent possible l’analyse de scènes hautement dynamiques et avec un éclairage complexe, des situations pour lesquelles les caméras traditionnelles reposant sur des images montrent leurs limites. Dans le cadre de cette thèse, deux tâches de perception bas niveau ont été considérées en particulier, car constituant la fondation de nombreuses tâches de plus haut niveau requises pour l’analyse de scènes : (1) le flot optique et (2) l’estimation de profondeur. En ce qui concerne le flot optique, une approche basée optimisation a été développée, permettant l’estimation de flot optique en temps réel avec une unique caméra à évènements haute définition. Pour cela, de courtes fenêtres temporelles d’évènements sont converties vers une représentation dense basée image, après application d’une étape de débruitage, et d’une densification inversement exponentielle proposée dans le cadre de ce travail. Une méthode de flot optique de l’état de l’art basée images est ensuite appliquée afin de calculer le flot optique final avec une latence basse. Cette approche heuristique permet de fournir des résultats justes, et est à ce jour la seule méthode de flot optique basée évènements capable d’opérer en temps réel avec des caméras à évènements haute définition. Pour ce qui est de l’estimation de profondeur, une méthode basée apprentissage pour de la fusion de données a été proposée, permettant de combiner les informations provenant d’un LiDAR et d’une caméra à évènements afin d’estimer des cartes de profondeur denses. Dans le cadre de ce travail, un réseau de neurones à convolution, appelé ALED, a été proposé. Il est composé de deux branches d’encodage asynchrones pour les nuages de points LiDAR et les évènements, de mémoires centrales où la fusion asynchrone des deux types de données est réalisée, et d’une branche de décodage. En particulier, une nouvelle notion de “deux profondeurs par évènement” a également été proposée, accompagnée d’une analyse théorique sur l’importance fondamentale de cette notion à cause du fait que les évènements soient indicatifs d’un changement. Enfin, un jeu de données enregistré en simulation a également été proposé, contenant des données LiDAR et évènements haute définition, ainsi que des cartes de profondeur servant de vérité terrain. En comparaison avec l’état de l’art, une réduction jusqu’à 61% de l’erreur moyenne a pu être atteinte, démontrant la qualité de notre réseau et des bénéfices apportés par l’utilisation de notre nouveau jeu de données. Une extension de ce travail sur l’estimation de profondeur a également été proposée, utilisant cette fois-ci un réseau de neurones basé attention pour une meilleure modélisation des relations spatiales et temporelles entre les données LiDAR et évènements. Des expérimentations ont été menées dans un premier temps dans l’objectif de proposer un réseau entièrement épars, capable d’associer directement à chaque évènement ses deux profondeurs, sans avoir besoin de passer par des représentations denses. À cause de limitations à la fois théoriques et techniques, une refonte de cette méthode a été proposée, cette fois-ci sur des entrées et sorties denses, afin de pouvoir s’affranchir de ces limitations. Le réseau final proposé dans le cadre de ce travail, DELTA, combine à la fois un aspect récurrent et une approche basée attention. Il est composé de deux branches d’encodage pour les nuages de points LiDAR et les évènements, d’un mécanisme de propagation afin d’être capable d’inférer les données LiDAR a une plus haute fréquence que celle d’entrée, d’une unique mémoire centrale pour la fusion des modalités, et d’une branche de décodage. En comparaison avec ALED, DELTA améliore les résultats pour l’ensemble des métriques considérées.