Détection d’anomalies en temps réel dans un flux vidéo
| Auteur / Autrice : | Fabien Poirier |
| Direction : | Gilles Bernard, Rakia Jaziri |
| Type : | Thèse de doctorat |
| Discipline(s) : | Informatique |
| Date : | Soutenance le 14/09/2023 |
| Etablissement(s) : | Paris 8 |
| Ecole(s) doctorale(s) : | École doctorale Cognition, langage, interaction (Saint-Denis, Seine-Saint-Denis) |
| Partenaire(s) de recherche : | Equipe de recherche : Laboratoire d’Intelligence Artificielle et Sémantique des Données |
| Jury : | Président / Présidente : Pierre Gançarski |
| Examinateurs / Examinatrices : Haytham Elghazel | |
| Rapporteurs / Rapporteuses : Kurosh Madani, Mustapha Lebbah | |
| DOI : | 10.70675/61035c90zc049z4981z9ed4z9634a67dd845 |
Mots clés
Résumé
Cette thèse s’inscrit dans une convention CIFRE entre l’entreprise Othello et le laboratoire LIASD. L’objectif est un système d’intelligence artificielle détectant en temps réel des dangers dans un flux vidéo. Pour y parvenir, une nouvelle approche combinant analyse temporelle et spatiale a été proposée. …/…Plusieurs pistes ont été explorées pour améliorer la détection d’anomalie, en y intégrant la détection d’objets, de la pose humaine et du mouvement. Pour l’explicabilité des résultats, des techniques propres aux images comme les cartes d’activation et de saillance ont été étendues aux vidéos, et une méthode originale a été proposée. …/…L’architecture proposée réalise une classification binaire ou non suivant qu’on veut alerter ou donner la cause. De nombreux modèles de réseaux neuronaux ont été testés, et trois d’entre eux ont été retenus. You Only Looks Once (YOLO) a été employé pour l’analyse spatiale, un Convolutional Recurrent Neuronal Network (CRNN) composé de VGG19 et d’un Gated Recurrent Unit (GRU) pour l’analyse temporelle, et un perceptron multi-couche pour la classification. Ces modèles traitent des données de types différents et peuvent être combinés en parallèle ou en série. Bien que le mode parallèle soit plus rapide, le mode série est généralement plus fiable.Pour entraîner ces modèles, l’apprentissage supervisé a été choisi, et deux jeux de données propriétaires ont été créés. Le premier est consacré à des objets ayant un rôle potentiel dans les anomalies et le second est constitué de vidéos contenant des anomalies ou non. Cette approche permet de traiter à la fois des flux vidéo continus et des vidéos finies, d’où une meilleure flexibilité dans la détection.