Thèse soutenue

Propager les incertitudes liées au traitement automatique des données issues de capteurs dans les modèles statistiques en écologie.

FR  |  
EN
Auteur / Autrice : Célian Monchy
Direction : Olivier GimenezMarie-Pierre Étienne
Type : Thèse de doctorat
Discipline(s) : Biologie et écologie évolutives
Date : Soutenance le 25/11/2025
Etablissement(s) : Université de Montpellier (2022-....)
Ecole(s) doctorale(s) : École Doctorale GAIA Biodiversité, agriculture, alimentation, environnement, terre, eau (Montpellier ; 2015-...)
Partenaire(s) de recherche : Laboratoire : Centre d'écologie fonctionnelle et évolutive (Montpellier)
Jury : Président / Présidente : Sébastien Villeger
Examinateurs / Examinatrices : Laura Mannocci
Rapporteurs / Rapporteuses : Damaris Zurell, Nathalie Peyrard
DOI : 10.70675/1994192bz39b6z4023za1b3zcbc382e50089

Résumé

FR  |  
EN

La crise actuelle de la biodiversité constitue un enjeu scientifique majeur, à la fois parce qu’elle impose d’identifier les causes et la responsabilité des sociétés humaines, mais aussi parce qu’elle interroge sur les moyens à mettre en œuvre pour en atténuer les conséquences. À ce titre, les sciences de la conservation se situent à la croisée de la biologie, de l’évolution, des sciences humaines et sociales, mais aussi des statistiques et des sciences de l’information, afin de définir des directions favorables à la protection du vivant et de sa diversité. Identifier les actions pertinentes nécessite de disposer d’indicateurs fiables sur l’état des écosystèmes, des communautés et des populations. Cela repose notamment sur des outils statistiques et de modélisation capables d’exploiter de manière robuste les observations de terrain qui ne reflètent qu’imparfaitement les processus écologiques sous-jacents, une partie échappant à l’observation. Adopter des protocoles rigoureux permet d'améliorer la qualité des données et de relier, par des modèles statistiques, les observations aux phénomènes réels. Dans ce contexte, l’utilisation de capteurs tels que les pièges photographiques ou les enregistreurs acoustiques s’impose comme une stratégie efficace pour optimiser la collecte de données à grande échelle. Leur déploiement permet de détecter des espèces rares ou cryptiques, d’analyser leur comportement ou encore d’estimer leur distribution. Le suivi par capteurs a l’avantage d’être passif et non-invasif, puisque l’enregistrement est autonome et ne nécessite qu'une intervention humaine ponctuelle, sans manipulation des animaux. Toutefois, la masse considérable de données ainsi générées soulève des défis en matière de traitement. L’apprentissage profond, et en particulier les réseaux de neurones convolutifs (CNN), offre des solutions performantes pour extraire une information pertinente de ces données massives, en classant les enregistrements selon l’espèce, l’individu, l’activité ou d’autres catégories pertinentes. Si leurs performances rivalisent souvent avec celles d’un observateur humain, certaines tâches restent sujettes à des erreurs de prédictions. Ma thèse porte sur la propagation de ces incertitudes lorsque les prédictions issues des CNN sont utilisées comme données d’entrée dans des modèles écologiques destinés à quantifier des paramètres de biodiversité. Je propose des approches probabilistes permettant de prendre en compte ces incertitudes, afin d’éviter des inférences écologiques biaisées. À partir d’études de simulations et de deux études de cas, je développe trois contributions principales : (1) l’utilisation des scores de confiance fournis par les CNN pour adapter une méthode classique de propagation d’incertitudes, les simulations de Monte Carlo ; (2) l’intégration des connaissances sur la performance du classifieur pour informer les paramètres d’identification dans un modèle hiérarchique bayésien ; (3) l’inclusion directe, dans un modèle d’occupation, de représentations réduites des données extraites par CNN. Ces approches permettent de mieux comprendre l’influence des incertitudes sur les inférences écologiques, et soulignent l’importance de disposer de mesures fiables et interprétables des erreurs issues des outils de classification automatique. Ce travail met en évidence la nécessité de faire évoluer les modèles écologiques afin qu'ils tiennent compte de la complexité des données d’entrée, au-delà d’une simple information binaire de présence-absence, en mobilisant les savoirs croisés de l’informatique et de l’écologie au sein d’une communauté interdisciplinaire. Enfin, il met en perspective les avancées constantes de l’électronique et de l’intelligence artificielle, dont l’utilisation dans les sciences de la conservation doit continuer d’être interrogée à l’aune de leur contribution à la production de connaissances scientifiques et, en définitive, à la protection de la biodiversité.