L'intelligence artificielle pour prédire les réseaux et les phénotypes des plantes
| Auteur / Autrice : | Jean-Baptiste Carluer |
| Direction : | André Mas, Gabriel Krouk |
| Type : | Thèse de doctorat |
| Discipline(s) : | Biostatistique |
| Date : | Soutenance le 18/12/2023 |
| Etablissement(s) : | Université de Montpellier (2022-....) |
| Ecole(s) doctorale(s) : | École doctorale Information, Structures, Systèmes (Montpellier ; 2015-....) |
| Partenaire(s) de recherche : | Laboratoire : Institut Montpelliérain Alexander Grothendieck (Montpellier ; 2003-....) |
| Jury : | Président / Présidente : Andreas Niebel |
| Examinateurs / Examinatrices : Sophie Lèbre, Vincent Ségura | |
| Rapporteurs / Rapporteuses : Véronique Brunaud, Frédérick Garcia | |
| DOI : | 10.70675/61d815ebz74f7z4385za681z815db71f1b01 |
Mots clés
Mots clés contrôlés
Mots clés libres
Résumé
Cette thèse explore l’impact de l’apprentissage automatique, en particulier l’apprentissage supervisé, sur l’avancement de divers domaines de la biologie, avec un accent particulier sur la science des plantes. Dans la première partie de ce travail, un aperçu complet de divers modèles d’apprentissage automatique supervisé est présenté, servant de point d’entrée fondamental dans le domaine de ces méthodes. La deuxième partie se penche sur les applications de ces modèles dans le contexte de la science des plantes.La partie de la thèse consacrée aux applications aborde l’énigme de l’héritabilité manquante. Ce phénomène, mis en lumière par le premier GWAS, concerne les variations phénotypiques inexpliquées qui transcendent les simples modifications génomiques.L’épistasie entre différents loci a émergé comme une explication partielle. Cependant, les modèles statistiques GWAS actuels souffrent de problèmes d’extensibilité et d’une grande sensibilité au taux de fausse découverte (FDR). Pour relever ces défis, la thèse présente Next-Gen GWAS (NGG), une nouvelle approche de modélisation capable d’évaluer plus de 60 milliards de polymorphismes nucléotidiques en quelques heures. La méthode est comparée aux modèles GWAS les plus récents et appliquée à Arabidopsis thaliana, ce qui permet d’obtenir des cartes épistatiques en 2D à la résolution du gène. Les résultats dé-montrent l’efficacité de NGG dans la récupération de l’héritabilité manquante à travers les interactions épistatiques, améliorant ainsi les capacités de prédiction des phénotypes.En outre, la thèse étudie les mécanismes de régulation qui régissent l’expression des gènes,en mettant l’accent sur les interactions des facteurs de transcription (TF). Les TF sont connus pour jouer un rôle important dans la régulation de l’expression des gènes, et leurs interactions sont connues pour façonner les réponses transcriptionnelles génomiques. La thèse propose une approche d’apprentissage automatique utilisant des arbres CART pour prédire les TF influents dans un ensemble de données scRNA-seq provenant des racines d’Arabidopsis thaliana. Cette méthodologie offre un moyen robuste et interprétable de prédire les TF mais est actuellement fortement limitée par les données de validation. Cette thèse souligne principalement l’influence profonde de l’apprentissage automatique super-visé sur la science expérimentale, en mettant en évidence ses contributions au décryptage de phénomènes délicats tels que l’héritabilité manquante et les mécanismes complexes de régulation des gènes.