Thèse en cours

Modèle de mélange bayésien pour la déconvolution de proportions cellulaires à partir de données transcriptomiques en masse

FR  |  
EN
Auteur / Autrice : Annesh Pal
Direction : Boris HejblumRodolphe Thiebaut
Type : Projet de thèse
Discipline(s) : Santé publique Option Biostatistiques
Date : Inscription en doctorat le 16/10/2023
Etablissement(s) : Bordeaux
Ecole(s) doctorale(s) : École doctorale Sociétés, politique, santé publique (Talence, Gironde ; 2011-....)
Partenaire(s) de recherche : Laboratoire : Bordeaux Population Health Research Center
Equipe de recherche : E10 - Statistics in Systems biology and Translational Medicine_SISTM

Résumé

FR  |  
EN

Titre : Modèle de mélange bayésien pour la déconvolution de proportions cellulaires à partir de données transcriptomiques en masse Problème, objet de la recherche, originalité du travail : Les essais de vaccins de phase précoce se caractérisent par de petites tailles d'échantillons. Cependant, ils présentent de plus en plus de mesures de données moléculaires de haute dimension, révélant les mécanismes d'immunogénicité et la réponse cellulaire sous-jacente déterminant l'effet du vaccin. Nous nous proposons de développer de nouvelles méthodes pour i) inférer l'abondance des populations cellulaires à partir de données transcriptomiques globales, ii) prédire l'imunogénécité du vaccin en fonction de ces prédictions, et iii) évaluer la qualité de ces abondances inférées comme marqueurs de substitution. En utilisant le cadre de la classification adaptative, nous souhaitons proposer une nouvelle méthode adaptative supervisée novatrice pour l'analyse discriminante de données de grande dimension tout en étant robuste à l'apparition de classes non observées dans l'échantillon d'apprentissage. Objectifs & hypothèses : Nous proposerons un nouveau modèle bayésien non-paramétrique pour le clustering de données de comptage. Compte tenu de la redondance de l'information entre les données de transcriptomiques et les données d'abondance cellulaire, une approche supervisée à visée predictive sera proposée. Enfin, nous quantifierons si l'effet d'une intervention peut être médié par ces prédictions. Enfin, nous evaluerons la qualité de marqueur de substitution des prédictions des populations cellulaires ainsi obtenues. Méthodes : En utilisant le cadre de la classification adaptative, nous souhaitons proposer une nouvelle méthode adaptative supervisée novatrice pour l'analyse discriminante de données de haute dimension tout en étant robuste à l'apparition de classes non observées dans l'ensemble d'apprentissage. Les données de RNA-seq étant souvent modélisées avec des distributions binomiales négatives, nous proposerons un modèle de mélange à processus de Dirichlet pour ces distributions. Ce modèle suppose un nombre de classes potentiellement infini (avec un nombre fini de classes non vides), permettant ainsi la découverte de nouvelles classes. Une procédure d'estimation variationnelle sera utilisée pour mitiger l'impact de la grande dimension sur le coût computationnel. Résultats attendus : La méthode proposée comblera les lacunes des méthodes actuellement en pointe pour l'inférence de la proportion de populations cellulaires à partir de l'expression génique. Ce travail sera diffusé dans des articles publiés dans des revues scientifiques internationales avec comité de lecture, et sera accompagné du développement d'un logiciel en R pour assurer son adoption par la communauté scientifique. Étapes opérationnelles et calendrier de la recherche : La première année sera consacrée à une revue de la littérature et à une comparaison approfondie des forces et des faiblesses des méthodoes existantes. La deuxième année se concentrera sur le développement et la mise en œuvre d'une nouvelle approche de classification adaptative bayésienne non-paramétrique. La troisième année, la méthode sera appliquée à la sous-étude immunologique intégrée dans COVERAGE (essai clinique randomisé de phase 3 évaluant plusieurs stratégies de traitement contre la COVID-19), ainsi qu'à PREVACUP (essai clinique randomisé évaluant trois stratégies de vaccination différentes contre Ebola). Insertion du projet dans des collectifs de recherche (nationaux ou internationaux, partenariats, etc.) et rôle du candidat : L'équipe SISTM collabore étroitement avec le Vaccine Research Institute (LabEx), ce qui lui donne un accès précieux aux données générées lors des essais cliniques et des études immunologiques menées par le VRI. De plus, une collaboration active existe avec Lynn Lin sur le développement de méthodes bayésiennes pour l'analyse de données cellulaires à haut débit.