Identification de cibles thérapeutiques à partir de données de séquençage ARN à l'échelle de la cellule unique à l'aide de réseaux de neurones profonds biologiquement interprétables
| Auteur / Autrice : | Charlotte Job |
| Direction : | Blaise Hanczar |
| Type : | Projet de thèse |
| Discipline(s) : | Informatique |
| Date : | Inscription en doctorat le 08/01/2025 |
| Etablissement(s) : | université Paris-Saclay |
| Ecole(s) doctorale(s) : | École doctorale Sciences et technologies de l'information et de la communication |
| Partenaire(s) de recherche : | Laboratoire : IBISC - Informatique, BioInformatique, Systèmes Complexes |
| Equipe de recherche : AROBAS : Algorithmique, Recherche Opérationnelle, Bioinformatique et Apprentissage Statistique | |
| Référent : Université d'Évry Val d'Essonne |
Mots clés
Mots clés libres
Résumé
Ce projet de recherche vise à développer des approches computationnelles pour rendre les réseaux de neurones profonds interprétables dans l'analyse de données transcriptomiques à l'échelle de la cellule unique. L'objectif principal est de permettre l'identification de cibles thérapeutiques innovantes tout en améliorant la compréhension des processus biologiques dérégulés dans les maladies. Pour ce faire, le projet propose deux axes complémentaires : (1) la conception de modèles biologiquement interprétables basés sur des connaissances issues d'ontologies ou d'experts, et (2) le développement de méthodes d'interprétation contrefactuelle pour identifier les gènes critiques influençant les phénotypes cellulaires. Dans une première approche, des autoencodeurs variationnels intégrant des connaissances biologiques (voies de signalisation, interactions protéines-protéines, processus biologiques, etc.) seront développés pour projeter les données dans un espace latent interprétable, facilitant l'analyse de trajectoires et de clustering. Dans une seconde approche, des modèles prédictifs pour des phénotypes tels que le pronostic ou la réponse aux traitements seront analysés à l'aide de techniques d'interprétation contrefactuelle pour identifier des gènes potentiellement modifiables pour influencer les phénotypes. L'innovation du projet réside également dans l'élaboration d'une méthode rigoureuse d'évaluation de l'interprétabilité biologique des modèles, permettant de valider la pertinence des résultats produits et leur capacité à refléter des mécanismes biologiques existants. Le projet sera appliqué sur des données publiques issues de bases telles que TISCH2 et Single Cell Portal, ainsi que sur des données privées du cancer du pancréas dans le cadre du projet interne START Pancréas. Cette démarche intégrée permettra de contribuer à la découverte de nouvelles cibles thérapeutiques et à une meilleure compréhension des pathologies étudiées.