Thèse en cours

ACP fonctionnelle pour données de comptage

FR  |  
EN
Auteur / Autrice : Nassim Bourarach
Direction : Vincent RivoirardFranck Picard
Type : Projet de thèse
Discipline(s) : Sciences
Date : Inscription en doctorat le 01/10/2022
Etablissement(s) : Université Paris sciences et lettres
Ecole(s) doctorale(s) : Ecole doctorale SDOSE (Paris)
Partenaire(s) de recherche : Laboratoire : Centre de recherche en mathématiques de la décision (Paris)
établissement opérateur d'inscription : Université Paris Dauphine-PSL (1968-....)

Mots clés

FR  |  
EN

Résumé

FR  |  
EN

Des avancées récentes en biologie cellulaire et séquençage à haut débit ont rendu possible l'émergence d'une génomique dite en cellules uniques. Il s'agit désormais d'accéder à l'identité moléculaire d'une population de cellules, sur la base des quantifications individuelles de leur génome, transcriptome, épigénome, et protéome. La variabilité intercellulaire des phénomènes moléculaires est soupçonnée de longue date, mais ce n'est que récemment que l'ampleur des variations peut être mesurée de manière fiable. Les défis méthodologiques posés par la génomique en cellule unique sont majeurs : l'exploitation de ce déluge de données ne pourra être réalisé sans un cadre mathématique et computationnel adapté. D'un point de vue méthodologique, nous avons accès à la distribution de l'expression des gènes sur une population entière, une cellule devenant une composante d'une distribution multidimensionnelle complexe. Aussi, cette variabilité inter-cellulaire mesurée nous informe sur les processus biologiques tels que la régulation des gènes, la différentiation et la prise de décision cellulaire. Plus globalement, les données de comptages sont devenues de plus en plus courantes, notamment car beaucoup de systèmes de mesures effectuent des comptages (d'individus, de particules, de séquences). D'un point de vue statistique, l'analyse de comptages en grande dimension pose des problèmes spécifiques, liés par exemple à l'hétéroscédasticité des modèles associés. D'un point de vue pratique, une des difficultés à traiter ce type de données est le manque d'outil de représentation permettant une analyse exploratoire. L'objectif de cette thèse est de proposer un cadre statistique général pour analyser et visualiser les données issues des expériences de séquençage à haut débit en cellules uniques. Ces données sont caractérisées par leur nature discrète (ce sont des comptages de quantification), leur forte dispersion, et la présence importante de données manquantes. De plus, nous nous focalisons sur une composante originale des données de génomique, à savoir leur organisation spatiale le long des chromosomes. Cette organisation crée des dépendances complexes entre les sites voisins, que nous proposons de modéliser dans un cadre fonctionnel adapté. L'objectif est donc de développer un cadre fonctionnel non-paramétrique pour modéliser ces observations, dans un premier temps comme des courbes unidimensionelles le long du génome.