ACP fonctionnelle pour données de comptage
| Auteur / Autrice : | Nassim Bourarach |
| Direction : | Vincent Rivoirard, Franck Picard |
| Type : | Projet de thèse |
| Discipline(s) : | Sciences |
| Date : | Inscription en doctorat le 01/10/2022 |
| Etablissement(s) : | Université Paris sciences et lettres |
| Ecole(s) doctorale(s) : | Ecole doctorale SDOSE (Paris) |
| Partenaire(s) de recherche : | Laboratoire : Centre de recherche en mathématiques de la décision (Paris) |
| établissement opérateur d'inscription : Université Paris Dauphine-PSL (1968-....) |
Mots clés
Mots clés libres
Résumé
Des avancées récentes en biologie cellulaire et séquençage à haut débit ont rendu possible l'émergence d'une génomique dite en cellules uniques. Il s'agit désormais d'accéder à l'identité moléculaire d'une population de cellules, sur la base des quantifications individuelles de leur génome, transcriptome, épigénome, et protéome. La variabilité intercellulaire des phénomènes moléculaires est soupçonnée de longue date, mais ce n'est que récemment que l'ampleur des variations peut être mesurée de manière fiable. Les défis méthodologiques posés par la génomique en cellule unique sont majeurs : l'exploitation de ce déluge de données ne pourra être réalisé sans un cadre mathématique et computationnel adapté. D'un point de vue méthodologique, nous avons accès à la distribution de l'expression des gènes sur une population entière, une cellule devenant une composante d'une distribution multidimensionnelle complexe. Aussi, cette variabilité inter-cellulaire mesurée nous informe sur les processus biologiques tels que la régulation des gènes, la différentiation et la prise de décision cellulaire. Plus globalement, les données de comptages sont devenues de plus en plus courantes, notamment car beaucoup de systèmes de mesures effectuent des comptages (d'individus, de particules, de séquences). D'un point de vue statistique, l'analyse de comptages en grande dimension pose des problèmes spécifiques, liés par exemple à l'hétéroscédasticité des modèles associés. D'un point de vue pratique, une des difficultés à traiter ce type de données est le manque d'outil de représentation permettant une analyse exploratoire. L'objectif de cette thèse est de proposer un cadre statistique général pour analyser et visualiser les données issues des expériences de séquençage à haut débit en cellules uniques. Ces données sont caractérisées par leur nature discrète (ce sont des comptages de quantification), leur forte dispersion, et la présence importante de données manquantes. De plus, nous nous focalisons sur une composante originale des données de génomique, à savoir leur organisation spatiale le long des chromosomes. Cette organisation crée des dépendances complexes entre les sites voisins, que nous proposons de modéliser dans un cadre fonctionnel adapté. L'objectif est donc de développer un cadre fonctionnel non-paramétrique pour modéliser ces observations, dans un premier temps comme des courbes unidimensionelles le long du génome.