Thèse soutenue

De l'acquisition à la représentation et à la production : modélisation computationnelle multi-échelle de la parole

FR  |  
EN
Auteur / Autrice : Xiaodan Chen
Direction : Mathias QuoyAlexandre PittiNancy F. Chen
Type : Thèse de doctorat
Discipline(s) : Sciences et Technologies de l'Information et de la Communication
Date : Soutenance le 27/02/2026
Etablissement(s) : CY Cergy Paris Université
Ecole(s) doctorale(s) : École doctorale Économie, Management, Mathématiques, Physique et Sciences Informatiques (Cergy-Pontoise, Val d'Oise)
Partenaire(s) de recherche : Laboratoire : Equipes Traitement de l'Information et Systèmes (Cergy-Pontoise, Val d'Oise ; 2002-....)
Agence de recherche : Institute for infocomm research (Singapour ; 2002-....)
Jury : Président / Présidente : Christian Dan Vodislav
Examinateurs / Examinatrices : Mathias Quoy, Alexandre Pitti, Nancy F. Chen, Nicolas Rougier, Bahia Guellaï, Rong Tong
Rapporteurs / Rapporteuses : Nicolas Rougier, Bahia Guellaï
DOI : 10.70675/0b19ebffz27c9z4d7cz8faeza618b656bd93

Résumé

FR  |  
EN

Comment le cerveau apprend-il, représente-t-il et produit-il la parole ? Déchiffrer ces principes computationnels constitue un enjeu central tant pour les sciences cognitives que pour l'intelligence artificielle. Cette thèse présente une étude unifiée de cette problématique à travers trois projets interconnectés qui modélisent la hiérarchie du traitement de la parole, partant de l'acquisition des sons de parole jusqu'à la représentation séquentielle structurelle, pour aboutir finalement à la production neuromusculaire de la parole. Le premier projet modélise le développement sensorimoteur précoce. Nous développons un réseau neuronal compact et interprétable simulant l'apprentissage de la parole chez le nourrisson. Le modèle montre comment l'exposition à la langue maternelle façonne la perception auditive de base. Il révèle également le rôle du codage prédictif comme mécanisme d'apprentissage continu pendant la « période critique », permettant l'ajustement aux régularités acoustiques de la langue maternelle tout en préservant la capacité fondamentale à en acquérir d'autres. Ce projet établit les fondements d'une primitive sensorimotrice audio-articulatoire pour les traitements de niveau supérieur. Le deuxième projet examine l'organisation de ces primitives en séquences. Nous proposons un modèle de codage par ordre de rang, inspiré du circuit de Broca, qui démontre une capacité de généralisation proto-syntaxique : robuste aux variations de surface, il reste sensible aux violations de règles abstraites, à l'instar de la réponse neurophysiologique P3b observée face à des nouveautés structurelles. Ce travail met en lumière un lien développemental crucial entre l'apprentissage sensorimoteur et l'émergence de la structure phonologique. Le troisième projet applique ce cadre cognitif à un défi d'ingénierie : la pénurie de données pour les modèles de conversion de l'électromyographie vocale en parole (Voiced Electromyography-to-Speech, V-ETS). Nous y introduisons une méthode d'auto-apprentissage multi-locuteurs basée sur la confiance phonémique (Confidence-based Multi-Speaker Self-training, CoM2S). Son innovation principale est un filtre de sélection exploitant les unités distinctives de la langue (les phonèmes) pour identifier des données synthétiques de haute qualité, améliorant ainsi significativement les performances des systèmes V-ETS.Collectivement, ces projets forment une étude hiérarchique de la parole : de l'acquisition des primitives sensorimotrices, à leur organisation en séquences structurées, jusqu'à l'application du phonème comme signal de supervision pour le décodage articulatoire. Ce travail démontre que des représentations ancrées dans la cognition ouvrent la voie à des technologies de la parole plus robustes et économes en données, établissant ainsi une boucle féconde entre les mécanismes cérébraux du langage et la conception de systèmes artificiels.