Synthèse et transformation expressive de la voix chantée
| Auteur / Autrice : | Luc Ardaillon |
| Direction : | Axel Roebel |
| Type : | Thèse de doctorat |
| Discipline(s) : | Traitement du signal |
| Date : | Soutenance le 21/11/2017 |
| Etablissement(s) : | Paris 6 |
| Ecole(s) doctorale(s) : | École doctorale Informatique, télécommunications et électronique de Paris (1992-....) |
| Partenaire(s) de recherche : | Institution : Institut de recherche et coordination acoustique musique (Paris) |
| Laboratoire : Analyse et synthèse sonores [Paris] | |
| Jury : | Président / Présidente : Olivier Adam |
| Examinateurs / Examinatrices : Christophe d' Alessandro, Jordi Bonada | |
| Rapporteurs / Rapporteuses : Thierry Dutoit, Nathalie Henrich-Bernardoni | |
| DOI : | 10.70675/7fa9efb3z676dz47dazb819zd86fdb63936d |
Mots clés
Résumé
Le but de cette thèse était de conduire des recherches sur la synthèse et transformation expressive de voix chantée, en vue de pouvoir développer un synthétiseur de haute qualité capable de générer automatiquement un chant naturel et expressif à partir d’une partition et d’un texte donnés. 3 directions de recherches principales peuvent être identifiées: les méthodes de modélisation du signal afin de générer automatiquement une voix intelligible et naturelle à partir d’un texte donné; le contrôle de la synthèse, afin de produire une interprétation d’une partition donnée tout en transmettant une certaine expressivité liée à un style de chant spécifique; la transformation du signal vocal afin de le rendre plus naturel et plus expressif, en faisant varier le timbre en adéquation avec la hauteur, l’intensité et la qualité vocale. Cette thèse apporte diverses contributions dans chacune de ces 3 directions. Tout d’abord, un système de synthèse complet a été développé, basé sur la concaténation de diphones. L’architecture modulaire de ce système permet d’intégrer et de comparer différent modèles de signaux. Ensuite, la question du contrôle est abordée, comprenant la génération automatique de la f0, de l’intensité, et des durées des phonèmes. La modélisation de styles de chant spécifiques a également été abordée par l’apprentissage des variations expressives des paramètres de contrôle modélisés à partir d’enregistrements commerciaux de chanteurs célèbres. Enfin, des investigations sur des transformations expressives du timbre liées à l'intensité et à la raucité vocale ont été menées, en vue d'une intégration future dans notre synthétiseur.