Agrégation de modèles en apprentissage statistique pour l'estimation de la densité et la classification multiclasse
| Auteur / Autrice : | Mathias Bourel |
| Direction : | Badih Ghattas |
| Type : | Thèse de doctorat |
| Discipline(s) : | Mathématiques |
| Date : | Soutenance le 31/10/2013 |
| Etablissement(s) : | Aix-Marseille |
| Ecole(s) doctorale(s) : | École Doctorale Mathématiques et Informatique de Marseille (Marseille) |
| Jury : | Président / Présidente : Christophe Pouet |
| Examinateurs / Examinatrices : Fabrice Gamboa, Denis Allard, Ricardo Fraiman | |
| Rapporteurs / Rapporteuses : Christophe Biemacki, Gonzalo Perera | |
| DOI : | 10.70675/ae579416z3b4fz4fc7z89a3z5878e563f532 |
Mots clés
Résumé
Les méthodes d'agrégation en apprentissage statistique combinent plusieurs prédicteurs intermédiaires construits à partir du même jeu de données dans le but d'obtenir un prédicteur plus stable avec une meilleure performance. Celles-ci ont été amplement étudiées et ont données lieu à plusieurs travaux, théoriques et empiriques dans plusieurs contextes, supervisés et non supervisés. Dans ce travail nous nous intéressons dans un premier temps à l'apport de ces méthodes au problème de l'estimation de la densité. Nous proposons plusieurs estimateurs simples obtenus comme combinaisons linéaires d'histogrammes. La principale différence entre ceux-ci est quant à la nature de l'aléatoire introduite à chaque étape de l'agrégation. Nous comparons ces techniques à d'autres approches similaires et aux estimateurs classiques sur un choix varié de modèles, et nous démontrons les propriétés asymptotiques pour un de ces algorithmes (Random Averaged Shifted Histogram). Une seconde partie est consacrée aux extensions du Boosting pour le cas multiclasse. Nous proposons un nouvel algorithme (Adaboost.BG) qui fournit un classifieur final en se basant sur un calcul d'erreur qui prend en compte la marge individuelle de chaque modèle introduit dans l'agrégation. Nous comparons cette méthode à d'autres algorithmes sur plusieurs jeu de données artificiels classiques.