(Semi-)Bandits Linéaires en Grandes Dimensions, Algorithmes Efficaces et Optimalité
| Auteur / Autrice : | Raymond Zhang |
| Direction : | Sheng Yang, Richard Combes |
| Type : | Thèse de doctorat |
| Discipline(s) : | Informatique mathématique |
| Date : | Soutenance le 12/12/2025 |
| Etablissement(s) : | université Paris-Saclay |
| Ecole(s) doctorale(s) : | École doctorale Sciences et technologies de l'information et de la communication (Orsay, Essonne ; 2015-....) |
| Partenaire(s) de recherche : | Laboratoire : Laboratoire des signaux et systèmes (Gif-sur-Yvette, Essonne ; 1974-....) |
| Référent : CentraleSupélec (2015-....) | |
| graduate school : Université Paris-Saclay. Graduate School Informatique et sciences du numérique (2020-….) | |
| Jury : | Président / Présidente : Michèle Wigger |
| Examinateurs / Examinatrices : Émilie Kaufmann, Vianney Perchet, Alan Kevin Jamieson | |
| Rapporteurs / Rapporteuses : Émilie Kaufmann, Vianney Perchet | |
| DOI : | 10.70675/ff75bb4azebe8z4ce5z84aaz072ff7aa4d3d |
Mots clés
Résumé
Dans cette thèse, nous étudions une généralisation du modèle des bandits manchots classique appelée le problème des (semi-)bandits linéaires. Dans ce problème d'apprentissage séquentiel, un apprenant sélectionne, à chaque tour, une action représentée par un vecteur potentiellement de grande dimension. L'apprenant reçoit alors une récompense qui est une fonction linéaire inconnue de l'action choisie, perturbée par du bruit. L'objectif de l'apprenant est de maximiser sa récompense cumulée sur un horizon de temps donné.Nous étudions d'abord un algorithme bayésien appelé Thompson Sampling (TS) dans le cadre des semi-bandits combinatoires linéaires. Nous montrons que lorsque les récompenses sont de Bernoulli, le regret de Thompson Sampling avec une a priori bêta croît exponentiellement avec la dimension. Nous proposons ensuite une modification de l'algorithme pour remédier à ce problème. Cette modification consiste à utiliser une a priori et une postérieure gaussiennes, même si les récompenses ne le sont pas. Ce nouvel algorithme ne présente pas de croissance exponentielle du regret avec la dimension. Nous appelons ce phénomène le « Paradoxe du Mésappariement ».Dans le cadre des bandits linéaires, lorsque l'ensemble des actions est un ellipsoïde, nous établissons une borne inférieure localement asymptotiquement minimax sur le regret de tout algorithme. Nous proposons ensuite un algorithme efficace appelé E2TC, qui est localement asymptotiquement minimax optimal, à une constante multiplicative près. Nous présentons également des résultats d'impossibilité pour le problème d'optimisation bilinéaire que tout algorithme optimiste doit résoudre. Cependant, nous proposons un algorithme efficace pour ce problème lorsque l'ensemble des actions est un ellipsoïde.Enfin, nous étudions une autre extension du problème des bandits manchots dans laquelle plusieurs joueurs sélectionnent chacun un bras à chaque tour ; la récompense de chaque joueur est affectée par la présence des autres joueurs. Nous étudions les limites fondamentales de la communication entre les joueurs, en montrant comment les collisions peuvent être utilisées pour améliorer la performance d'apprentissage de l'ensemble des joueurs.