Thèse soutenue

Permutation equivariant and permutation invariant reinforcement learning for multi-agent systems

FR  |  
EN
Auteur / Autrice : Zhuofan Xu
Direction : Matthias Függer, Benedikt Bollig, Thomas Nowak
Type : Thèse de doctorat
Discipline(s) : Informatique
Date : Soutenance le 11/12/2025
Etablissement(s) : université Paris-Saclay
Ecole(s) doctorale(s) : École doctorale Sciences et technologies de l'information et de la communication (Orsay, Essonne ; 2015-....)
Partenaire(s) de recherche : Laboratoire : Laboratoire Méthodes formelles (Gif-sur-Yvette, Essonne ; 2021-....)
Référent : École normale supérieure Paris-Saclay (Gif-sur-Yvette, Essonne ; 1912-....)
graduate school : Université Paris-Saclay. Graduate School Informatique et sciences du numérique (2020-….)
Jury : Examinateurs / Examinatrices : Régis Sabbadin, Alain Dutech, Nicolas Sabouret, Lina Ye, Sergio Mover
Rapporteurs / Rapporteuses : Régis Sabbadin, Alain Dutech
DOI : 10.70675/3bc9621ez4f5cz456ez8734z8561f950297a

Résumé

FR  |  
EN

L'apprentissage par renforcement profond (Deep Reinforcement Learning, DRL) a connu un succès remarquable dans de nombreuses tâches de décision séquentielle, allant des jeux vidéo à la robotique. Son extension aux environnements multi-agents (Multi-Agent Reinforcement Learning, MARL) introduit toutefois des défis supplémentaires : la coordination dans des espaces de grande dimension, l'instabilité de l'entraînement liée à la non-stationnarité, et la difficulté de généraliser les stratégies apprises à des équipes ou tâches variées.Une source majeure d'inefficacité provient de l'absence de prise en compte des symétries structurelles. Dans les systèmes coopératifs, l'ordre des agents n'a pas de signification intrinsèque : permuter les entrées ne devrait pas modifier la nature du problème. Les architectures neuronales classiques n'intègrent généralement pas cette propriété, ce qui entraîne redondance de paramètres, faible efficacité et instabilité.Cette thèse propose des méthodes fondées sur l'intégration explicite de la permutation équivariante (PE) et de la permutation invariante (PI) dans la conception des architectures neuronales pour le MARL. Nous développons de nouveaux réseaux, tels que le Permutation-Equivariant Neural Network (PENN), sa variante invariante IPENN, et les structures Global-Local Permutation Equivariant (GLPE) au cœur du cadre Centralized Permutation Equivariant (CPE). Ces architectures sont intégrées dans des paradigmes établis, notamment l'apprentissage centralisé avec exécution décentralisée (CTDE), les méthodes de décomposition de valeur (QMIX, QPLEX) et les algorithmes acteur-critique (MAPPO).Les approches proposées sont évaluées sur un large éventail de bancs d'essai, depuis des environnements simplifiés comme les Multi-Armed Bandits (MAB) jusqu'à des cadres coopératifs complexes tels que Combat, SMAC, RWARE et MPE. Les résultats montrent des gains significatifs en stabilité, efficacité et performance finale.Enfin, des pistes exploratoires sont étudiées. Elles portent sur de nouvelles structures équivariantes, comprenant des mécanismes d'attention, des structures stables par permutation et des variantes inspirées de la transformée de Fourier, ainsi que sur des stratégies d'apprentissage complémentaires comme le curriculum learning et l'auto-jeu. Ces travaux mettent en évidence le potentiel des architectures sensibles aux symétries pour un apprentissage multi-agents plus scalable et interprétable.