Explication de l'apprentissage par renforcement
| Auteur / Autrice : | Léo Saulières |
| Direction : | Florence Dupin de Saint Cyr-Bannay, Martin C. Cooper |
| Type : | Thèse de doctorat |
| Discipline(s) : | Informatique et Télécommunications |
| Date : | Soutenance le 19/12/2024 |
| Etablissement(s) : | Université de Toulouse (2023-2025) |
| Ecole(s) doctorale(s) : | École doctorale Mathématiques, informatique et télécommunications (Toulouse) |
| Partenaire(s) de recherche : | Etablissement de délivrance conjointe : Université Toulouse 3 Paul Sabatier (1969-2024) |
| Laboratoire : Institut de Recherche en Informatique de Toulouse (1995-....) | |
| Jury : | Examinateurs / Examinatrices : Wassila Ouerdane |
| Rapporteurs / Rapporteuses : Frédéric Koriche, Laurent Vercouter | |
| DOI : | 10.70675/ef57c459z3e5bz437czbc31zec8bfff34d87 |
Résumé
S dernières années, les modèles issus de l'Intelligence Artificielle (IA) ont connu une progression impressionnante tant sur la précision de leurs résultats que sur l'amplitude de leurs applications. Cette progression s'explique en partie par l'utilisation de réseaux de neurones permettant de résoudre efficacement diverses tâches en se basant sur un ensemble de données. Les différentes avancées en IA prédictive (par opposition à l'IA analytique qui s'intéresse à la représentation des connaissances et à la formalisation du raisonnement) ont été mises au service de domaines variés comme l'agriculture, la médecine ou encore l'éducation. On remarque également que l'IA prédictive est de plus en plus présente dans notre vie de tous les jours, que cela soit pour de la recommandation de musique avec Spotify, de la génération d'image avec Midjourney ou encore de l'aide à la synthèse de réunion avec Leexi. Cette omniprésence entraîne un questionnement vis-à-vis de la régulation de ces modèles. Avec, entre autres, l'utilisation des réseaux de neurones, les modèles performants s'apparentent à des boîtes noires. L'emploi de ces modèles opaques pour des domaines à risque, tels que la médecine ou les véhicules autonomes, requiert un contrôle spécifique avant la mise à disposition aux utilisateurs. Ainsi, des institutions proposent de réglementer l'IA (par exemple, la Commission Européenne avec l'AI Act). Ces réglementations mettent en avant l'obligation de vérifier, expliquer et analyser les modèles opaques, particulièrement pour les applications à haut risque. De plus, l'utilisateur doit avoir le droit de demander des explications sur la prise de décision d'un modèle, comme le rejet d'attribution d'un prêt par une banque. Ce besoin de transparence a entraîné le développement de l'IA explicable (XAI), à savoir le domaine proposant des méthodes pour rendre les modèles d'IA moins opaque, voire transparent. Nous nous focalisons dans cette thèse sur l'explication d'un type d'IA appelé Apprentissage par Renforcement (RL), qui consiste à apprendre un comportement adéquat dans un environnement au travers d'essais-erreurs. L'agent (ou modèle d'IA) apprend à effectuer, depuis chaque état de l'environnement, une action optimale pour la réalisation d'une tâche spécifique. Cette thèse s'inscrit dans le domaine de l'Apprentissage par Renforcement explicable (XRL), un domaine en pleine expansion qui regroupe les méthodes d'explication du RL. Nos deux contributions majeures concernent la proposition d'une taxonomie originale de l'état de l'art du XRL et la création et l'analyse de 4 méthodes pour le XRL. Notre taxonomie catégorise les différentes méthodes du XRL par rapport à la cible de l'explication et à la manière de l'expliquer. Un nouvel environnement multi-agent de RL, intitulé 'Drone Coverage', a été implémenté pour tester nos méthodes. Celles-ci relèvent de deux catégories différentes selon notre taxonomie. Avec 'Scenario eXplanation' (SXp) et 'Expected States eXplanation' (ESX), nous expliquons l'action d'un agent effectuée depuis un état donné en fournissant des conséquences attendues. SXp résume le futur en 3 séquences d'état-action appelées scénarios. ESX compacte les états que l'agent peut atteindre à un certain horizon en un sous-objectif concis et représentatif. Avec 'History eXplanation based on Predicates' (HXP) et 'Backward-HXP' (B-HXP), nous expliquons une séquence d'état-action de l'agent en fournissant un ensemble d'éléments importants de cette séquence. HXP extrait d'une séquence d'état-action courte, les actions les plus importantes pour la réalisation d'un prédicat défini. A partir d'une séquence d'état-action longue, B-HXP fournit un ensemble de prédicats et actions importantes associées en procédant récursivement depuis la fin de la séquence.