Entraînement des réseaux profonds : complexité, robustesse de la rétropropagation non lisse et algorithmes inertiels
| Auteur / Autrice : | Ryan Boustany |
| Direction : | Jérome Bolte, Edouard Pauwels |
| Type : | Thèse de doctorat |
| Discipline(s) : | Mathématiques appliquées |
| Date : | Soutenance le 31/03/2025 |
| Etablissement(s) : | Université Toulouse Capitole |
| Ecole(s) doctorale(s) : | École doctorale Mathématiques, informatique et télécommunications (Toulouse) |
| Partenaire(s) de recherche : | Laboratoire : TSE-R (Toulouse) |
| DOI : | 10.70675/af67c4ebz6f4bz4ef3za8e5zaeecb9511883 |
Mots clés
Mots clés contrôlés
Mots clés libres
Résumé
L'apprentissage basé sur les réseaux neuronaux repose sur l'utilisation combinée de techniques d'optimisation non convexe de premier ordre, d'approximation par sous-échantillonnage, et de différentiation algorithmique, qui est l'application numérique automatisée du calcul différentiel. Ces méthodes sont fondamentales pour les bibliothèques informatiques modernes telles que TensorFlow, PyTorch et JAX. Cependant, ces bibliothèques utilisent la différentiation algorithmique au-delà de leur cadre primaire sur les opérations différentiables de base. Souvent, les modèles intègrent des fonctions d'activation non différentiables comme ReLU ou des dérivées généralisées pour des objets complexes (solutions à des problèmes de sous-optimisation). Par conséquent, comprendre le comportement de la différentiation algorithmique et son impact sur l'apprentissage est devenu un enjeu clé dans la communauté de l'apprentissage automatique. Pour aborder cela, un nouveau concept de différentiation non lisse, appelé gradients conservatifs, a été développé pour modéliser la différentiation algorithmique non lisse dans les contextes d'apprentissage modernes. Ce concept facilite également la formulation de garanties d'apprentissage et la stabilité des algorithmes dans les réseaux neuronaux profonds tels qu'ils sont pratiquement implémentés.Dans ce contexte, nous proposons deux extensions du calcul conservatif, trouvant une large gamme d'applications dans l'apprentissage automatique. Le premier résultat fournit un modèle simple pour estimer les coûts computationnels des modes backward et forward de la différentiation algorithmique pour une large classe de programmes non lisses. Un deuxième résultat se concentre sur la fiabilité de la différentiation automatique pour les réseaux neuronaux non lisses opérant avec des nombres en virgule flottante. Enfin, nous nous concentrons sur la construction d'un nouvel algorithme d'optimisation exploitant uniquement des informations de second ordre en utilisant la différentiation automatique non lisse non convexe de premier ordre bruitée. Partant d'un système dynamique (une équation différentielle ordinaire), nous construisons INNAprop, dérivé d'une combinaison d'INNA et de RMSprop.