
ThèseInformatiqueINRAE
INRAE – Occitanie-Toulouse
France
jeudi 5 novembre 2026
Le/la doctorant.e sera recruté·e par le laboratoire INRAE-MIAT à Toulouse et sera rattaché·e à l'axe de recherche Decision-Making Agents (DeCA), un environnement pluridisciplinaire combinant intelligence artificielle, économie et approche par simulation pour modéliser la prise de décision dans les systèmes socio-agro-environnementaux. La thèse sera co-encadrée par Meritxell Vinyals (CR@INRAE) et Régis Sabbadin (DR@INRAE, HDR), qui disposent tous deux d'une solide expérience dans les modèles formels et les algorithmes d'aide à la décision. L'équipe d'encadrement comprend également Léo Saulières (CR@INRAE), qui apportera son expertise en apprentissage par renforcement et explicabilité. L'apprentissage par renforcement (RL) est largement considéré comme le paradigme du machine learning qui reflète le plus fidèlement l'apprentissage humain : un agent artificiel y apprend à maximiser une récompense cumulée en interagissant avec son environnement, en équilibrant continuellement exploration et exploitation. Néanmoins, malgré des avancées considérables — comme les agents de RL profond atteignant des performances surhumaines dans des jeux complexes —, les agents de RL restent en retrait par rapport aux humains dans de nombreuses capacités d'apprentissage critiques, notamment la généralisation, l'efficacité échantillonnelle et le transfert d'apprentissage. Cela soulève une question fondamentale et encore non résolue : par quels mécanismes les humains parviennent-ils à apprendre à agir aussi efficacement à partir d'un nombre minimal d'expériences ? Des études récentes en sciences cognitives sociales attribuent ce succès à la capacité très développée des humains pour l'apprentissage social. Ce projet de thèse se concentre plus particulièrement sur l'apprentissage observationnel, un mécanisme d'apprentissage social central largement utilisé par plusieurs espèces intelligentes, dont l'humain, dans lequel un apprenant acquiert des connaissances en observant d'autres individus interagir avec l'environnement. L'apprentissage par renforcement observationnel (ORL) a émergé récemment comme un domaine de recherche à l'intersection du RL et de l'apprentissage observationnel (OL). Cependant, les méthodes existantes reposent principalement sur des architectures de RL profond avec des fondements théoriques limités, ce qui restreint l'interprétabilité et la généralisation. Les exceptions à cette tendance se concentrent plutôt sur des cadres plus simples, à savoir le problème du bandit, et ne traitent pas de la complexité accrue de la prise de décision séquentielle en RL. Dans ce contexte, l'objectif principal de ce projet de thèse est de développer de nouvelles architectures d'ORL bien fondées, permettant aux agents non seulement d'apprendre de leur propre expérience directe, mais aussi d'exploiter efficacement l'expérience observationnelle — c'est-à-dire l'observation du comportement de leurs pairs —, dans le but de combler l'écart entre les agents de RL artificiels et les apprenants humains. Contrairement aux travaux antérieurs, les architectures proposées s'appuieront à la fois sur des théories cognitives sociales et sur des cadres de prise de décision rigoureux, permettant une caractérisation théorique fondée des méthodes qui en découlent.
Source : INRAE · Récupérée le 6 octobre 2026