
ThèseSociologieDoctorat.gouv.fr
IRIT : Institut de Recherche en Informatique de Toulouse
Toulouse cedex 4
lundi 16 novembre 2026
MSCA COFUND BEST
L'intégration massive des systèmes d'intelligence artificielle (IA) dans l'industrie et la société exige désormais de contrôler leur adaptation aux humains tout en vérifiant leur alignement avec les normes réglementaires, telles que le Guidance for AI Adoption in Australia ou le EU AI Act. L'évaluation réglementaire de l'IA repose sur une approche fondée sur le risque : plus un système d'IA intervient dans un domaine critique (c'est-à-dire où une ou plusieurs mauvaises décisions peuvent affecter l'autonomie, la sécurité ou la dignité d'une personne), plus les obligations imposées sont strictes. Pour maintenir le contrôle de l'utilisateur, les architectures d'IA déployées dans des contextes à haut risque adoptent de plus en plus le principe de l'humain dans la boucle (human-in-the-loop). Cette approche permet de délimiter précisément quelles tâches peuvent être déléguées à l'IA et quels jugements restent de la responsabilité humaine. L'objectif est alors d'assister l'utilisateur dans l'évaluation de l'IA selon son cas d'usage et de lui fournir des outils pour maintenir sa responsabilité, par exemple via des mécanismes d'explicabilité dans la prise de décision ou des évaluations des biais, discriminations et déviations du modèle déployé. Dans le domaine de la robotique collaborative, une erreur d'un agent de supervision conversationnel d'un robot industriel peut causer de graves dommages matériels, voire des blessures. Une mauvaise interprétation d'une commande vocale ou textuelle peut déclencher un mouvement inattendu du bras robotique. Ce cas illustre la nécessité d'une évaluation rigoureuse des risques liés à la compréhension du langage naturel dans des contextes où la sécurité opérationnelle est primordiale. Les modèles conversationnels tels que ChatGPT, Claude ou Kimi utilisent l'apprentissage par renforcement à partir du feedback humain (RLHF) pour s'aligner sur les attentes des utilisateurs. Cependant, le RLHF présente des vulnérabilités documentées : exploration vers des comportements indésirables ou prohibés, amplification des biais des annotateurs, et instabilité de la fonction de récompense apprise. Les méthodes actuelles d'évaluation des LLM offrent peu de garanties en termes d'explicabilité et de traçabilité de ces mécanismes d'alignement. De même, dans le domaine médical, un agent conversationnel assistant un chirurgien ou un système d'aide à la décision clinique pourrait mal interpréter une instruction orale avec des conséquences pour le patient. Dans le contexte éducatif, une incompréhension de la part d'un agent tutoriel IA pourrait renforcer des connaissances erronées ou prodiguer des conseils inappropriés à un apprenant vulnérable. Cette thèse vise à développer une plateforme d'audit des agents conversationnels combinant des métriques de détection de vulnérabilités calculables et conformes aux exigences réglementaires (AI Act, RGPD), des protocoles d'évaluation sous contrainte budgétaire, et une bibliothèque open-source à destination des développeurs, auditeurs et régulateurs. Elle propose également de nouveaux algorithmes fondés sur l'analyse fine des mécanismes RLHF pour réduire les risques d'exploration nuisible et stabiliser l'alignement des modèles. L'ensemble débouchera sur des recommandations méthodologiques concrètes pour le déploiement sûr d'agents conversationnels dans des domaines critiques tels que la santé, l'éducation et la robotique. École doctorale : EDMITT - Ecole Doctorale Mathématiques, Informatique et Télécommunications de Toulouse Direction : Emmanuelle CLAEYS Financement : MSCA COFUND BEST
Source : Doctorat.gouv.fr · Récupérée le 5 septembre 2026