
Inria – DIRECTION (Centre Inria de l'Université Grenoble Alpes ou Siège (Grenoble ou Paris ))
France
vendredi 11 décembre 2026
4,50 €/h
Type de contrat : Convention de stage Contexte et atouts du poste Le ou la stagiaire sera accueilli(e) au sein de la Mission Défense & Sécurité, créée en 2020 afin de fédérer et de développer les différentes actions d’Inria répondant aux besoins numériques des forces armées et du ministère de l’Intérieur. Le stage se déroulera au sein du pôle de recherche Parole & Audio, sous la direction de Clara Ponchard et Pauline Soutrenon. Le stage porte sur la reconnaissance d’entités nommées dans la parole. La reconnaissance d’entités nommées (Named Entity Recognition, NER) consiste à identifier et à catégoriser automatiquement, dans un contenu linguistique, les mentions correspondant à des entités d’intérêt, telles que des personnes, des lieux, des organisations ou toute autre catégorie définie par un guide d’annotation. L’objectif du projet est de développer des méthodes permettant d’extraire automatiquement ces entités à partir d’enregistrements audio. Deux approches complémentaires seront étudiées : une approche en pipeline, reposant sur une transcription intermédiaire du signal, et une approche de bout en bout, visant à extraire les entités directement à partir du signal audio. Dans l’approche en pipeline, un système de reconnaissance automatique de la parole (Automatic Speech Recognition, ASR) transcrit dans un premier temps le signal audio, puis un modèle de NER identifie et type les entités présentes dans la transcription. Cette architecture permet de s’appuyer sur des systèmes ASR et NER déjà performants et d’utiliser des modèles de NER à typage ouvert, tels que GLiNER, permettant d’intégrer de nouvelles catégories d’entités sans nécessiter un ré-entraînement complet du système. Cette approche présente néanmoins une limite importante : sa dépendance à la qualité de la transcription automatique. Les erreurs produites par le système ASR peuvent se propager à l’étape de reconnaissance des entités. De plus, les sorties ASR diffèrent des données textuelles sur lesquelles les modèles de NER sont généralement entraînés, notamment par une ponctuation absente ou imprécise et par la présence de phénomènes propres à la parole spontanée. Une partie des travaux visera donc à étudier l’impact de ces différences et à améliorer la robustesse des modèles de NER aux sorties de systèmes ASR. En parallèle, une approche de bout en bout sera explorée afin d’identifier les entités nommées directement à partir du signal audio, sans dépendre d’une transcription intermédiaire explicitement produite en amont. Cette approche pourra s’appuyer sur des modèles de parole pré-entraînés sur de grandes quantités de données multilingues, tels que XLSR-53 ou Whisper, et sur des architectures permettant d’assurer conjointement la transcription, la détection et le typage des entités. Des approches récentes telles que WhisperNER constituent notamment une piste intéressante pour permettre l’intégration de nouvelles catégories d’entités tout en exploitant directement les représentations issues du signal de parole. L’approche de bout en bout pourrait permettre de limiter la propagation des erreurs inhérente aux architectures en pipeline et d’exploiter des informations présentes dans le signal acoustique mais absentes de la transcription. Elle soulève cependant d’autres difficultés, notamment la disponibilité plus limitée de données associant directement signal audio et annotations en entités nommées. Mission confiée Le stage comportera plusieurs objectifs : – Réaliser un état de l’art des approches existantes pour l’extraction d’entités nommées à partir de la parole, en étudiant à la fois les architectures en pipeline et les approches de bout en bout ; – Prendre en main et préparer des corpus associant signal audio, transcriptions et annotations en entités nommées, notamment dans un contexte multilingue ; – Mettre en œuvre une première approche en pipeline combinant un système de reconnaissance automatique de la parole (ASR) et un modèle de reconnaissance d’entités nommées (NER) ; – Adapter un modèle de NER à typage ouvert, tel que GLiNER, aux catégories d’entités définies dans le cadre du projet ; – Améliorer la robustesse du système de NER aux sorties ASR, notamment par fine- tuning sur des transcriptions automatiques ou artificiellement bruitées ; – Explorer et mettre en œuvre une approche de bout en bout permettant d’extraire les entités nommées directement à partir du signal audio, en s’appuyant sur des modèles de parole pré-entraînés et des architectures récentes ; – Comparer les approches en pipeline et de bout en bout en termes de performances, de robustesse aux différentes conditions de parole et de capacité de généralisation à différentes langues et catégories d’entités. Le stage comprendra une composante expérimentale importante, incluant la préparation et la manipulation de données audio, l’entraînement et le fine-tuning de modèles, ainsi que l’évaluation et l’an Compétences Solide maîtrise de Python ; · Pratique de bibliothèques et
Source : Inria · Récupérée le 9 octobre 2026