
StageInformatiqueInria
Inria – DIRECTION (Centre Inria de l'Université Grenoble Alpes ou Siège (Grenoble ou Paris ))
France
vendredi 11 décembre 2026
4,50 €/h
Type de contrat : Convention de stage Contexte et atouts du poste Le ou la stagiaire sera accueilli(e) au sein de la Mission Défense & Sécurité, créée en 2020 afin de fédérer et de développer les différentes actions d’Inria répondant aux besoins numériques des forces armées et du ministère de l’Intérieur. Le stage se déroulera au sein du pôle de recherche Parole & Audio, sous la direction de Clara Ponchard. Il s’inscrit dans la continuité des travaux de l’équipe sur l’identification de la langue. L’identification automatique de la langue consiste à prédire la langue parlée dans un enregistrement de signal audio. Elle a de nombreuses applications, soit en tant que telle pour le routage d’appels téléphoniques, soit comme prétraitement avant une tâche de reconnaissance de la parole. Les systèmes actuels d’identification de la langue reposent généralement sur des représentations latentes de haute dimension, difficilement interprétables. Le score de reconnaissance fourni par ces systèmes constitue une décision globale qui ne permet pas d’identifier directement les indices linguistiques ayant conduit à la prédiction. Afin de répondre à cette limite, les travaux menés dans l’équipe ont conduit au développement d’un système d’identification de la langue fondé sur une approche phonotactique, présentant des performances à l’état de l’art et reposant sur une représentation interprétable des enregistrements (une séquence de phonèmes localisés temporellement) et un calcul du score simple reposant sur les fréquences de chaque n-gramme dans chaque langue1. L’objectif du stage est de poursuivre ces travaux en étendant ce système à deux nouvelles problématiques : l’identification automatique de l’accent et de l’alternance codique (code-switching), c’est-à-dire l’alternance de deux ou plusieurs langues au sein d’une même conversation ou d’un même énoncé. 1 Iradukunda, M., Duroselle, R., & Ponchard, C. (2026). Identification de la langue par modélisation phonotactique de séquences en API. Actes des Journées d’Études sur la Parole (JEP 2026), 665–674. https://doi.org/10.21437/JEP.2026-64 Mission confiée Le stage comprendra une composante expérimentale importante, incluant la préparation et la manipulation de données audio, l’entraînement et le fine-tuning de modèles, ainsi que l’évaluation et l’analyse des systèmes développés. Principales activités Le stage comportera plusieurs objectifs : • Prendre en main le système existant d’identification automatique de la langue et les différents outils sur lesquels il repose ; • Réaliser un état de l’art des approches existantes pour l’identification automatique de l’accent et de l’alternance codique (code-switching) ; • Proposer des pistes d’amélioration des systèmes existants afin d’accroître leur robustesse, notamment lorsque les segments de parole sont de courte durée ou produits dans des conditions acoustiques dégradées ; • Exploiter et préparer des corpus de parole multilingues de grande taille nécessaires à l’entraînement et à l’évaluation des différents systèmes ; • Mettre en œuvre une sélection des approches identifiées et évaluer leurs performances, à la fois en termes de précision et d’interprétabilité ; • Mettre en œuvre le fine-tuning de modèles récents de reconnaissance automatique de phonèmes multilingues, tels que Wav2Vec2Phoneme ou ZIPA. Compétences • Solide maîtrise de Python ; • Pratique de bibliothèques et frameworks d’apprentissage automatique et profond tels que PyTorch, PyTorch Lightning, Keras, Scikit-learn et Transformers (Hugging Face), ou d’outils équivalents ; • Bonne connaissance des méthodes d’apprentissage automatique et d’apprentissage profond ; • Intérêt pour le traitement de la parole et la manipulation de différents types de données (audio, texte, signaux) ; • Intérêt pour les projets interdisciplinaires à l’interface entre informatique et sciences humaines et sociales ; • Bonne maîtrise de l’anglais. Des connaissances en traitement automatique de la parole, en phonétique et/ou en traitement du signal constitueront un plus. Inria, l'institut national de recherche dans les sciences et technologies du numérique, est en appui de l’État pour les stratégies nationales de recherche et d’innovation du numérique en tant qu'Agence de programmes. Inria mène plus de 300 projets de recherche et d’innovation avec ses 3500 scientifiques, ingénieurs et personnels d’appui, en partenariat avec les universités et l’écosystème numérique (entreprises, entrepreneurs, acteurs publics). Ensemble, nous explorons des domaines clés comme l'intelligence artificielle, la cybersécurité, l’informatique quantique, le Cloud, la transformation numérique de la santé, les jumeaux numériques ou encore les technologies numériques pour la défense. Nous construisons des solutions concrètes telles que des logiciels, des startups technologiques, des partenariats avec les entreprises du tissu national et des formations de pointe. Notre objectif : l’impact scientifique, technologique et
Source : Inria · Récupérée le 9 octobre 2026