
StageBiologieINRAE
INRAE – Occitanie-Toulouse
France
dimanche 29 novembre 2026
Vous serez accueilli(e) au sein de l’unité MIAT (Mathématique et Informatique Appliqués de Toulouse - 24, Chemin de Borde Rouge 31320 Auzeville-Tolosane) dont les recherches visent à développer de nouvelles méthodes mathématiques, algorithmiques ou informatiques pour améliorer la compréhension des grands mécanismes biologiques ou agronomiques en collaborant avec les équipes de recherche en biologie. Vous serez encadré par Nathalie Vialaneix (INRAE, MIAT, Toulouse) http://www.nathalievialaneix.eu, Christine Gaspin (INRAE, MIAT, Toulouse), Malvina Marku (INRAE, MIAT, Toulouse) et Benjamin Charlier (INRAE, MIAT, Toulouse). Problématique du stage : (merci de vous référer au pdf joint). On s'intéresse aux problèmes d'apprentissage de type « apprentissage de probabilités d'étiquettes » (Label Probability Learning [2]). Dans ce type de problèmes, on cherche à entraîner un prédicteur, Φ, permettant de prédire une variable aléatoire Y (binaire, ∈ {0, 1}) à partir d'une variable aléatoire X (∈ Rd) mais, contrairement au cadre classique, on ne dispose pas d'un échantillon d’apprentissage (xi,yi)i=1,...,n mais d’un ensemble de ≪ sacs ≫ disjoints, (Sj)j=1,...,p pour lesquels on dispose de : la mesure de X pour chacun des éléments du sac : (xi)i∈Sj ; la mesure de la moyenne de Y pour le sac : mj = Σi∈Sj yi, la valeur de yi elle-même restant inconnue. Un cadre un peu plus complexe décrit dans dans [3, 5, 1] considère que la mesure mj est partiellement inconnue (mesurée de manière bruitée), par exemple par contamination mutuelle des échantillons positifs (yi = 1) et des échantillons négatifs (yi = 0), comme dans [3]. L'objectif de ce stage sera d'étudier et/ou implémenter et tester ce cadre d'apprentissage pour l'analyse de données biologiques complexes se présentant sous la forme d'une mesure d'un courant ionique (données de séquençage direct de l'ARN par technologie Nanopore). Travail à effectuer Selon l'appétence de l'étudiant-e recruté-e, le stage pourra consister à réaliser : une synthèse de la bibliographie de ce domaine ; une implémentation d'une ou deux stratégies d'apprentissage ; le test de celle(s)-ci sur des données issues du projet DEMETER (données de séquençage direct de l'ARN par technologie Nanopore). L'objectif de ces tests est d'étudier les modifications de l'ARN et leur implication dans les processus de résistance au stress hydrique chez le tournesol. En savoir plus : focus sur l'épitranscriptomique... Plus de 170 modifications chimiques sont actuellement répertoriées dans les ARN, qui ont un impact sur le fonctionnement des organismes vivants, notamment pour une adaptation rapide aux stress de l'environnement [4]. Le séquençage d'ARN « direct » par la technologie Nanopore constitue une approche prometteuse pour identifier ces modifications. L'approche produit, en effet, des données sous la forme d'un courant ionique influencé par les différents types de modifications. Toutefois, le problème d'apprentissage est très particulier car, la technique de séquençage étant destructive de la molécule d'ARN, il n'existe pas de bases d'apprentissage d'ARN natifs (« naturels ») mais des techniques expérimentales orthogonales permettent d'obtenir une estimation de la probabilité de modification pour chaque position (ou site) des ARN. Le sujet de stage pourrait donner lieu à une poursuite en thèse en statistique / machine learning (financement en cours d'obtention et/ou soutien pour préparer le concours de l'ED MITT). Références [1] Shreyas Havaldar, Navodita Sharma, Shubhi Sareen, Karthikeyan Shanmugam, and Aravindan Raghuveer. Learning from label proportions : bootstrapping supervised learners via belief propagation. Preprint arXiv :2310.08056, 2023. [2] Novi Quadrianto, Alex J. Smola, Tibério S. Caetano, and Quoc V. Le. Estimating labels from label proportions. Journal of Machine Learning Research, 10(82), 2009. [3] Clayton Scott and Jianxin Zhang. Learning from label proportions : A mutual contamination framework. In In Proceedings of 33th Conference on Neural Information Processing Systems (NeurIPS 2020), 2020. [4] Dominik Sordyl, Etienne Boileau, Agata Bernat, Satyabrata Maiti, Sunandan Mukherjee, S. Naeim Moafinejad, Masoud Amiri Farsani, Anastasiya Shavina, Andrea Cappannini, Giada Agostini, Silvestro G. Conticello, Filip Stefaniak, Christoph Dieterich, Elzbieta Purta, and Janusz M. Bujnicki. MODOMICS : a database of RNA modifications and related information. 2025 update and 20th anniversary. Nucleic Acids Research, 54(D1) :D219–D225, 2026. [5] Jianxin Zhang, Yutong Wang, and Clayton Scott. Learning from label proportions by learning with label noise. In In Proceedings of 36th Conference on Neural Information Processing Systems (NeurIPS 2022), 2022.
Source : INRAE · Récupérée le 3 octobre 2026