
StageBiologieINRAE
INRAE – Occitanie-Toulouse
France
dimanche 15 novembre 2026
Vous serez accueilli.e au sein de l’unité MIAT ((Mathématique et Informatique Appliqués de Toulouse - 24, Chemin de Borde Rouge 31320 Auzeville-Tolosane). dans le cadre d'un projet nationale (ANR Pro-k-mer). Le stage sera co-encadré par Benjamin Linard (MIAT, INRAE, Toulouse), spécialisé dans le développement d’algorithmes et d’outils pour l’analyse des génomes et métagénomes, Guillaume Croville (ENVT, INRAE, Toulouse), compétences en virologie vétérinaire, Fabio Pardi et Eric Rivals(LIRMM, CNRS, Montpellier), compétences en phylogénétique. Il impliquera des échanges réguliers, et de potentiels déplacements chez ces partenaires. Le suivi des émergences virales est une activité importante dans le contexte de la santé animale. Il permet de réagir rapidement lorsque qu’une potentielle nouvelle épidémie débute, limitant ainsi les impacts économiques et sociaux associés. Aujourd’hui, le séquençage d’ADN via les technologies de reads longs Nanopore offre la capacité de séquencer très rapidement des échantillons animaux et de repérer des fragments d’ADN associés à un nouveau virus ou un nouveau variant. Cette identification se base sur une analyse taxonomique du virus échantillonné. Elle se fait souvent par des outils bio-informatiques basés sur des k-mers et des algorithmes de classification ; on peut citer les outils Kraken, très utilisé en métagénomique virale. L’analyse fine et phylogénétique du génome échantillonné arrive dans un second temps, souvent après assemblage des reads et plusieurs étapes de contrôle qualité. Les séquences candidates sont introduites dans un arbre de génomes viraux connus, potentiellement datés ou géographiquement localisés. Ces informations supplémentaires permettent d’affiner le scénario d’émergence, et donc les actions à prendre pour limiter son impact. Cette inférence phylogénétique n’est pas applicable directement aux milliers de reads séquencés par le Nanopore, car le coût de calcul associé est trop important. Le « placement » phylogénétique est une méthode alternative compatible avec l’analyse de millions de reads pour un coût de calcul bien inférieur. Elle présente le potentiel d’une analyse bioinformatique fine directement depuis la production des reads viraux, permettant un gain de temps et de réactivité. Les méthodes basées sur les phylo-k-mer, développées dans nos équipes, portent fortement ce potentiel de mise à l’échelle. Le stage s’intéressera au benchmarking des outils de « placement » phylogénétique dans le contexte de la classification taxonomiques des séquences virales. Il s’appuiera sur un pipeline d’évaluation existant, et cherchera à l’étendre sur deux aspects : • La collecte et l’évaluation de la qualité de nombreux arbres phylogénétiques viraux, afin d’établir une liste de genres et espèces virales candidates pour étendre les données d’entrée du benchmark. • L’extension d’une plateforme de benchmarking PEWO, pour pourvoir évaluer la qualité des identification taxonomiques atteignables sur la base de ces données génomiques. Cette étape impliquera le développement de nouvelles métriques pour la comparaison des outils de classification taxonomique testés et l’évaluation de la qualité de l’identification. Le but général du stage est d’évaluer la précision du placement phylogénétique dans un contexte de diversité virale bien plus large. Le stage s’intéressera donc à la fois, premièrement à explorer, compiler et évaluer des données génomiques virales complexes, bruitées et souvent incomplètes du point de vue phylogénétique, et deuxièmement à impliquer une forte composante de développement basée sur Python et le gestionnaire de WorkFlow Snakemake. Objectifs du stage : • Produire une collection de jeu de données virales pour amorcer le benchmark (arbre phylogénétiques issus de bases de données. • Étendre les pipelines d’évaluation pour évaluer la qualité des identifications taxonomiques basées sur le placement phylogénétique et des méthodes de classification supervisées (type Kraken). • Développer de nouveaux critères d’évaluation de la qualité des identifications phylogénétiques produites. • Implémenter les extensions du pipeline via du code python et le gestionnaire de workflow snakemake.
Source : INRAE · Récupérée le 3 octobre 2026