Doctorat.gouv.fr
Institut de Recherche en Horticulture et Semences
Beaucouzé
jeudi 31 décembre 2026
Rémunération dédiée à la préparation du doctorat
L’accès à de vastes jeux de données végétales hétérogènes pose de nombreuses questions dont : 1. Identifier les individus : aider les systématiciens à résoudre les ambiguïtés de dénomination des taxons entre différents référentiels, voire en l’absence de référentiel. 2. Consolider le vocabulaire : proposer une méthode automatisable pour rapprocher les termes utilisés dans des jeux de données différents afin de décrire mesures et modalités de variables qualitatives. 3. Intégrer les données : traiter conjointement des données provenant de différentes échelles (spatiales, temporelles ou liées au contexte expérimental) en mettant en correspondance individus et variables similaires, tout en prenant en compte les différences de contexte grâce à des transformations mathématiques ou statistiques appropriées. Nous faisons l’hypothèse que la combinaison d’ontologies, de référentiels, et de méthodes d’intelligence artificielle appliquées aux problèmes sous-jacents (reconnaissance et classification d’entités nommées ou alignement d’ontologies, etc.) peuvent permettre de répondre à ces questions et aider les biologistes à mieux comprendre les jeux de données. Dans les domaines des études agronomiques et de la biodiversité (sauvage ou cultivée), de nombreuses publications montrent l’importance de l’intégration et de la normalisation de données (à l’exemple des données d’occurrence du GBIF, normalisées autour du triplet « nom, lieu, date », sources de milliers d’études – cf https://doi.org/10.1073/pnas.2018093118) mais aussi les besoins d’indicateurs de références (exemples :https://doi.org/10.1111/brv.12852) et l’hétérogénéité des données (dans le cas de la biodiversité : https://doi.org/10.1371/journal.pbio.3000183). Des outils d’agrégation ont été développés pour divers groupes de plantes et dans divers contextes (génomique du bananier :https://doi.org/10.1093/database/bat035, annotation sémantique de publications en agronomie :https://doi.org/10.1016/j.atech.2024.100484). Mais ces outils restent limités en termes de diversité de données, restent focalisés sur certains organismes et au final manquent de généricité. Ils ne ciblent pas non plus les problèmes de nommage. La question de la reconnaissance d’entités nommées est un problème classique en traitement automatique des langues, ciblé au sein des LLM actuels (https://doi.org/10.1109/TKDE.2020.2981314). Leur usage pour aider à désambiguïser les noms de taxons serait une application originale. De même, l’alignement d’ontologies et l’enrichissement ontologique font l’objet de recherches depuis les débuts du Web sémantique et se voient aujourd’hui assistés par des approches d’IA Générative (https://doi.org/10.1016/j.inffus.2025.103254, https://doi.org/10.1016/j.jbi.2025.104865), dont la combinaison et le domaine applicatif seraient là aussi originaux. Enfin, l’approche envisagée pour aborder l’intégration de données s’appuiera sur les travaux menés dans le cadre du projet DIVIS, qui sont elles-aussi innovantes. Le travail de thèse s’organisera autour des 3 questions scientifiques évoquées précédemment : 1. L’identification des individus sur lesquels sont acquises les données. Inventaire des sources taxonomiques, proposition d’une méthodologie pour identifier les différences d’interprétation et lever les ambiguïtés. Développement d’un outil informatique mettant en œuvre la méthode proposée. 2. La consolidation du vocabulaire. Inventaire des ontologies pertinentes et alignement entre ontologies, proposition d’une méthode de mise en correspondance de vocabulaire complémentaire et implantation logicielle. 3. L’intégration de données en tant que telle. Appropriation de l’existant développé dans le cadre du projet DIVIS, étendue de la méthode au cas de l’intégration de jeux de données multiples et inclusion au sein du prototype existant. Les travaux seront appliqués au genre Rosa, plante modèle pour l’équipe GDO qui dispose d’une expertise et corpus documentaire importants à son sujet, ainsi qu'à des jeux de données d'intérêt pour le Centre Horticole d'Agadir. La méthode de travail consistera dans un premier temps dans une comparaison bibliographique et analyse du code de différents outils dont l’objectif semble correspondre au besoin, en particulier dans le domaine du traitement automatique de la langue naturelle et analyse sémantique (reconnaissance et classification d’entités nommées, désambiguïsation d’entités nommées ou alignement d’ontologies, etc.). Il s’agit alors de proposer une adaptation ou un re-codage pour répondre aux objectifs du projet. Ces travaux seront suivis par des activités d’analyse de sensitivité, études d’optimisation, simulation des scénarii, et validation. Pour les calculs les plus lourds et chronophages, la grille GliCID sera utilisée. En
Source : Doctorat.gouv.fr · Récupérée le 27 septembre 2026