
PosteInformatiqueInria
Inria – DCIS-IES (Le Chesnay)
France
lundi 30 novembre 2026
Selon le barème statutaire de la fonction publique, les diplômes et le niveau d'expérience.
Type de contrat : CDD Contexte et atouts du poste Le service Information et Édition Scientifiques (IES) relève de la Direction de la culture et de l’information scientifiques (DCIS) – elle-même rattachée à la Direction générale déléguée à la science (DGD-S). Il assure le soutien des activités scientifiques, en s’appuyant sur six pôles d’activités : Acquisitions numériques Archives ouvertes Edition scientifique IES pour la Médiation scientifique Services à l’usager Données de la recherche. Ce poste est positionné au sein de la DCIS et sera encadré par Alain Monteil et Kumar Guha Dans le cadre du projet AIKO (AI for scientists: publication KnOwledge), piloté par Inria dans sa mission d’Agence de programmes et le CIRAD, nous recrutons pour une durée d’un an, un/e expert/e en en ingénierie des systèmes d’information et réseaux. Ce poste est centré sur les communs logiciels et les outils opérationnels à déployer dans les établissements, pour alimenter une infrastructure de recherche sur les publications scientifiques. Cette mission devra se poursuivre dans le cadre d’une collaboration avec l’INIST-CNRS. Mission confiée Reprendre la chaine de traitement existante qui moissonne les publications déposées sur HAL pour en faire des versions TEI normalisées avec l’Outil GROBID et les traitements avec les applications comme SoftCite, Biblio-Glouton et Datastet comme enrichissement. Il faudra mener une opération de reprise de codes développés lors de précédents projets pour en assurer la pérennité et la portabilité au sein de l’infrastructure ISTEX. Analyser des sources internes et externes pertinentes pour le projet : analyse du contenu, de la qualité des données, du potentiel d’enrichissement de la base HAL, des modalités de cet enrichissement. Le candidat aura à animer les personnes impliquées dans le projet (INRIA et INIST-CNRS) et devra agir avec une certaine autonomie rapidement. Enfin il/elle devra prendre en compte le passage en production à large échelle et volumétrie (processus en parallèle, etc.). Principales activités • Production de versions nettoyées (sérialisation, tokenisation, filtrage par langue) pour fournir des corpus directement utilisables pour l’entraînement de LLMs et autres modèles d’IA. Une collaboration devra se mettre en place avec le DFKI (Sarrebruck, DE) qui a déjà travaillé sur les outils correspondants (https://github.com/scilons) pour des contenus issus de Unpaywall ; • Mise en place d’une base bibliographique de citations désambiguïsées sur la base de l’outil biblio-glutton (https://github.com/kermitt2/biblio-glutton) qui combine les références bibliographiques sur la base des informations issues du portail CrossRef, mais aussi des entrées de HAL. Ce travail peut servir de base pour créer un graphe de citation solide à la disposition de la communauté scientifique ; • Repérage de sections spécifiques dans les documents, comme par exemple les financeurs dans le cadre des travaux déjà menés par le CCSD et qui pourront permettre d’expérimenter par exemple les tendances scientifiques liées aux financements ANR • Repérage massif des mentions faites à des logiciels et des jeux de données, sur la base des composants open source SoftCite et Datastet, déjà utilisés pour le baromètre de la science ouverte. Ces données serviront directement aux travaux des scientifiques. Compétences Savoir : • Backend Developer expérimenté(e) • Expérience avec un langage backend (Python, Node.js, Java, etc.). • Connaissance des protocoles HTTP et des API REST • COAR Notify (protocole de notification entre entrepôts). • OAI-PMH (Open Archives Initiative Protocol for Metadata Harvesting). • Protocoles d'interopérabilité (ex : SWORD, OAI-ORE). • La connaissance du protocole S3 (Simple Storage Service) serait un plus. • La conception et l'optimisation de bases de données type ArangoDB ou similaire. • Expérience avec ArangoDB (AQL, indexation). • La conteneurisation des applications avec Docker. • Maîtrise de Docker (Dockerfile, Docker Compose). • Le déploiement et la maintenance d'environnements cloud. • Maîtrise de XML et XML-TEI et des normes associées. • Machine learning • Grand Modèle de Langage (LLM) • Connaissance en architecture réseau et virtualisation ? • Connaissances en modèles et standards pour la représentation de données bibliographiques et/ou textuelles. • Maîtrise d’un ou plusieurs langages de programmation permettant la manipulation de données (Python, R, XSLT) • Maîtrise de l’anglais écrit, et si possible oral. • Méthodologie de conduite de projet en particulier en mode AGILE Savoir Faire • Appliquer les techniques du domaine • Rédiger des contenus adaptés aux publics • Utiliser les logiciels spécifiques à l'activité • Utiliser les outils bureautiques • Communiquer et faire preuve de pédagogie Savoir être • Faire preuve de rigueur et de méthode • Avoir l’esprit d’équipe • Avoir le sens de la communication • Avoir un bon esprit d’analyse • Faire preuve de curiosité Inria, l'institut national
Source : Inria · Récupérée le 7 octobre 2026