Stage Conception et validation d’un modèle sémantique interopérable pour les études en métabolomique

 Stage · Stage M2  · 6 mois    Bac+5 / Master   INRAE, UR1268, Biopolymères Interactions Assemblages (BIA) · Nantes (France)

 Date de prise de poste : 15 janvier 2027

Mots-Clés

modèle de données sémantique metabolomique ontologies

Description

Contexte

Les graphes de connaissances revêtent une importance capitale pour l’intégration des données et des connaissances dans le respect des principes FAIR. Les modèles conceptuels sur lesquels ils s’appuient sont définis par des ontologies qui constituent la couche de raisonnement du Web sémantique géré au niveau international par le consortium W3C. Dans ce contexte, le projet européen ELIXIR RCI-M s’inscrit dans la feuille de route ELIXIR 2024–2028 et vise à améliorer la reproductibilité, la comparabilité, l’interopérabilité et l’intégration des données de métabolomique. Il s’appuie notamment sur des ressources telles que MetaboLights, WorkflowHub et Galaxy, ainsi que sur des standards et vocabulaires comme ISA, MSIO, Bioschemas et PSI-MS.
Dans ce contexte, le projet a permis de produire une première version consolidée d’un modèle sémantique pour les données de métabolomique s’appuyant sur le standard ISA utilisé dans Metabolights. Cette version est centrée sur deux composants prioritaires : les échantillons biologiques et une technologie analytique, la chromatographie. Le stage proposé vise à poursuivre ce travail en transformant ce cadre conceptuel en un modèle formel, documenté et évalué sur des études métabolomiques réelles.

Objectifs

L’objectif principal est de concevoir, implémenter et valider une première version exploitable du modèle sémantique de données métabolomiques s’appuyant sur des ontologies conformes aux standards du W3C comme SOSA et PROV-O et sur les ontologies de la communauté OBO. Le ou la stagiaire devra notamment :
· Analyser les besoins de représentation des études métabolomiques ;
· Étudier plusieurs études publiques de MetaboLights ;
· Consolider le modèle conceptuel issu de du projet ELIXIR ;
· Formaliser les concepts et relations dans Protégé ;
· Documenter les alignements entre ISA, SOSA et PROV-O ;
· Représenter les échantillons biologiques, procédures, systèmes et observations chromatographiques ;
· Relier les descripteurs des échantillons biologiques à des vocabulaires contrôlés ;
· Définir des questions en langage naturel et les transcrire en langage SPARQL ;
· Évaluer le modèle sur des jeux de données réels ;

Missions

Le stage sera organisé autour des activités suivantes :
· Analyse bibliographique et technique sur les ontologies et standards de métadonnées scientifiques.
· Analyse de la version M5.11 et des documents associés aux biosamples et à la chromatographie.
· Étude de la structure ISA de plusieurs études MetaboLights.
· Identification des correspondances entre ISA, SOSA, PROV-O, BFO et les vocabulaires pertinents pour décrire les métadonnées associées aux échantillons biologiques.
· Conception d’un modèle conceptuel consolidé.
· Implémentation du modèle en OWL/RDF dans Protégé.
· Création d’exemples d’instances représentant des études, biosamples, assays, procédures et observations.
· Définition de contraintes SHACL, si pertinent.
· Écriture de requêtes SPARQL illustrant l’interrogation du modèle.
· Évaluation de la couverture, de la cohérence et de l’interopérabilité.
· Documentation des choix de modélisation et des difficultés rencontrées.

Périmètre scientifique

Le périmètre d’étude portera sur :
· les études et essais analytiques de MetaboLights (Study, Assay);
· Les échantillons biologiques et leurs descripteurs (Biosamples) ;
· Les relations entre étude, échantillon, essais analytiques, technologie, mesure et résultats analytiques ;
· Les procédures et systèmes liés à la chromatographie ;
· La provenance élémentaire des données ;

Profil recherché

Étudiant(e) de Master 2 ou de dernière année d’école d’ingénieur en Informatique, Bioinformatique Science des données, Intelligence artificielle, Ingénierie des connaissances, Web sémantique, Biologie computationnelle ou Sciences de l’information. Le ou la candidate devra présenter un intérêt pour la représentation des connaissances, la modélisation de données scientifiques et l’interopérabilité des données biologiques.

Compétences souhaitées

· Bases en modélisation de données ou bases de données.
· Connaissances en RDF, OWL, SPARQL
· Intérêt pour l’ingénierie des connaissances, ontologies et Web sémantique.
· Notions de Python appréciées.
· Connaissance des données biologiques ou omiques appréciée.
· Intérêt pour les principes FAIR et la provenance des données.
· Capacité à lire des articles et documentations techniques en anglais.
· Rigueur dans la formalisation et la documentation.

La connaissance préalable de Protégé, ISA, SOSA ou MetaboLights serait un avantage, mais n’est pas exigée.

Environnement technique

· Protégé ;
· RDF, OWL, SPARQL ;
· Éventuellement SHACL ;
· Python ;
· ISA-Tab ou ISA-JSON ;
· SOSA/SSN ;
· PROV-O ;
· Ontologies OBO ;
· MetaboLights ;

Encadrement

Magalie Weber - Ingénieure de recherche spécialisée en ingénierie des connaissances- INRAE, Unité de recherche Biopolymères Interactions Assemblages, Nantes
Franck Giacomoni – Ingénieur de recherche en bioinformatique – INRAE, Unité de Nutrition Humaine Clermont Ferrand

Candidature

Par mail uniquement - Curriculum vitæ et lettre de motivation à adresser conjointement aux deux encadrants.

Candidature

Date limite : 30 octobre 2026

Contacts

 Franck Giacomoni
 frNOSPAManck.giacomoni@inrae.fr

 Magalie Weber
 maNOSPAMgalie.weber@inrae.fr

Offre publiée le 29 septembre 2026, affichage jusqu'au 30 octobre 2026