Mots-Clés
data management
intégration de données
ontologies
génétique
génomique
NoSQL
Neo4j
Python
json
Linux
Shell
Javascript
Description
Titre : Mise en place d’un outil d’intégration de données pour améliorer la caractérisation des ressources génétiques
Mots clés :
- Data management, intégration de données, ontologies, génétique, génomique
- NoSQL (Neo4J et Elasticsearch), Python, JSON, GNU/Linux, Shell, JavaScript.
Résumé du projet de stage :
Un des enjeux de la biologie végétale est d’étudier, voire de prédire la capacité des plantes à s’adapter à des stress en s’appuyant sur des données génétiques, génomiques et environnementales. Pour y parvenir les chercheurs étudient des collections de ressources génétiques, représentant la diversité existante d’une espèce, et souhaitent disposer de connaissances intégrées aussi exhaustives que possible sur chacune des accessions/ressources génétiques de ces collections.
L’URGI est une unité de service développant de nouvelles approches basées sur les graphes de connaissances. Le but est de faciliter l’intégration de données hétérogènes pour apporter à la communauté scientifique un appui simple et efficace pour l’exploration et l’accès aux données.
L’objectif du stage proposé sera de mettre en place un outil permettant la mise en relation de ressources génétiques provenant d’un large panel d’espèces de plantes d’intérêt (blé, vigne, peuplier, chêne …) avec des données de caractérisation provenant de jeux de données hétérogènes (génomique, génétique, phénomique, biblio …). Pour cela, la personne recrutée devra poursuivre le développement d’une base graphe (débutée en 2025) pour l’enrichir avec de nouvelles données. Elle devra ensuite développer une interface, qui sera intégrée au système d’information de l’URGI, pour pouvoir interroger les données de cette base graphe et les rendre accessibles.
Objectifs :
- Intégration de données hétérogènes dans une base de données NoSQL.
Le(a) candidat(e) devra concevoir l’extension du schéma existant et proposer un ETL (Extract Transform and Load) qui permettra l’intégration des données dans la base via des workflows automatisés et reproductibles.
- Développement d’une interface de visualisation.
Le(a) candidat(e) devra proposer une interface permettant l’interrogation de la base graphe et la visualisation des résultats afin de faciliter l’accès aux données.
Compétences techniques recherchées :
- Maîtrise des commandes UNIX (shell), de la programmation python et javascript.
- Connaissance en SGBD, des connaissances en NoSQL sera un plus.
- Connaissance de la technologie Docker souhaitable.