Stage de M2 en bioinformatique et métabolomique

 Stage · Stage M2  · 6 mois    Bac+5 / Master   Institut Pasteur · Paris 15 (France)

Mots-Clés

bioinformatique metabolomique

Description

Version française

Titre du stage

Développement d’une base de données interne pour l’annotation de données LC-MS/MS

Présentation de la plateforme :

Créée en 2021, la Metabolomics Core Facility (MCF) de l’Institut Pasteur accompagne les équipes de recherche du campus dont les projets requièrent une caractérisation fine du métabolome. La plateforme s’appuie sur :
* des instruments de pointe en spectrométrie de masse ;
* une équipe d’ingénieurs en chimie analytique et bio-informatique ;
* un savoir-faire couvrant l’ensemble de la chaîne : préparation des échantillons, acquisition, traitement et interprétation des données.

Bien que la métabolomique non ciblée soit une approche exploratoire en plein essor, le processus d’annotation des métabolites demeure l’un des principaux verrous analytiques. En effet, malgré l’enrichissement continu des banques spectrales publiques, ces ressources restent intrinsèquement hétérogènes et incomplètes face à la complexité du métabolome.

L’une des difficultés inhérentes à l’annotation en spectrométrie de masse (MS) réside dans la forte dépendance des signatures analytiques (temps de rétention, spectres de fragmentation MS/MS, adduits) vis-à-vis des conditions instrumentales (technologies MS, géométries d’ionisation, énergies de collision) et de l’effet de matrice biologique. Cette forte variabilité inter-analytique limite la robustesse d’une base de données universelle et totalement agnostique.

Afin de pallier ces biais et d’atteindre de hauts niveaux de confiance dans l’identification des composés (selon les critères de la Metabolomics Standards Initiative, MSI), notre plateforme souhaite développer sa propre bibliothèque spectrale interne (in-house spectral library). Ce référentiel analytique, construit à partir de standards acquis dans nos conditions chromatographiques et spectrométriques exactes, aura pour objectif d’optimiser la fiabilité de nos annotations et de garantir à nos collaborateurs scientifiques une interprétation biologique de haute précision.

Objectifs du stage :

Le ou la stagiaire aura pour mission de :

Veille technologique et analytique

Effectuer une revue critique de la littérature concernant les formats de bibliothèques spectrales (ex. : MSP, MGF), les algorithmes de scoring pour l’appariement de spectres MS/MS (similarité cosinus, entropie spectrale, etc.) ainsi que les outils de dé-réplication, afin de définir l’architecture la plus adaptée à notre référentiel.

L’étudiant(e) devra également poursuivre une démarche de recherche objective visant à identifier et sélectionner les technologies adaptées à la mise en place d’une base de données évolutive, permettant de stocker les données à long terme de manière pérenne (MongoDB, PostgreSQL, …), et pouvant être couplée à des moteurs orientés graphe (Neo4j, par exemple).

Conception et construction de la base de données interne

Développer une solution structurée permettant d’extraire, de nettoyer et de stocker de manière automatisée les signatures analytiques (temps de rétention, m/z exact, spectres de fragmentation MS/MS) issues des standards analytiques injectés sur les instruments de la plateforme.

Implémentation du workflow d’extraction et d’alimentation automatique de la base de données

Concevoir et développer un pipeline bio-informatique automatisé et reproductible (via Snakemake, Nextflow ou équivalent) intégrant :

  • l’extraction des données (spectres MS, MS/MS et métadonnées associées) ;
  • le formatage des données brutes vers un format adapté (MGF, MSP, …) ;
  • la mise en place d’outils permettant l’injection des données formatées dans la base de données.

Validation scientifique sur des jeux de données réels

Dans un premier temps, l’étudiant(e) devra tester la robustesse du pipeline sur des cohortes ou des échantillons représentatifs des activités de la plateforme. Il ou elle évaluera ensuite la plus-value de la base de données interne en menant une étude comparative inter-projets à l’aide de ce nouveau référentiel.

L’objectif sera de mettre en exergue l’impact des méthodes analytiques ainsi que des matrices biologiques sur la stabilité des signatures observées pour un groupe de molécules chimiques utilisées à des fins de contrôle qualité.

Mise en place d’une approche permettant la fouille de données

Enfin, l’étudiant(e) devra proposer une approche complémentaire à la base de données afin d’en permettre une exploration efficace. Le but sera de mettre en place un outil reposant sur des approches en réseau et en théorie des graphes, voire sur des méthodes d’intelligence artificielle, pour aider les futurs utilisateurs à identifier des motifs d’intérêt dans le cadre de questionnements scientifiques.

Grâce à l’expérience acquise et aux outils mis en place, l’étudiant(e) sera également encouragé(e) à proposer une étude scientifique élaborée au cours de son stage, en lien avec les intérêts et les défis actuels de la métabolomique non ciblée.

Profil recherché (Master 2 bio-informatique / biologie computationnelle)

Compétences indispensables :

  • Excellente maîtrise de Python et du shell Unix.
  • Connaissance de Git et du travail en ligne de commande.
  • Bon niveau d’anglais écrit et oral.

Compétences appréciées :

  • Expérience avec un système de gestion de workflows (Snakemake, Nextflow, CWL…).
  • Notions concernant la création et l’utilisation de base de données non relationnelles.
  • Intérêt marqué pour la biologie et la métabolomique ; première expérience des données de spectrométrie de masse bienvenue.

Ce que nous offrons :

  • Immersion au sein d’une équipe pluridisciplinaire au cœur de l’Institut Pasteur.
  • Accès à des instruments et à des données de dernière génération.
  • Contribution à un projet open-source potentiellement valorisable par une publication.
  • Gratification mensuelle selon la réglementation en vigueur (stage de 4 à 6 mois, date de début flexible).

En résumé :

Le ou la stagiaire évoluera au sein d’un environnement interdisciplinaire, en interaction étroite avec les ingénieurs de la plateforme et les équipes de recherche utilisatrices.

Les livrables attendus incluront une architecture de base de données documentée, un pipeline automatisé et reproductible d’extraction/alimentation, ainsi qu’une première validation sur jeux de données réels.

Les objectifs 1 à 4 constituent le cœur du stage. L’objectif 5 pourra être abordé en fonction de l’avancement du projet et des appétences du ou de la stagiaire.


English version

Internship title

Development of an internal database for the annotation of LC-MS/MS data

About the platform

Created in 2021, the Metabolomics Core Facility (MCF) at Institut Pasteur supports research teams across the campus whose projects require fine-grained characterization of the metabolome. The platform relies on:

  • state-of-the-art mass spectrometry instruments;
  • a team of engineers in analytical chemistry and bioinformatics;
  • expertise covering the entire workflow: sample preparation, data acquisition, processing, and interpretation.

Although untargeted metabolomics is a rapidly expanding exploratory approach, metabolite annotation remains one of its main analytical bottlenecks. Indeed, despite the continuous enrichment of public spectral libraries, these resources remain intrinsically heterogeneous and incomplete when faced with the complexity of the metabolome.

One of the inherent challenges of annotation in mass spectrometry (MS) lies in the strong dependence of analytical signatures (retention time, MS/MS fragmentation spectra, adducts) on instrumental conditions (MS technologies, ionization geometries, collision energies) and on biological matrix effects. This high inter-analytical variability strongly limits the robustness of a universal and fully agnostic database.

To overcome these limitations and achieve high levels of confidence in compound identification (according to the criteria of the Metabolomics Standards Initiative, MSI), our platform aims to develop its own internal spectral library (in-house spectral library). This analytical reference resource, built from standards acquired under our exact chromatographic and spectrometric conditions, will aim to improve the reliability of our annotations and to ensure high-precision biological interpretation for our scientific collaborators.

Internship objectives

The selected candidate will be responsible for the following tasks:

Technological and analytical survey

Carry out a critical review of the literature on spectral library formats (e.g., MSP, MGF), scoring algorithms for MS/MS spectral matching (cosine similarity, spectral entropy, etc.), as well as dereplication tools, in order to define the most suitable architecture for our reference resource.

The student will also conduct an objective evaluation aimed at identifying and selecting the technologies best suited for building an evolving database capable of storing data sustainably over the long term (MongoDB, PostgreSQL, …), and that could be coupled with graph-oriented engines (for example, Neo4j).

Design and construction of the internal database

Develop a structured solution enabling the automated extraction, cleaning, and storage of analytical signatures (retention time, exact m/z, MS/MS fragmentation spectra) derived from analytical standards injected on the platform’s instruments.

Implementation of the extraction and automatic database population workflow

Design and develop an automated and reproducible bioinformatics pipeline (using Snakemake, Nextflow, or equivalent) integrating:

  • data extraction (MS spectra, MS/MS spectra, and associated metadata);
  • formatting of raw data into a suitable format (MGF, MSP, …);
  • implementation of tools enabling the injection of formatted data into the database.

Scientific validation on real datasets

As a first step, the student will test the robustness of the pipeline on cohorts or samples representative of the platform’s activities. He or she will then assess the added value of the internal database by conducting a comparative cross-project study using this new reference resource.

The objective will be to highlight the impact of analytical methods as well as biological matrices on the stability of the observed signatures for a set of chemical compounds used for quality control purposes.

Development of a data mining approach

Finally, the student will propose an approach complementary to the database in order to enable its efficient exploration. The goal will be to set up a tool based on network approaches and graph theory, and potentially artificial intelligence methods, to help future users identify patterns of interest in the context of scientific questions.

Based on the experience gained and the tools developed, the student will also be encouraged to propose a scientific study designed during the internship period, in connection with current interests and challenges in untargeted metabolomics.

Desired profile

Master’s degree (year 2) in bioinformatics / computational biology

Required skills

  • Excellent command of Python and the Unix shell.
  • Familiarity with Git and command-line work.
  • Good written and spoken English.

Preferred skills

  • Experience with workflow management systems (Snakemake, Nextflow, CWL…).
  • Basic knowledge of the creation and use of non-relational databases.
  • Strong interest in biology and metabolomics; prior experience with mass spectrometry data would be a plus.

What we offer

  • Immersion in a multidisciplinary team at the heart of Institut Pasteur.
  • Access to state-of-the-art instruments and cutting-edge data.
  • Contribution to an open-source project with potential for publication.
  • Monthly internship allowance in accordance with current regulations (4- to 6-month internship, flexible start date).

In summary

The intern will work in an interdisciplinary environment, in close interaction with the platform’s engineers and the research teams using its services.

Expected deliverables will include a documented database architecture, an automated and reproducible extraction/loading pipeline, as well as an initial validation on real datasets.

Objectives 1 to 4 constitute the core of the internship. Objective 5 may be explored depending on project progress and the student’s interests and strengths.

Candidature

Procédure : Envoyer CV, lettre de motivation et, si possible, lien vers un dépôt de code (GitHub, GitLab…) à : metabolomics@pasteur.fr

Contacts

 Arnaud Meng
 arNOSPAMnaud.meng@pasteur.fr

Offre publiée le 26 août 2026, affichage jusqu'au 1 janvier 2027