Apprentissage profond sur graphes pour le clustering et alignement de données single-cell

 Stage · Stage M2  · 6 mois    Bac+5 / Master   Laboratoire Bordelais de Recherche en Informatique · Talence (France)  ~600€ brut par mois

 Date de prise de poste : 4 janvier 2027

Mots-Clés

apprentissage profond graph neural network apprentissage non-supervisé cellule unique intégration de données médecine personnalisée

Description

French version:

Contexte : Au sein de l’équipe BKB du laboratoire LABRI, nous nous intéressons à l’étude de différents phénotypes à partir de données d’expression de gènes, en particulier les données de cellule unique (scRNASeq). L’expression d’un gène correspond à la quantité d’ARN qui est « produit » par ce gène, que l’on peut interpréter comme son niveau d’activité. Il est ainsi possible de caractériser un patient par son profil d’expression génique. Grâce aux progrès technologiques, nous sommes désormais capables de mesurer l’expression génétique au niveau cellulaire et d’estimer le nombre de classes cellulaires présentes. À partir de ces données d’expression à l’échelle cellulaire, nous pouvons entraîner des réseaux de neurones pour reconnaître des types cellulaires et identifier des signatures génétiques cellulaires. Ces approches permettent de mieux caractériser certaines pathologies (par exemple la progression d’un cancer au sein d’une cohorte) et d’adapter la prise en charge en fonction des caractéristiques du patient [1].

Sujet : Un premier volet de ce projet vise à explorer les dernières avancées sur les méthodes de classification non supervisées (i.e., clustering) pour identifier des regroupements de cellules partageant des signatures génétiques communes. L’objectif sera de proposer une solution basée sur l’apprentissage profond, prometteuse selon la littérature, en intégrant l’étape de réduction de dimensionnalité et de clustering dans le même modèle, par opposition aux méthodes classiques en deux étapes, via une analyse en composantes principales (ACP) puis un k-means, par exemple. La piste privilégiée consistera à utiliser un réseau de neurones sur graphes (Graph Neural Network, GNN) afin d’apprendre des représentations latentes des cellules en exploitant à la fois leur profil d’expression génique et les relations de voisinage représentées dans un graphe de similarité. L’apprentissage du GNN permettra de produire un espace latent intégrant les interactions entre cellules, propice à l’identification de populations cellulaires cohérentes. Le clustering sera réalisé directement dans cet espace latent et l’originalité consistera à intégrer conjointement l’apprentissage des représentations et celui du clustering [2]. Différentes architectures de GNN seront étudiées et comparées afin d’évaluer leur capacité à capturer la structure des données scRNA-seq. L’objectif sera d’évaluer dans quelle mesure les GNN permettent d’améliorer les performances obtenues avec les auto-encodeurs étudiés lors de précédents stages [3], tout en les comparant aux approches classiques de réduction de dimension suivie d’un clustering.
Le deuxième volet de ce projet est plus exploratoire. Le domaine du biomédical est marqué par la multiplication des jeux de données de cellule unique accessibles via différents portails. Un nouveau défi de recherche consiste alors à intégrer ces différents jeux de données pour pouvoir les comparer [4]. À partir des représentations apprises par les GNN sur chaque jeu de données, nous étudierons différentes stratégies permettant d’aligner ces représentations dans un espace latent commun. L’objectif sera d’évaluer dans quelle mesure des mécanismes d’apprentissage par transfert ou d’adaptation de domaine [5] permettent d’exploiter les connaissances acquises sur un jeu de données A pour améliorer le clustering et l’intégration d’un jeu de données B présentant des phénotypes comparables.
Enfin, une attention particulière sera portée à la visualisation des représentations apprises. L’objectif sera de construire un espace latent de faible dimension, idéalement bidimensionnel, permettant d’explorer visuellement les populations cellulaires identifiées et de faciliter l’interprétation des résultats par les biologistes. Cette analyse sera complétée par des approches d’interprétation biologique, notamment des analyses d’enrichissement fonctionnel et l’identification de gènes biomarqueurs associés aux populations cellulaires détectées.

Compétences recherchées :

  • Compétences en apprentissage profond sur une diversité d’architectures et de problématiques appliquées aux données (signaux, images, texte, etc.).
  • Bonne maîtrise des langages Python et R.
  • Connaissances des bibliothèques :
    • en analyse de données single-cell : Scanpy
    • en machine learning : scikit-learn
    • en deep learning : PyTorch et PyTorch Geometric

Livrable attendu :

  • Dépôt de code versionné sous Git, bien commenté, structuré et avec un scénario entièrement reproductible.
  • Rédaction d’un rapport final détaillant la démarche, les résultats et les perspectives.

Perspectives :

  • Selon l’avancement du projet, les résultats pourront faire l’objet d’une soumission à JOBIM, sous la forme d’un article court ou d’un poster.
  • Ce projet pourra également ouvrir la voie à une poursuite en thèse, selon les opportunités de financement disponibles (concours, financement sur projet ou autre dispositif).

Références :
[1] Flores, M., et al. (2022). Deep learning tackles single-cell analysis — A survey of deep learning for scRNA-seq analysis. Briefings in Bioinformatics, 23(1), bbab531.
[2] Xu, P., et al. (2026). scCluBench: Comprehensive Benchmarking of Clustering Algorithms for Single-Cell RNA Sequencing. Proceedings of the AAAI Conference on Artificial Intelligence, 40(2), 1364–1372.
[3] Bidet, F., et al. (2026). scRAW: Representation learning for rare cell population identification. Poster accepted at the JOBIM conference.
[4] Asloudj, Y., et al. (2025). scEVE: A Single-Cell RNA-Seq Ensemble Clustering Algorithm Capitalizing on the Differences of Predictions between Multiple Clustering Methods. NAR Genomics and Bioinformatics, 7(2), lqaf073.
[5] Tan, C., et al. (2018). A Survey on Deep Transfer Learning. Artificial Neural Networks and Machine Learning – ICANN 2018, 270–279.


English version:

Context:
Within the BKB team at the LaBRI laboratory, we are interested in studying different phenotypes from gene expression data, in particular single-cell RNA sequencing (scRNA-seq) data. Gene expression corresponds to the amount of RNA “produced” by a gene and can be interpreted as its level of activity. A patient can therefore be characterized by their gene expression profile. Thanks to technological advances, we are now able to measure gene expression at the cellular level and estimate the number of cell classes present. From these cell-level expression data, neural networks can be trained to recognize cell types and identify cell-specific gene signatures. These approaches can help better characterize certain diseases, for example cancer progression within a cohort, and adapt patient management according to individual characteristics [1].

Project:
The first part of this project aims to explore recent advances in unsupervised classification methods (i.e., clustering) to identify groups of cells sharing common gene signatures. The objective will be to develop a deep learning-based solution, which has shown promising results in the literature, by integrating dimensionality reduction and clustering within the same model, as opposed to conventional two-step approaches such as principal component analysis (PCA) followed by k-means clustering.

The main approach considered will rely on a Graph Neural Network (GNN) to learn latent representations of cells by exploiting both their gene expression profiles and neighborhood relationships represented through a similarity graph. The GNN will learn a latent space that incorporates interactions between cells and is suitable for identifying coherent cell populations. Clustering will be performed directly in this latent space, with the key idea of jointly learning the representations and the clustering structure [2]. Different GNN architectures will be investigated and compared to assess their ability to capture the structure of scRNA-seq data. The objective will be to determine to what extent GNNs can improve upon the performance obtained with autoencoders investigated during previous internships [3], while also comparing them with conventional dimensionality-reduction-then-clustering approaches.

The second part of the project will be more exploratory. The biomedical field is characterized by a rapidly growing number of single-cell datasets available through various public repositories. A new research challenge therefore lies in integrating these different datasets in order to compare them [4]. Based on the representations learned by GNNs for each dataset, we will investigate different strategies to align these representations within a common latent space. The objective will be to assess to what extent transfer learning or domain adaptation mechanisms [5] can leverage knowledge acquired from a dataset A to improve the clustering and integration of a dataset B exhibiting comparable phenotypes.

Finally, particular attention will be paid to the visualization of the learned representations. The objective will be to construct a low-dimensional latent space, ideally two-dimensional, enabling visual exploration of the identified cell populations and facilitating interpretation of the results by biologists. This analysis will be complemented by biological interpretation approaches, including functional enrichment analyses and the identification of biomarker genes associated with the detected cell populations.

Required skills:

  • Skills in deep learning across a range of architectures and data-related applications (signals, images, text, etc.).
  • Good proficiency in Python and R.
  • Knowledge of the following libraries:
    • for single-cell data analysis: Scanpy;
    • for machine learning: scikit-learn;
    • for deep learning: PyTorch and PyTorch Geometric.

Expected deliverables:

  • A version-controlled Git repository containing well-commented and well-structured code, together with a fully reproducible workflow.
  • A final report describing the methodology, results, and future perspectives.

Perspectives:

  • Depending on the progress of the project, the results may lead to a submission to JOBIM, either as a short paper or a poster.
  • The project may also provide an opportunity to pursue a PhD, depending on available funding opportunities (competitive doctoral funding, project-based funding, or other schemes).

References:

[1] Flores, M., et al. (2022). Deep learning tackles single-cell analysis — A survey of deep learning for scRNA-seq analysis. Briefings in Bioinformatics, 23(1), bbab531.
[2] Xu, P., et al. (2026). scCluBench: Comprehensive Benchmarking of Clustering Algorithms for Single-Cell RNA Sequencing. Proceedings of the AAAI Conference on Artificial Intelligence, 40(2), 1364–1372.
[3] Bidet, F., et al. (2026). scRAW: Representation learning for rare cell population identification. Poster accepted at the JOBIM conference.
[4] Asloudj, Y., et al. (2025). scEVE: A Single-Cell RNA-Seq Ensemble Clustering Algorithm Capitalizing on the Differences of Predictions between Multiple Clustering Methods. NAR Genomics and Bioinformatics, 7(2), lqaf073.
[5] Tan, C., et al. (2018). A Survey on Deep Transfer Learning. Artificial Neural Networks and Machine Learning – ICANN 2018, 270–279.

Candidature

Procédure : Envoyer son CV, une lettre de motivation et ces deux derniers relevés de notes par mail avec l'objet "[stage] candidature à Apprentissage profond sur graphes pour le clustering et alignement de données single-cell".

Date limite : 18 décembre 2026

Contacts

 Victoria Bourgeais
 viNOSPAMctoria.bourgeais@u-bordeaux.fr

 Loann Giovannangeli
 loNOSPAMann.giovannangeli@u-bordeaux.fr

Offre publiée le 21 septembre 2026, affichage jusqu'au 18 décembre 2026