Mots-Clés
transcriptomique
circRNA
k-mers
Description
Sujet de stage de M2: Détection d’ARN circulaires par indexation de k-mers
Lieu : au choix, CRIStAL (Lille) ou IGDR (Rennes), avec suivi régulier par les deux équipes tout au long du stage
Date : 6 mois entre janvier et août 2027
Encadrement : Camille Marchet (CRIStAL, équipe Bonsai, Lille) / Yuna Blum et Thomas Derrien (IGDR, équipe BINGO, Rennes)
Collaboration additionnelle : Chloé Bessière (IMRB, Créteil) apportera son expertise sur la quantification par k-mers à grande échelle et sur les signatures de leucémie.
Contexte
Les ARN circulaires (circRNA) sont des ARN non codants qui forment une boucle fermée au lieu d’être linéaires.
Cette structure les protège de la dégradation et leur donne une demi-vie longue, ce qui en fait de bons candidats comme biomarqueurs précoces de réponse thérapeutique ou de rechute dans les cancers, notamment en hématologie pédiatrique.
En bioinformatique, détecter un ARN circulaire après son séquençage suppose de repérer une jonction chimérique (la jonction de back-splicing), une séquence que les aligneurs classiques (STAR, HISAT2) ne recherchent pas nativement. Les outils dédiés comme CIRI3 contournent ce problème avec des heuristiques d’alignement, plus fiables mais coûteuses en temps de calcul et difficiles à faire passer à l’échelle sur de grandes cohortes.
L’équipe Bonsai (CRIStAL) a développé REINDEER [1], une structure d’indexation par k-mers qui permet d’interroger de grandes collections de séquences sans alignement, beaucoup plus rapidement. Cette approche n’a encore jamais été appliquée à la détection de jonctions de back-splicing : c’est ce que ce stage se propose d’explorer.
Objectifs du stage
- Comprendre comment adapter un index k-mer (par exemple [1]) pour rechercher les jonctions de back-splicing : il faut construire un catalogue de séquences de jonction candidates, absentes du génome de référence, et l’intégrer à l’index.
- Construire un jeu de données simulées, où l’on connaît à l’avance les jonctions présentes et leur abondance, pour valider l’approche en conditions contrôlées.
- Faire tourner l’index de k-mers sur ces données et évaluer s’il retrouve correctement les jonctions attendues.
- Faire tourner CIRI3 [2] sur les mêmes données pour comparer les deux méthodes : sensibilité, spécificité, temps de calcul.
- Si le temps le permet, refaire cette comparaison sur un jeu de données publiques réel (RNA-seq d’un cancer, avec des circRNA déjà validés expérimentalement).
Une recherche de financement de thèse est en cours pour poursuivre ces étapes, et les ancrer dans une collaboration clinique en lien avec les leucémies pédiatriques.
Profil recherché
Étudiant·e de M2 de bioinformatique, à l’aise en programmation (Python, et idéalement des bases en C++ ou Rust). Des notions d’algorithmique des séquences ou de structures d’indexation (k-mers, graphes de de Bruijn) sont un plus mais pas indispensables.
Contact
Camille Marchet : camille.marchet@univ-lille.fr
Yuna Blum : yuna.blum@univ-rennes.fr
References
[1] REINDEER: efficient indexing of k-mer presence and abundance in sequencing datasets, C Marchet et al. 2020
[2] Detecting and quantifying circular RNAs in terabyte-scale RNA-seq datasets with CIRI3, X Zheng et al. 2025