Mots-Clés
IA
organisation 3D
génomique
Hi-C
deep learning
mutagénèse in silico
Description
Criblage in silico de l’organisation 3D du génome par deep learning : impact de la diversité génétique sur la génomique 3D.
Contexte scientifique :
L’organisation tridimensionnelle du génome ; des territoires chromosomiques aux boucles d’interaction, en passant par les compartiments A/B et les domaines topologiques associés (TADs) ; joue un rôle fondamental dans la régulation de l’expression génique chez les mammifères (Spielmann et al., 2018). Chez les animaux d’élevage, cette architecture reste encore peu caractérisée au regard de la diversité génétique inter-individuelle et inter-raciale. Si les méthodes expérimentales de capture de conformation de la chromatine (comme la Hi-C) permettent de cartographier physiquement ces interactions (Tavallaee and Orouji, 2025), leur coût élevé et leur complexité technique fne permettent pas un déploiment à grande échelle.
L’émergence récente de modèles de deep learning performants, à l’image d’ORCA (Zhou, 2022), change la donne en permettant de prédire in silico l’organisation chromatinienne directement à partir de la séquence primaire d’ADN. Ces outils offrent l’opportunité de mener une mutagénèse virtuelle à très haute résolution pour identifier les régions clés de l’architecture 3D. Le principe du criblage in silico consiste à simuler une mutation locale (ex. : randomisation de 10 paires de bases) et à comparer les matrices d’interactions prédites avant et après mutation. L’application de différentes métriques dédiées permet ensuite de quantifier précisément l’impact de la séquence mutée sur la topologie locale.
Objectifs du projet
Ce projet de stage vise à standardiser une méthode de screening virtuel et à l’appliquer à la diversité génétique bovine à travers deux axes complémentaires :
-
Déploiement et automatisation du criblage in silico : L’objectif est de consolider, automatiser et passer à l’échelle supérieure un pipeline de mutagénèse in silico. En couplant le modèle ORCA (Python) et un package R développé en interne au laboratoire, le/la stagiaire déploiera un workflow optimisé sur l’ensemble du génome bovin. Ce travail permettra de cartographier de manière systématique les régions dites « 3D-actives », essentielles au maintien de l’architecture locale.
-
Impact topologique de la variation génétique : Ce second volet exploitera la puissance du pipeline pour évaluer l’effet fonctionnel des polymorphismes (SNPs, indels) et des variants structuraux (SVs, CNVs) issus des récents pangénomes bovins. Il s’agira de caractériser finement la manière dont ces variations de séquence modulent l’architecture 3D à l’échelle de l’individu, de la race et de l’espèce, ouvrant de nouvelles perspectives pour l’interprétation des variants associés à des caractères d’intérêt phénotypique.
Résultats attendus & Valorisation :
Ce stage fournira (1) un pipeline robuste et documenté pour le criblage structural à l’échelle du génome, et (2) un catalogue des variants bovins à fort impact topologique.
Compétences recherchées :
Etudiant titulaire d’un Master 1 en bioinformatique/biostatistique ou équivalent, possédant les compétences suivantes :
- Connaissances en bioinformatique, (bio)statistique et biologie,
- Maîtrise de l’environnement Linux/Unix,
- Capacité à coder en bash, R et/ou Python,
- Rigueur et esprit de synthèse.
Spielmann M, Lupiáñez DG, Mundlos S (2018) Structural variation in the 3D genome. Nat Rev Genet 19:453–467. https://doi.org/10.1038/s41576-018-0007-0
Tavallaee G, Orouji E (2025) Mapping the 3D genome architecture. Comput Struct Biotechnol J 27:89–101. https://doi.org/10.1016/j.csbj.2024.12.018
Zhou J (2022) Sequence-based modeling of three-dimensional genome architecture from kilobase to chromosome scale. Nat Genet 54:725–734. https://doi.org/10.1038/s41588-022-01065-4