Mots-Clés
Nanopore
Plasmodium falciparum
haplotypage
Description
Développement et validation d’un pipeline d’haplotypage Nanopore pour l’étude du polymorphisme de Plasmodium falciparum
Contexte
Plasmodium falciparum, principal agent responsable du paludisme, présente une forte diversité génétique, notamment au niveau de gènes polymorphes tels que msp1, msp2 et csp. La caractérisation de cette diversité est importante pour l’étude des populations parasitaires, de la transmission et de la diversité des antigènes.
Le séquençage long-read Oxford Nanopore permet de couvrir des amplicons entiers et d’associer, au sein d’une même molécule, les différents polymorphismes présents dans un allèle. Cependant, les erreurs résiduelles de séquençage, notamment les insertions/délétions et les erreurs dans les régions répétées, rendent difficile la distinction entre véritables haplotypes et erreurs techniques.
Notre problématique est d’identifier et de reconstruire de manière fiable les différents haplotypes d’un gène polymorphe de P. falciparum à partir de données d’amplicons Nanopore, tout en distinguant la diversité biologique du bruit de séquençage.
Objectif du stage
L’objectif sera de développer, optimiser et valider un pipeline bioinformatique automatisé permettant de détecter, regrouper et reconstruire les différents haplotypes présents dans des échantillons de P. falciparum.
Une attention particulière sera portée à la combinaison de plusieurs informations, notamment la longueur des amplicons, la similarité des séquences et l’abondance des reads, afin d’identifier les haplotypes majoritaires et minoritaires de manière robuste.
Méthodologie
Le projet s’articulera autour de quatre étapes principales :
-
Prétraitement et contrôle qualité
Filtrage des reads Nanopore, identification des amplicons ciblés et caractérisation de la qualité, de la couverture et de la distribution des longueurs.
-
Identification des haplotypes candidats
Regroupement des reads en combinant l’information de longueur et la similarité de séquence. Les seuils de regroupement seront optimisés et évalués plutôt que fixés a priori.
-
Reconstruction des haplotypes
Alignement des reads de chaque groupe et génération de séquences consensus, avec correction des erreurs spécifiques aux données Nanopore. Les différences entre haplotypes (SNPs, indels et variations de longueur) seront ensuite caractérisées.
-
Score de confiance pour chaque haplotype reconstruit
Afin d’évaluer la robustesse de sa détection et de sa séquence consensus. Ce score pourra intégrer différents critères tels que le nombre et la proportion de reads supportant l’haplotype, la cohérence des séquences au sein du cluster, la couverture et la qualité des positions variables, ainsi que la distance avec les autres haplotypes détectés. L’objectif sera notamment d’identifier les haplotypes présentant un score insuffisant susceptibles de correspondre à des erreurs de séquençage.
-
Validation des performances
Évaluation de la capacité du pipeline à détecter des haplotypes majoritaires et minoritaires à partir de données expérimentales et, lorsque disponibles, de mélanges ou données simulées de composition connue. Les performances seront évaluées en termes de sensibilité, précision, taux de faux positifs et qualité de reconstruction.
Livrables
• Un pipeline bioinformatique reproductible et documenté, développé en Python/Bash et, selon l’avancement, intégré dans un workflow Nextflow ou Snakemake.
• Un tableau de synthèse par échantillon et par gène indiquant notamment le nombre d’haplotypes, leur taille, leur abondance et les variants identifiés ainsi que le score de confiance pour chacun d’entre eux.
• Un fichier FASTA contenant les séquences consensus.
• Une évaluation des performances et des limites de la méthode, notamment pour la détection des haplotypes minoritaires.
Compétences
Le stage mobilisera des compétences en bioinformatique, programmation Python/Bash, analyse statistique et visualisation de données. Le/la stagiaire sera amené(e) à utiliser R pour l’analyse statistique des résultats et la production de représentations graphiques adaptées. Une expérience avec minimap2, samtools, pysam, Biopython et/ou les workflows reproductibles (Nextflow/Snakemake) sera appréciée.
Le projet comportera également un volet développement logiciel, avec la conception d’une interface utilisateur intuitive et ergonomique (« user-friendly ») permettant de lancer les analyses, de paramétrer le pipeline et de visualiser les principaux résultats de manière interactive, afin de rendre l’outil accessible à des utilisateurs non spécialistes de la ligne de commande.