Mots-Clés
phylogénie
structure
protéines
Description
Phylogénétique des états structuraux des protéines
La phylogénie moléculaire des protéines a pour objet d’étude l’évolution des séquences d’acides aminés. Cette dynamique évolutive est essentiellement contrainte par la fonction des protéines, elle-même assurée par leur structure tridimensionnelle.
Il est communément admis que les structures des protéines sont plus robustes aux mutations que leurs séquences : deux protéines homologues peuvent ne partager que 20 à 25 % d’identité de séquence et pourtant adopter des structures similaires. En effet, la plupart des mutations observées sont des substitutions entre acides aminés biochimiquement proches, qui n’ont que peu d’effet sur la structure et sont donc quasi neutres d’un point de vue évolutif. La structure permet alors d’étudier l’évolution de protéines très distantes lorsque le signal porté par les séquences est saturé.
Par ailleurs, la position des sites mutés dans la structure influe fortement sur leur dynamique évolutive. Les positions exposées au solvant, dépourvues de contacts et structuralement tolérantes, sont susceptibles d’accumuler les mutations. À l’inverse, d’autres sites sont soumis à une sélection purificatrice, soit parce qu’ils portent la fonction biochimique (résidus catalytiques, fixation de cofacteurs, interfaces d’interaction), soit parce qu’ils sont critiques pour l’intégrité structurale (cœur hydrophobe enfoui, empilement, géométrie des coudes, ponts disulfure). Enfin, l’information structurale ne porte pas à elle seule les signaux évolutifs : la dynamique des séquences est elle-même soumise à des contraintes propres (code génétique, biais muta-tionnels, etc.), et combiner les dynamiques évolutives des structures et des séquences serait particulièrement enrichissant pour la phylogénie moléculaire.
Les modèles phylogénétiques intégrant la dynamique évolutive des structures font pourtant défaut, historiquement en raison de l’écart entre le nombre de structures connues et l’abondance des séquences. Désormais, les méthodes modernes de modélisation structurale à haut débit réduisent progressivement cet écart. Parallèlement, des algorithmes efficaces pour encoder une information structurale riche sont activement développés. Ils décrivent, par différentes approches géométriques, l’environnement structural de chaque acide aminé ; ces environnements peuvent être regroupés en classes représentées par des caractères. Une protéine peut ainsi être encodée non plus comme une séquence d’acides aminés, mais comme une succession d’états structuraux locaux, à l’image de l’alphabet 3Di de Fold-seek (van Kempen et al., 2024). Les acides aminés biochimiquement proches occupant souvent les mêmes environnements structuraux, leur variabilité de séquence (dérive neutre) se réduit à un nombre restreint d’états structuraux. À l’inverse, une forte variabilité des séquences d’états structuraux entre protéines pourrait signaler de véritables changements de repliement. Les séquences d’alphabets structuraux devraient donc conserver un signal phylogénétique plus profond dans le temps que l’alphabet des acides aminés, et l’analyse de leur évolution révéler des dynamiques inaccessibles à l’analyse des seules séquences.
Ce stage propose de tester cette hypothèse sur deux familles d’homologues aux régimes évolutifs contrastés : l’ATP synthase et le lysozyme. L’ATP synthase est un complexe universel, présent dans les trois domaines du vivant et hérité de LUCA : ses sous-unités catalytiques divergent sur des échelles de temps où l’identité de séquence est largement saturée, alors que l’architecture reste reconnaissable. C’est donc le cas limite où un alphabet structural devrait apporter le plus de signal. Le lysozyme représente la situation inverse : petite protéine monomérique, abondamment documentée structuralement et fonctionnellement, il regroupe des familles divergentes (types c, g et i) et constitue un modèle classique d’évolution moléculaire, avec des épisodes de sélection positive et de convergence bien caractérisés. Il permet donc de vérifier que l’encodage en états structuraux ne perd pas le signal aux échelles de temps courtes, et de confronter les sites détectés à des résultats déjà établis.
Étapes envisagées
- Collecte des séquences et structures homologues depuis AlphaFold DB (Varadi et al., 2024).
- Conversion en états structuraux avec Foldseek (van Kempen et al., 2024).
- Alignements et construction d’arbres phylogénétiques à partir des successions d’états structuraux (Puente-Lelievre et al., 2023 ; Garg & Hochberg, 2025).
- Inférence des histoires évolutives à partir des encodages structuraux et des séquences d’acides aminés.
- Comparaison des trajectoires évolutives et identification des événements et sites d’intérêt.
Références
. Garg S.G., Hochberg G.K.A. (2025). A general substitution matrix for structural phylogenet-ics. Molecular Biology and Evolution 42(6), msaf124. doi:10.1093/molbev/msaf124
. Puente-Lelievre C., Malik A.J., Douglas J., Ascher D., Baker M., Allison J., Poole A., Lundin D., Fullmer M., Bouckaert R., Kim H., Steinegger M., Matzke N.J. (2023). Tertiary-interaction characters enable fast, model-based structural phylogenetics beyond the twilight zone. bio-Rxiv 2023.12.12.571181. doi:10.1101/2023.12.12.571181
. van Kempen M., Kim S.S., Tumescheit C., Mirdita M., Lee J., Gilchrist C.L.M., Söding J., Stei-negger M. (2024). Fast and accurate protein structure search with Foldseek. Nature Bio-technology 42, 243–246. doi:10.1038/s41587-023-01773-0
. Varadi M. et al. (2024). AlphaFold Protein Structure Database in 2024: providing structure coverage for over 214 million protein sequences. Nucleic Acids Research 52(D1), D368–D375. doi:10.1093/nar/gkad1011