Mots-Clés
knowledge graph
RAG
language model
metadata
ontologies
Description
Version française
Développement d’une approche d’enrichissement (RAG) de graphes de connaissances pour caractériser des métadonnées à partir de publications scientifiques et d’ontologies
Contexte
Les données omiques publiques constituent une ressource précieuse pour analyser des variations biologiques entre des stades de développement, des traitements ou des caractéristiques environnementales. Leur réutilisation à grande échelle se heurte cependant à un obstacle majeur : les métadonnées décrivant les conditions expérimentales sont dispersées dans les publications, et souvent incomplètes et très hétérogènes d’un article à l’autre. Leur extraction manuelle, longue et coûteuse, limite fortement leur réutilisation et la capacité à mener des méta-analyses à partir de données déjà publiées.
Un workflow opérationnel (Text2Meta) a déjà été développé pour extraire des métadonnées expérimentales à partir d’articles scientifiques, selon une approche de type RAG : les passages du texte susceptibles de contenir l’information recherchée sont d’abord repérés, puis un modèle de langage extrait et structure les termes sous forme de métadonnées. Une première évaluation, menée à partir de près de 2500 échantillons biologiques annotés manuellement (gold standard), a donné des résultats encourageants, tout en révélant une limitation : les réponses générées par l’IA sont souvent correctes sur le fond, mais formulées de manière trop hétérogène pour permettre une évaluation automatique fiable.
Objectif du stage
Ce stage aura pour but de proposer et développer un protocole de normalisation afin de lier les métadonnées extraites à des vocabulaires contrôlés issus d’ontologies du domaine. Pour cela, il faudra :
1. Rechercher les correspondances entre les métadonnées extraites - automatiquement (Text2Meta) et manuellement (gold standard) - de publications scientifiques et des vocabulaires issus d’ontologies du domaine, par une approche de type RAG (embedding, calcul de similarité)
2. Produire un graphe de connaissances intégrant ces correspondances entre les métadonnées des échantillons et les termes ontologiques ainsi que les définitions associées
3. Valider les résultats à partir d’un sous-échantillon du gold standard, préalablement annoté avec des termes ontologiques
4. Tester le processus complet (extraction des métadonnées, intégration dans un graphe de connaissance) sur un nouveau modèle biologique
5. Développer une interface permettant l’exploitation du graphe de connaissance généré
Profil recherché
- Étudiant(e) en Master 2 de bioinformatique, informatique ou équivalente
- Compétences en programmation en langage python
- Intérêt pour les modèles de langage et approches RAG
- Notions en web sémantique et graphes de connaissance
Début de stage : entre janvier et mars
English version
Development of a knowledge graph enrichment approach (RAG) to caracterize metadata from scientification publications and ontologies
Context
Public omics data constitue a valuable resource to analyze biological information between developmental stages, treatments or environmental characteristics. However, their large-scale reuse faces a major obstacle: the metadata describing experimental conditions are scattered throughout publications, incomplete and highly heterogeneous from one article to another. Their extraction – a time consuming and costly process – severely limits their reuse and the ability to conduct meta-analyses based on previously published data.
An operational workflow (Text2Meta) has already been developed to extract the experimental metadata from scientific articles, using a RAG-based approach: text passages likely to contain the target information are first identified, and a language model extracts and structures the terms as metadata. An initial evaluation, conducted on a dataset of nearly 2,500 manually annotated biological samples (gold standard), returned encouraging results but revealed a limitation: while the AI-generated answers are often factually correct, they are phrased too inconsistently to allow for reliable automated evaluation.
Goal
The goal of this internship is to propose and develop a standardization protocole to link the extracted metadata to controlled vocabularies derived from domain-specific ontologies. This will involve:
1. Identify matches between metatadata extracted – automatically (Text2Meta) and manually (gold standard) – from scientific publication and vocabularies from domain-specific ontologies, using a RAG-based approach (embeddings, similarity calculation)
2. Produce a knowledge graph integrating these matches betweed samples metadata and ontological terms as well as their association definitions
3. Validate these results using a sub-sample of the gold standard, previously annotated with ontological terms
4. Test the full process (metadata extraction, integration in a knowledge graph) on a new biological model
5. Develop an interface enabling the utilization of the generated knowledge graph
Profile
- Master 2 in bioinformatics, informatics or equivalent
- Python programming skills
- Interest in language models and RAG approaches
- Familiarity with semantic web and knowledge graphs
Internship start: between january and march