Conception et Mise en Oeuvre d'Un Protocole d'Entraînement d'Un Llm Médical Français H/F - INRIA
- CDD
- Télétravail accepté
- INRIA
Les missions du poste
A propos d'Inria
Inria, l'institut national de recherche dans les sciences et technologies du numérique, est en appui de l'État pour les stratégies nationales de recherche et d'innovation du numérique en tant qu'Agence de programmes. Inria mène plus de 300 projets de recherche et d'innovation avec ses 3500 scientifiques, ingénieurs et personnels d'appui, en partenariat avec les universités et l'écosystème numérique (entreprises, entrepreneurs, acteurs publics). Ensemble, nous explorons des domaines clés comme l'intelligence artificielle, la cybersécurité, l'informatique quantique, le Cloud, la transformation numérique de la santé, les jumeaux numériques ou encore les technologies numériques pour la défense. Nous construisons des solutions concrètes telles que des logiciels, des startups technologiques, des partenariats avec les entreprises du tissu national et des formations de pointe. Notre objectif : l'impact scientifique, technologique et industriel au service de la souveraineté numérique de la France.
Conception et mise en oeuvre d'un protocole d'entraînement d'un LLM médical français
Type de contrat : CDD
Niveau de diplôme exigé : Bac +5 ou équivalent
Autre diplôme apprécié : thèse
Fonction : Ingénieur scientifique contractuel
Niveau d'expérience souhaité : Jeune diplômé
Contexte et atouts du poste
Cette proposition de poste s'inscrit dans le cadre du projet FG4H financé par la BPI, projet qui a vocation à développer un grand modèle de langue (LLM) spécialisé pour le domaine médical français, en s'appuyant sur plusieurs millions de dossiers patients fournis par les partenaires du projets.
Pour des raisons de confidentialités des données, l'entraînement et la validation de ce modèle prendra place au sein d'une infrastructure sécurisée, ce qui pose des contraintes fortes.
La personne retenue sera un acteur majeur dans la définition du protocole d'entraînement et de mise en oeuvre initiale de ce protocole, en coordination avec les partenaires du projet et en fonction des contraines liées à l'infrastructure de calcul.
Mission confiée
Missions :
En relation avec les membres de l'équipe ALMANACH (plus particulièrement Éric de la Clergerie), et en interaction avec les partenaires médicaux, la personne recrutée devra définir un protocole précis pour l'entraînement du modèle médical, avec en premier lieu le choix d'un modèle initial dont l'entraînement sera prolongé (par exemple un modèle QWEN 3.* 30 milliards de paramètres) et ensuite les modes optimaux d'exploitation des données cliniques (en continual pretraining ou instruction tuning par exemple).
Des essais préliminaires seront conduits sur des données non confidentielles (données publiques, fictives, ...) pour une évaluation préliminaire des points clés de ce protocole. Ce travail devrait conduire à une bibliothèque de code exploitable pour démarrer l'entraînement à grande échelle.
Dès que ce protocole sera bien établi et que des données cliniques seront disponibles sur l'instrastructure sécurisée de calcul, la personne recrutée sera en charge de lancer et monitorer l'entraînement sur celles-ci, en réalisant les adaptations nécessaires si besoin.
Principales activités
Principales activés :
- veille sur les développpements rapides en IA génératives pour (a) sélectionner le meilleur LLM pouvant servir de base pour le modèle médical et (b) les modes d'entraînement adaptés (probablement à base d'instructions sous forme de tâches)
- conception de tâches pouvant en particulier être synthétisées à partir de dossiers patient
- évaluation à petite échelle des divers modes d'entraînement sur des données non confidentielles
- à partir de ces évaluations, conception d'une bibliothèque de code pouvant facilement être déployée au sein de l'infrastructure sécurisée de calcul.
- recensement de jeux de données pour l'évaluation du modèle, soit existant en français, soit par traduction, soit par distillation à partir de LLM médicaux existants
- mise en oeuvre initiale de l'entraînement du modèle médical une fois les données cliniques disponibles au sein de l'infrastructure sécurisée
Compétences
Compétences techniques et niveau requis :
- excellente maîtrise des techonologies liées aux LLM, en particulier sur leurs entraînements (Continual Pre-Training, Supervised Fine-Tuning, Reinforcement Learning, Distillation, ...) et évaluations, avec la pratique des bibliothèques Python associées
- bonne connaissance des données médicales
- expérience préliminaire dans l'utilisation de plateformes de calcul sécurisées, avec de plus une sensibilisation aux aspects liés à la confidentialité des données
Langues : français, anglais si possible
Compétences relationnelles : capacité à interargir avec de nombreux partenaires dans un cadre pluri-disciplinaire (informatique/IA et médical)
Compétences additionnelles appréciées :
Avantages
- Restauration subventionnée
- Transports publics remboursés partiellement
- Congés: 7 semaines de congés annuels + 10 jours de RTT (base temps plein) + possibilité d'autorisations d'absence exceptionnelle (ex : enfants malades, déménagement)
- Possibilité de télétravail et aménagement du temps de travail
- Équipements professionnels à disposition (visioconférence, prêts de matériels informatiques, etc.)
- Prestations sociales, culturelles et sportives (Association de gestion des oeuvres sociales d'Inria)
- Accès à la formation professionnelle
- Sécurité sociale
Compétences requises
- Python
- Anglais
- Distillation
- Français