Conception et mise en oeuvre d'un protocole d'entraînement d'un LLM médical français
Inria (French Institute for Research in Computer Science and Automation)
SecurityPosted Aug 26, 2026via html-list
Conception et mise en oeuvre d'un protocole d'entraînement d'un LLM médical français
Download job offer in PDF format
The offer description be low is in French
Contract type :
Fixed-term contract
Level of qualifications required :
Graduate degree or equivalent
Other valued qualifications :
thèse
Fonction :
Temporary scientific engineer
Level of experience :
Recently graduated
Context
Cette proposition de poste s'inscrit dans le cadre du projet FG4H financé par la BPI, projet qui a vocation à développer un grand modèle de langue (LLM) spécialisé pour le domaine médical français, en s'appuyant sur plusieurs millions de dossiers patients fournis par les partenaires du projets.
Pour des raisons de confidentialités des données, l'entraînement et la validation de ce modèle prendra place au sein d'une infrastructure sécurisée, ce qui pose des contraintes fortes.
La personne retenue sera un acteur majeur dans la définition du protocole d'entraînement et de mise en oeuvre initiale de ce protocole, en coordination avec les partenaires du projet et en fonction des contraines liées à l'infrastructure de calcul.
Assignment
Missions :
En relation avec les membres de l'équipe ALMANACH (plus particulièrement Éric de la Clergerie), et en interaction avec les partenaires médicaux, la personne recrutée devra définir un protocole précis pour l'entraînement du modèle médical, avec en premier lieu le choix d'un modèle initial dont l'entraînement sera prolongé (par exemple un modèle QWEN 3.* 30 milliards de paramètres) et ensuite les modes optimaux d'exploitation des données cliniques (en continual pretraining ou instruction tuning par exemple).
Des essais préliminaires seront conduits sur des données non confidentielles (données publiques, fictives, ...) pour une évaluation préliminaire des points clés de ce protocole. Ce travail devrait conduire à une bibliothèque de code exploitable pour démarrer l'entraînement à grande échelle.
Dès que ce protocole sera bien établi et que des données cliniques seront disponibles sur l'instrastructure sécurisée de calcul, la personne recrutée sera en charge de lancer et monitorer l'entraînement sur celles-ci, en réalisant les adaptations nécessaires si besoin.
Main activities
Principales activés :
• veille sur les développpements rapides en IA génératives pour (a) sélectionner le meilleur LLM pouvant servir de base pour le modèle médical et (b) les modes d'entraînement adaptés (probablement à base d'instructions sous forme de tâches)
• conception de tâches pouvant en particulier être synthétisées à partir de dossiers patient
• évaluation à petite échelle des divers modes d'entraînement sur des données non confidentielles
• à partir de ces évaluations, conception d'une bibliothèque de code pouvant facilement être déployée au sein de l'infrastructure sécurisée de calcul.
• recensement de jeux de données pour l'évaluation du modèle, soit existant en français, soit par traduction, soit par distillation à partir de LLM médicaux existants
• mise en oeuvre initiale de l'entraînement du modèle médical une fois les données cliniques disponibles au sein de l'infrastructure sécurisée
Skills
Compétences techniques et niveau requis :
• excellente maîtrise des techonologies liées aux LLM, en particulier sur leurs entraînements (Continual Pre-Training, Supervised Fine-Tuning, Reinforcement Learning, Distillation, ...) et évaluations, avec la pratique des bibliothèques Python associées
• bonne connaissance des données médicales
• expérience préliminaire dans l'utilisation de plateformes de calcul sécurisées, avec de plus une sensibilisation aux aspects liés à la confidentialité des données
Langues : français, anglais si possible
Compétences relationnelles : capacité à interargir avec de nombreux partenaires dans un cadre pluri-disciplinaire (informatique/IA et médical)
Compétences additionnelles appréciées :
Benefits package
• Restauration subventionnée
• Transports publics remboursés partiellement
• Congés: 7 semaines de congés annuels + 10 jours de RTT (base temps plein) + possibilité d'autorisations d'absence exceptionnelle (ex : enfants malades, déménagement)
• Possibilité de télétravail et aménagement du temps de travail
• Équipements professionnels à disposition (visioconférence, prêts de matériels informatiques, etc.)
• Prestations sociales, culturelles et sportives (Association de gestion des œuvres sociales d'Inria)
• Accès à la formation professionnelle
• Sécurité sociale
Apply for this position
Share
• Facebook
• Linkedin
• Twitter
• Email
General Information
• Theme/Domain :
Language, Speech and Audio
Statistics (Big data)
(BAP E)
• Town/city :
Paris
• Inria Center :
Centre Inria de Paris
• Starting date :
2026-10-01
• Duration of contract :
3 months
• Deadline to apply :
2026-09-26
Warning : you must enter your e-mail address in order to save your application to Inria. Applications must be submitted online on the Inria website. Processing of applications sent from other channels is not guaranteed.
Instruction to apply
Defence Security :
This position is likely to be situated in a restricted area (ZRR), as defined in Decree No. 2011-1425 relating to the protection of national scientific and technical potential (PPST).Authorisation to enter an area is granted by the director of the unit, following a favourable Ministerial decision, as defined in the decree of 3 July 2012 relating to the PPST. An unfavourable Ministerial decision in respect of a position situated in a ZRR would result in the cancellation of the appointment.
Recruitment Policy :
As part of its diversity policy, all Inria positions are accessible to people with disabilities.
Contacts
• Inria Team :
ALMANACH
• Recruiter :
Villemonte De La Clergeri Eric
/
Eric.Villemonte_De_La_Clergerie@inria.fr
The keys to success
La personne recrutée doit être passionnée par les développements de l'IA générative (LLM) et leurs applications sociétales, ici dans le domaine de la santé qui soulève divers défis (confidentialité des données, extrême techinicité des documents médicaux, ...). Elle doit être prête à interagir avec un public divers (informaticiens IA, experts médicaux, gestionaires d'infrastructure, ...). Elle doit également savoir se tenir au courant et prendre en compte des évolutions très rapides dans le domaine de l'IA générative.
About Inria
Inria, the French national institute for research in digital science and technology, supports the French government in national research and innovation strategies in the digital field, acting as Digital Programs Agency. Inria leads over 300 research and innovation projects with its 3,500 scientists, engineers, and support staff, in partnership with universities and the digital ecosystem (businesses, entrepreneurs, and public stakeholders). Together, we explore strategic fields such as artificial intelligence, cybersecurity, quantum computing, cloud technologies, digital transformation in healthcare, digital twins, and digital technologies for defence. We develop practical solutions such as software, tech startups, partnerships with national companies, and cutting-edge training programmes. Our goal is to drive scientific, technological, and industrial excellence to ensure France’s digital sovereignty.
Source URL: https://jobs.inria.fr/public/classic/en/offres/2026-10424