Les missions du poste


Dans le cadre d'une mission au sein d'un organisme de la statistique publique, vous interviendrez en autonomie sur un projet de traitement automatique de formulaires et de reconnaissance d'écriture manuscrite, en lien avec une équipe métier basée à Lyon.

Vos responsabilités clés :

  • Développer un pipeline de reconnaissance d'écriture manuscrite (OCR/HTR) et de modèles vision-langage (VLM) sur des formulaires scannés
  • Prétraiter les images (redressement, binarisation), recaler/aligner les formulaires, segmenter et découper les zones d'intérêt
  • Comparer plusieurs modèles et approches, identifier les plus adaptés au besoin
  • Concevoir une méthodologie d'évaluation rigoureuse : métriques par tâche, calibration, gestion de l'incertitude, analyse fine des erreurs, scores de confiance
  • Construire un pipeline de sortie comparé automatiquement à un fichier de référence, avec analyse des divergences par classe de variable
  • Documenter la solution (code reproductible et versionné sous git, documentation technique, note de passation)
  • Assurer une restitution régulière, à l'écrit comme à l'oral, auprès de publics techniques et métier
  • Respecter des exigences fortes de confidentialité et de sécurité (secret statistique, non-exfiltration des données, transparence, auditabilité des traitements)

Le profil recherché

  • Formation : Master 2, diplôme d'ingénieur ou doctorat en science des données, apprentissage automatique, vision par ordinateur ou équivalent
  • Expérience : 2 à 5 ans en projets ML/IA, avec mise en production de projets de data science et évaluation rigoureuse des performances
  • Compétences techniques :
    • Python de niveau professionnel (PyTorch, OpenCV, écosystème Hugging Face, pandas)
    • Environnement Machine Learning avec MLflow, bonnes pratiques MLOps
    • Déploiement en environnement conteneurisé (Docker/Kubernetes), stockage objet S3, usage de GPU
    • Vision par ordinateur : prétraitement d'images, segmentation, détection de zones d'intérêt
    • Apprentissage profond : OCR/HTR, modèles vision-langage (VLM) ; fine-tuning de LLM/VLM open-weight apprécié

Compétences requises

  • Docker
  • Python
  • OpenCV
  • Intelligence artificielle
  • Autonomie
  • Kubernetes
  • Machine learning
  • Git
Postuler sur le site du recruteur

Ces offres pourraient aussi vous correspondre.

Recherches similaires

L’emploi par métier dans le domaine Data et IA à Paris