Les missions du poste


Établissement : Institut Polytechnique de Paris École nationale supérieure de techniques avancées École doctorale : Ecole Doctorale de l'Institut Polytechnique de Paris Laboratoire de recherche : U2IS - Unité d'Informatique et d'Ingénierie des Systèmes Direction de la thèse : Sao Mai NGUYEN ORCID 0000000309290019 Début de la thèse : 2026-11-01 Date limite de candidature : 2026-10-31T23:59:59 Cette thèse se propose d'étudier la programmation et l'exécution semi-automatique de tâches du quotidien par un robot ou un exosquelette bras/main d'assistance au mouvement. Partant des outils à l'état de l'art sur la manipulation robotique humanoïde, l'enjeu sera de piloter une assistance robotique de manière naturelle ou du moins intuitive, acceptable et digne de confiance pour la réalisation de tâches quotidiennes par une Personne en Situation de Handicap (PSH) ayant une perte importante de mobilité du membre supérieur. Au-delà des techniques d'apprentissage utilisées en robotique humanoïde, l'utilisation de l'exosquelette permettra de faciliter les démonstrations et l'apprentissage de tâches du quotidien, notamment par une personne valide. Par ailleurs, lors de l'utilisation, les mouvements résiduels de l'utilisat.rice.eur pourront être interprétés comme signaux initiateurs et guident de l'intention, tout en permettant d'adapter l'exécution de la tâche de façon persistante, et ainsi améliorer l'appropriation. Cette thèse devra travailler sur plusieurs questions de recherche, dont la préservation de l'intégrité physique et le sentiment d'agentivité de l'utilisation constituent le fil directeur, et contribuent à l'originalité du sujet.

Comme précisé plus haut, l'amélioration de l'affordance est une thématique importante à travailler, pour la robustification de la saisie dans un premier temps, mais également pour la réalisation de tâches du quotidien. Ceci est également un bon vecteur pour impliquer l'utilisateur, et robustifier les tâches. Il s'agira donc ici de travailler sur des indicateurs d'affordance permettant tout d'abord d'améliorer la saisie d'objets non connus à l'avance, et d'étendre cela à la réalisation de tâches plus complexes.

L'apprentissage par renforcement étant à priori privilégié, dans le but de pré-entraîner, de généraliser et/ou de spécialiser cet apprentissage, un travail consistera à intégrer le système d'assistance et des bibliothèques d'objets dans un simulateur. L'objectif sera donc ici de réintégrer au sein du simulateur des déformations, bruits, troncatures liées à l'observation, affordances, et potentiellement efforts, afin d'être le plus proche possible de l'environnement réel et de sa variabilité potentielle. Cet outil de simulation devrait idéalement permettre d'entraîner les primitives d'actions, ainsi que l'orchestrateur, tout en étant contraint/guidé par des démonstrations [17], pour faciliter le transfert sim2real [18].

Enfin, l'implication de l'utilisateur valide ou PSH, lors de l'apprentissage et pendant l'exécution sera un élément différentiant important de la thèse. Notamment, un travail portera sur le partage du contrôle de l'exosquelette [19] et de la détection d'intention, que ce soit lors de l'initiation de la tâche, mais également lors de l'exécution, avec la possible réorientation [4], mais également la modification la probabilité des affordances de saisies et de primitives d'actions. L'objectif de cette thèse est de développer une architecture complète d'apprentissage multimodal, continu et sûr permettant à un bras et une main robotisés de type exosquelette :

· D'apprendre des tâches de manipulation du quotidien à partir de démonstrations humaines. Nous considererons un apprentissage hierarchique avec un bas niveau apprentant des primitives d'action atomiques et un planificateur [20], avec des tâches d'interaction simple dans un premier temps (apporter de la nourriture, manipulation/saisie, verser un liquide, ouvrir et fermer des portes, ...). Nous pourrons considerer la distillation de modeles de fondations dans des systemes plus légers pour bootstrapper l'apprentissage du planificateur.

· De généraliser ou spécialiser l'apprentissage via un apprentissage par renforcement en simulation, probablement Isaac Sim ou Genesis,

· D'Intégrer l'utilisateur dans la boucle d'apprentissage (human-in the-loop reinforcement learning [22,23]) pour réaliser des corrections d'intention en ligne, par exemple pour corriger la saisie ou l'action en cours d'exécution, pour faire ajouter des demonstrations de nouvelles taches [20] ou pour donner des instructions par interaction par langage naturel [21],

L'intégration de l'utilisateur dans la boucle d'apprentissage est également un élément important pour l'appropriation du système, que ce soit lors de l'initiation de la tâche ou en cours d'utilisation. Un travail de fond important sur l'apprentissage de l'affordance pourrait également permettre cette inclusion de l'utilisateur dans l'amélioration du pilotage. T0-T3 : Après une phase de revue de la littérature, de prise de contact avec des usagers, de prise en main du système matériel (capteurs, caméra, exosquelettes expérimental ABLE7D, bras robotiques expérimentaux Kinova Gen3/Jaco), et de définition des objets à manipuler et actions à réaliser, le doctorant pourra specifier les contraintes materielles et operationneles de son systeme.

T3-T9 : Il pourra compléter par une revue de la littérature sur les modeles d'apprentissage par imitation et renforcement, en particulier les approches pour la physical safety et par human-in-the-loop learning afin d'identifier les algorithmes correspondant aux contraintes identifiées. Il pourra alors initier des premières expérimentations/mesures sur système réel, ainsi que les premiers enregistrements et rejeux de démonstrations.
T9-T12: Viendra ensuite la phase de mise en place du simulateur tel que précisé plus haut, avec l'intégration des contraintes réelles, affordances, et démonstrations.

T12-T14 : Les algorithmes d'apprentissage par imitation et par renforcement pourront être déployés sur ce simulateur. Des tests pour la la sureté du systeme pourront être caractérisés

T3-T115 : En parallèle, le travail de recherche sur l'amélioration de l'affordance, de la compréhension de la scène, et de la prise en compte des entrées utilisateur (notamment de l'intention et des mouvements résiduels), sera initié et intégrée aux algorithmes d'apprentissage.

T15 -T18 Les resultats seront consolidés par des approches human-in the loop reinforcement learning pour integrés les demonstrations et informations de l'utilisateur, notamment pour mieux intégrer l'intention de l'utilisateur.

T18-T24. Puis, le transfert vers le système réel sera opéré, idéalement dès le début de la 2ème année, afin de laisser du temps aux observations, validations et améliorations expérientielles. Notamment le sentiment de maîtrise/agentivité et de robustesse/confiance, pourront être appréciés et améliorés uniquement lors de cette phase.

T24-T30 : Enfin, une évaluation par des usagers (aidants et/ou soignants) pourra être envisagée en fin de thèse.

Le profil recherché

Candidat.e issu d'une grande école d'ingénieur ou d'un Master 2, ayant une bonne maîtrise des outils informatiques et de la vision par ordinateur, ainsi que des bases solides en intelligence artificielle (idéalement en RL). Le candidat devra également s'intéresser à la robotique, et aimé le travail expérimental (des réalisations de projets personnels en robotiques seraient un plus), et avoir une sensibilité aux problématique de santé et de handicap.

Compétences requises

  • Intelligence artificielle
  • Robotique
Postuler sur le site du recruteur

Ces offres pourraient aussi vous correspondre.

Recherches similaires

L’emploi par métier dans le domaine Industrie à Paris