Thèse Apprentissage Prédictif et Modèles de Monde pour les Systèmes Intelligents Multimodaux H/F - Doctorat.Gouv.Fr
- CDD
- Doctorat.Gouv.Fr
Les missions du poste
Établissement : Institut Polytechnique de Paris Télécom SudParis École doctorale : Ecole Doctorale de l'Institut Polytechnique de Paris Laboratoire de recherche : SAMOVAR - Services répartis, Architectures, Modélisation, Validation, Administration des Réseaux Direction de la thèse : Anis LAOUITI ORCID 0000000212874739 Début de la thèse : 2026-11-01 Date limite de candidature : 2026-11-30T23:59:59 Les systèmes intelligents ont de plus en plus besoin de comprendre et d'anticiper les environnements dynamiques en utilisant des informations issues de sources multiples et hétérogènes. Celles-ci peuvent inclure des images, de la vidéo, du texte, des données de capteurs, des traces de mobilité, des données de communication ou d'autres signaux contextuels. L'apprentissage prédictif et les approches basées sur les modèles de monde offrent une voie prometteuse pour acquérir des représentations compactes qui capturent la structure pertinente et l'évolution au fil du temps.
Cette proposition examine comment de telles approches peuvent soutenir la prédiction, l'apprentissage de représentations et la prise de décision au sein des systèmes intelligents multimodaux. Les domaines d'application potentiels comprennent la mobilité connectée, les systèmes sensibles aux communications (communication-aware), l'intelligence artificielle collaborative ainsi que d'autres environnements dynamiques. Le domaine d'application final sera sélectionné à l'issue d'une première revue de la littérature, d'une évaluation des données et d'une étude de faisabilité.
La proposition est délibérément agnostique en matière de modèles. JEPA est un exemple possible de cadre d'apprentissage prédictif auto-supervisé qui pourra être évalué au cours de la recherche, aux côtés d'autres approches appropriées telles que les méthodes basées sur les transformeurs, les approches contrastives, génératives ou les modèles de fondation multimodaux. Le choix final du modèle s'appuiera sur la problématique de recherche, les données disponibles, les contraintes de calcul et les preuves empiriques. Intelligent systems increasingly need to understand and anticipate dynamic environments using information from multiple and heterogeneous sources. Examples may include images, video, text, sensor data, mobility traces, communication data, or other contextual signals. Predictive learning and world-model approaches offer a promising direction for learning compact representations that capture relevant structure and change over time.
This proposal investigates how such approaches can support prediction, representation learning, and decision-making in multimodal intelligent systems. Potential application domains include connected mobility, communication-aware systems, collaborative artificial intelligence, and other dynamic environments. The final application domain will be selected after an initial literature review, data assessment, and feasibility study.
The proposal is deliberately model-agnostic. JEPA is one possible example of a self-supervised predictive-learning framework that may be evaluated during the research, alongside other suitable approaches such as transformer-based, contrastive, generative, or multimodal foundation-model methods. The final model choice will be based on the research question, available data, computational constraints, and empirical evidence.
Research Questions
1. How can predictive-learning and world-model approaches learn useful representations from heterogeneous multimodal data?
2. Which model families and learning strategies are most suitable for prediction and representation learning in the selected dynamic-system setting?
3. How can information from multiple modalities or sources be combined effectively while preserving accuracy, efficiency, and robustness?
4. What trade-offs exist among predictive performance, label efficiency, computational cost, and communication requirements?
5. Where distributed, federated, or collaborative settings are relevant, how can learning and information exchange be performed effectively and reliably?
6. How should robustness, privacy, trust, and security considerations be assessed for the selected application?
Objectives
- Conduct a literature review and gap analysis on predictive learning, world models, multimodal representation learning, and relevant intelligent-system applications.
- Identify a focused application domain, data source, experimental setting, and measurable research problem.
- Compare suitable model architectures and learning strategies without committing in advance to a single framework.
- Evaluate selected approaches in terms of predictive quality, label efficiency, computational resources, scalability, and robustness.
- Develop a reproducible experimental methodology and derive recommendations for the selected application context.
The research will proceed in stages. First, a systematic literature review and feasibility analysis will identify the most relevant problem setting, datasets or simulators, baseline methods, and evaluation criteria. Second, appropriate multimodal data and experimental scenarios will be selected. Third, candidate predictive-learning and world-model approaches will be implemented or adapted and compared against relevant baselines.
Depending on the selected use case, the work may examine centralized, federated, distributed, or collaborative learning settings. Model selection will remain evidence-driven: JEPA may be included as a baseline or candidate method, but it will not be a required architecture. The study will use the methods that best fit the final research question and available experimental resources.
Evaluation will consider appropriate measures such as prediction quality, representation usefulness for downstream tasks, label efficiency, computational and memory requirements, communication overhead where applicable, and robustness under realistic conditions. Additional privacy or security evaluations will be included only when they are relevant to the final selected system.
Le profil recherché
Parcours Académique : * Master de Recherche (M2) ou Diplôme d'Ingénieur en Intelligence Artificielle, Informatique ou Systèmes Embarqués.
Une expérience préalable dans le déploiement de l'IA est fortement souhaitée.
Recherche en Intelligence Artificielle & Deep Learning
Optimisation de Modèles (lightweight AI) : Maîtrise théorique et pratique des techniques de compression de modèles, incluant l'élagage (pruning), la quantification et la distillation de connaissances.
Architectures Avancées : Familiarité avec l'apprentissage auto-supervisé (Self-Supervised Learning) et les architectures de type JEPA (Joint Embedding Predictive Architecture).
Recherche d'Architecture Neuronale (NAS) : Expérience dans l'automatisation de la conception de modèles spécifiquement adaptés aux environnements matériels contraints.
Frameworks : Maîtrise experte de PyTorch ou TensorFlow.
Une expérience préalable dans le déploiement de l'IA est fortement souhaitée.
Recherche en Intelligence Artificielle & Deep Learning
Optimisation de Modèles (lightweight AI) : Maîtrise théorique et pratique des techniques de compression de modèles, incluant l'élagage (pruning), la quantification et la distillation de connaissances.
Architectures Avancées : Familiarité avec l'apprentissage auto-supervisé (Self-Supervised Learning) et les architectures de type JEPA (Joint Embedding Predictive Architecture).
Recherche d'Architecture Neuronale (NAS) : Expérience dans l'automatisation de la conception de modèles spécifiquement adaptés aux environnements matériels contraints.
Frameworks : Maîtrise experte de PyTorch ou TensorFlow.
Compétences requises
- Intelligence artificielle
- Distillation
- TensorFlow