Stage PFE Data Quality Challenge : fiabiliser la donnée avec l'IA générative (Qualité de la donnée, Deep Learning, Modèles de diffusion, Data Science)
Aubay · Boulogne-Billancourt, Île-de-France, France
Apply & track with Apply EdgeCe sujet de stage est rattaché au lab'Innov d'Aubay. il s'agit de la cellulle d'innovation du groupe Aubay. Tu pourras intervenir sur des projets en mode R&D adoptant une approche agile. À Paris ou à Lyon, nous te proposons des sujets Innovants notamment sur l’IA, la Data, le numérique responsable ... et encore pleins d’autres à découvrir !ici, nous te proposons le stage "Data Quality Challenge"Et si on rendait la donnée irréprochable ? Benchmarke les algorithmes les plus récents – des statistiques classiques aux modèles de diffusion – pour imputer les valeurs manquantes et détecter les anomalies.LE SUJET :La qualité de la donnée est un élément essentiel en entreprise : pour la prise de décisions, un pilotage efficace, ou être le point de départ d'un projet réussi. C'est pourquoi le Lab'Innov d'Aubay en a fait un axe de recherche majeur, adossé à une thèse en cours sur le sujet.Ta mission : explorer et confronter trois familles d'approches – méthodes statistiques, réseaux profonds et modèles de diffusion – pour imputer les données manquantes et détecter les anomalies. L'objectif n'est pas seulement la performance : nous cherchons la solution la plus sobre et la plus rapide, capable d'être industrialisée dans nos pipelines de données.Tu travailleras au cœur d'une équipe R&D, avec un vrai sujet ouvert, des moyens de calcul et la liberté de proposer tes propres pistes.TA CONTRIBUTION :Il te faudra :
- Établir un état de l'art structuré des trois familles d'algorithmes (statistiques, profonds, diffusion) pour l'imputation et la détection d'anomalies.
- Concevoir un protocole d'évaluation commun mesurant performance, robustesse, temps de calcul et consommation énergétique.
- Implémenter et comparer des algorithmes représentatifs de chaque famille sur des jeux de données de référence.
- Identifier les conditions dans lesquelles les modèles de diffusion apportent un gain réel face à des méthodes plus simples – et à quel coût.
- Restituer tes résultats à l'équipe et contribuer aux publications / livrables du Lab'Innov.POUR TOI :
- Une immersion dans un projet de recherche.
- La maîtrise de modèles de pointe (dont les modèles de diffusion) sur un cas d'usage concret, pas un exercice d'école.
- Une compétence très recherchée : savoir évaluer et industrialiser un modèle, pas seulement l'entraîner.
- Un livrable valorisable (benchmark, article, soutenance) et une porte d'entrée vers un CDI chez Aubay.Mots clés : Data Quality, Imputation, Détection d'anomalies, Modèles de diffusion, Deep Learning, Stack technique : Benchmark, R&D, Thèse, Frugalité numériquePython, PyTorch, scikit-learn, Pandas / NumPy, modèles de diffusion, Git, Jupyter / MLflowQUI ES-TU ?Tu es en dernière année d'école d'ingénieur ou équivalent, et tu recherches un stage de fin d'études de 4 à 6 mois, pour démarrer entre février et avril 2027.Tu es une personne motivée, dynamique et autonome. Avec un attrait pour la R&D et l'innovation. Tu aimes le travail en équipe.Opportunité de CDI à la fin du stage.