Rattrapage 2026
Vous traiterez 4 projets sur des jeux de données publics. Pour chacun :
-
Téléchargez le dataset depuis le lien Kaggle indiqué.
-
Réalisez une EDA rapide : types des variables, distributions, valeurs manquantes, premières visualisations. Concluez par écrit sur la nature du problème et la métrique pertinente.
-
Choisissez la démarche que vous estimez adaptée — c'est à vous de décider après l'EDA.
-
Implémentez votre solution, évaluez-la honnêtement (validation croisée, jeu de test mis de côté…), et commentez vos choix méthodologiques.
Format de rendu : un seul notebook Jupyter (.ipynb) contenant les 4 projets, dans des sections clairement identifiées. Le notebook doit pouvoir être ré-exécuté de bout en bout.
1. Petites annonces de véhicules d'occasion
Vous récupérez l'export d'un site américain d'annonces de voitures d'occasion (~400 000 annonces, ~25 colonnes). Vous y trouvez le constructeur, le modèle, l'année, le kilométrage, l'état déclaré, le type de carburant, la transmission, la couleur, l'État (US) de l'annonce, ainsi que le prix affiché.
Les annonces ont été saisies à la main : beaucoup de valeurs manquantes, des prix aberrants (0 …), des modalités à très haute cardinalité, des doublons potentiels.
À vous de déterminer ce que vous voulez prédire et comment encoder proprement les colonnes catégorielles avant de modéliser.
🔗 Dataset Kaggle — Used Cars Dataset (Craigslist)
2. Spaceship Titanic — passagers disparus
Le vaisseau Spaceship Titanic transportait environ 8 700 passagers vers trois exoplanètes habitables quand il a traversé une anomalie spatiale.
Vous disposez des données de voyage : cabine, planète d'origine, âge, dépenses dans les commodités du bord, ainsi qu'une variable cible
Transported. Plusieurs colonnes contiennent des valeurs manquantes et le nom complet des passagers laisse deviner des regroupements familiaux qu'il peut être utile d'exploiter.
🔗 Dataset Kaggle — Spaceship Titanic
3. Kuzushiji-MNIST — caractères cursifs anciens
Le KMNIST est un jeu de 70 000 images en niveaux de gris (28×28) de caractères japonais cursifs (kuzushiji) extraits de livres historiques de l'époque Edo.
Comme MNIST il y a 10 classes (dix hiragana), mais la difficulté visuelle est plus élevée : la même classe peut avoir des graphies très variées et certains caractères se ressemblent beaucoup.
Vous reprendrez une démarche analogue à celle vue sur MNIST classique, en l'adaptant si nécessaire.
🔗 Dataset Kaggle — Kuzushiji-MNIST
4. Alien vs Predator — qui est qui ?
Une base d'images de stills cinématographiques mélange des photographies des deux franchises de science-fiction Alien et Predator. Le jeu contient quelques centaines d'images couleur seulement, organisées en deux dossiers (
alien et predator), avec un partage train/validation déjà effectué.
Le défi : entraîner un classifieur visuel performant à partir d'un très petit volume de données.
🔗 Dataset Kaggle — Alien vs Predator Images
Conseils généraux
- L'EDA conditionne tout : prenez le temps de comprendre les données avant de coder un modèle.
- Documentez vos hypothèses, vos choix de prétraitement et de métrique.
- Une baseline simple bien évaluée vaut mieux qu'un modèle compliqué bricolé.
- Vous pouvez utiliser Kaggle Notebooks pour profiter de l'environnement et du GPU, puis rapatrier le
final ici..ipynb