RattrapageRattrapage 2026
Vous traiterez **4 projets** sur des jeux de données publics. Pour chacun :
1. Téléchargez le dataset depuis le lien Kaggle indiqué.
2. Réalisez une **EDA rapide** : types des variables, distributions, valeurs manquantes, premières visualisations. Concluez par écrit sur la nature du problème et la métrique pertinente.
3. Choisissez la démarche que vous estimez adaptée — c'est à vous de décider après l'EDA.
4. Implémentez votre solution, évaluez-la honnêtement (validation croisée, jeu de test mis de côté…), et commentez vos choix méthodologiques.
**Format de rendu :** un **seul notebook Jupyter (.ipynb)** contenant les 4 projets, dans des sections clairement identifiées. Le notebook doit pouvoir être ré-exécuté de bout en bout.
---
### 1. Petites annonces de véhicules d'occasion
Vous récupérez l'export d'un site américain d'annonces de voitures d'occasion (~400 000 annonces, ~25 colonnes). Vous y trouvez le constructeur, le modèle, l'année, le kilométrage, l'état déclaré, le type de carburant, la transmission, la couleur, l'État (US) de l'annonce, ainsi que le prix affiché.
Les annonces ont été saisies à la main : beaucoup de valeurs manquantes, des prix aberrants (0 $, 9 999 999 $…), des modalités à très haute cardinalité, des doublons potentiels.
À vous de déterminer ce que vous voulez prédire et comment encoder proprement les colonnes catégorielles avant de modéliser.
🔗 [Dataset Kaggle — Used Cars Dataset (Craigslist)](https://www.kaggle.com/datasets/austinreese/craigslist-carstrucks-data)
---
### 2. Spaceship Titanic — passagers disparus
Le vaisseau *Spaceship Titanic* transportait environ 8 700 passagers vers trois exoplanètes habitables quand il a traversé une anomalie spatiale.
Vous disposez des données de voyage : cabine, planète d'origine, âge, dépenses dans les commodités du bord, ainsi qu'une variable cible `Transported`. Plusieurs colonnes contiennent des valeurs manquantes et le nom complet des passagers laisse deviner des regroupements familiaux qu'il peut être utile d'exploiter.
🔗 [Dataset Kaggle — Spaceship Titanic](https://www.kaggle.com/competitions/spaceship-titanic/data)
---
### 3. Kuzushiji-MNIST — caractères cursifs anciens
Le KMNIST est un jeu de 70 000 images en niveaux de gris (28×28) de caractères japonais cursifs (*kuzushiji*) extraits de livres historiques de l'époque Edo.
Comme MNIST il y a 10 classes (dix hiragana), mais la difficulté visuelle est plus élevée : la même classe peut avoir des graphies très variées et certains caractères se ressemblent beaucoup.
Vous reprendrez une démarche analogue à celle vue sur MNIST classique, en l'adaptant si nécessaire.
🔗 [Dataset Kaggle — Kuzushiji-MNIST](https://www.kaggle.com/datasets/anokas/kuzushiji)
---
### 4. Alien vs Predator — qui est qui ?
Une base d'images de stills cinématographiques mélange des photographies des deux franchises de science-fiction *Alien* et *Predator*. Le jeu contient quelques centaines d'images couleur seulement, organisées en deux dossiers (`alien` et `predator`), avec un partage train/validation déjà effectué.
Le défi : entraîner un classifieur visuel performant à partir d'un très petit volume de données.
🔗 [Dataset Kaggle — Alien vs Predator Images](https://www.kaggle.com/datasets/pmigdal/alien-vs-predator-images)
---
**Conseils généraux**
- L'EDA conditionne tout : prenez le temps de comprendre les données avant de coder un modèle.
- Documentez vos hypothèses, vos choix de prétraitement et de métrique.
- Une baseline simple bien évaluée vaut mieux qu'un modèle compliqué bricolé.
- Vous pouvez utiliser Kaggle Notebooks pour profiter de l'environnement et du GPU, puis rapatrier le `.ipynb` final ici.
max 50 MB · types : .ipynb