Thibaud.
← Retour aux projets
Terminé2023 · Data Analyst

Analyse de Données

Pipeline complet : nettoyage, stats, visualisation en Python

StackPython·Pandas·Matplotlib

Le contexte

Des données brutes ne disent rien tant qu'on ne les fait pas parler. L'enjeu : partir d'un jeu de données en vrac et en sortir des constats lisibles, même pour quelqu'un qui ne code pas.

Mon approche

Pipeline Python de bout en bout : ingestion, nettoyage et normalisation sous Pandas, calculs statistiques, puis visualisations claires avec Matplotlib et Seaborn pour faire ressortir les tendances.

Ce que j'en retire

La chaîne data complète maîtrisée, de la donnée sale au graphique qui raconte quelque chose. Et une surprise : coder le pipeline est la partie facile.

Je pensais que le dur serait les stats. En fait, le temps part dans le nettoyage (valeurs manquantes, formats incohérents, doublons) et surtout dans le « rendre lisible » : un bon graphique pour quelqu'un qui ne code pas vaut mieux qu'un calcul savant que personne ne lit. C'est cette obsession de la lisibilité que je garde de ce projet.

Graphique d'analyse de données
Visualisation de données en Python