Scripts de nettoyage et de profilage de données en Python, faciles à auditer
La première passe sur un nouveau jeu de données est toujours la même corvée : vérifier la forme, les types, les valeurs manquantes, les doublons et les valeurs aberrantes avant de pouvoir commencer une véritable analyse. Les analystes décrivent désormais les colonnes du jeu de données et confient à l'IA le code de profilage et de nettoyage, réduisant une tâche qui prenait un après-midi à bien moins d'une heure — à condition que le script soit auditable et qu'aucune donnée brute ne quitte l'entreprise.
Vous êtes analyste de données, à l'aise avec pandas. Écrivez du code Python pour profiler et nettoyer un jeu de données. Je l'exécuterai moi-même sur les données réelles. Colonnes et types (pas de données réelles, juste la structure) : {{data_description}} Mon objectif de nettoyage : {{objective}} Règles : - Travaillez uniquement à partir de la structure décrite. Ne supposez pas de distributions, de valeurs de catégories ou de plages que vous ne pouvez pas voir. Lorsqu'une décision dépend des données réelles, produisez un résumé imprimé ou une assertion (assert), pas une hypothèse codée en dur. - Chaque transformation doit être réversible et journalisée : affichez le nombre de lignes et de valeurs nulles avant/après pour chaque étape, et ne supprimez jamais de lignes silencieusement — isolez-les dans un dataframe séparé que je pourrai inspecter. - Traitez explicitement les pièges classiques : nombres au format texte, formats de date mixtes, espaces et casse dans les variables catégorielles, et division par zéro dans tout indicateur dérivé. - Placez chaque seuil que je pourrais vouloir modifier (seuil de valeur aberrante, stratégie pour les nulls) dans des variables clairement nommées en haut du script. - Terminez par un court rapport de qualité des données : lignes en entrée vs en sortie, colonnes concernées, et tout ce que je devrais décider manuellement. - Ajoutez un commentaire d'une ligne sur chaque étape non évidente. Privilégiez la lisibilité à l'élégance.
Renseignez vos informations : le prompt se met à jour en direct — puis copiez-le.
# --- paramètres modifiables --- NULL_STRATEGY = "flag" # flag, drop, ou fill OUTLIER_Z = 3.0 before = len(df) df["plan"] = df["plan"].str.strip().str.lower().map( {"free": "Free", "pro": "Pro"}).fillna(df["plan"]) df["mrr"] = pd.to_numeric( df["mrr"].str.replace(r"[$,]", "", regex=True), errors="coerce") # les lignes où mrr n'a pas pu être converti sont conservées et signalées, pas supprimées : bad_mrr = df[df["mrr"].isna()] print(f"rows in={before} unparseable mrr={len(bad_mrr)}") dupes = df[df.duplicated("customer_id", keep=False)] print(f"duplicate customer_ids: {dupes['customer_id'].nunique()} ids, {len(dupes)} rows") # Rapport de qualité des données : examinez bad_mrr et dupes avant l'analyse.
Le flux de travail complet
- Décrivez les colonnes et les types à partir de votre schéma, sans coller de lignes réelles
- Exécutez le script sur une copie des données et lisez les comptages avant/après affichés à chaque étape
- Inspectez chaque dataframe signalé (parsing raté, doublons, valeurs aberrantes) au lieu de faire confiance à une suppression automatique
- Recalculez à la main tout indicateur dérivé sur quelques lignes avant de bâtir une analyse dessus
Attention à
L'IA est particulièrement dangereuse sur les chiffres : elle produit des réponses erronées mais assurées sur les séries temporelles et les indicateurs dérivés, plutôt que d'admettre une incertitude. Vérifiez vous-même les calculs d'évolution annuelle et tout calcul comportant des trous ou des zéros.
Ne téléversez pas de fichiers contenant de vraies données clients ou employés vers un outil d'IA grand public pour les nettoyer. Utilisez le principe du schéma décrit, ou un échantillon synthétique ou totalement anonymisé, sur une instance approuvée — des données personnelles dans un outil public peuvent enfreindre le droit de la protection des données et votre propre politique de gouvernance.
Un script de nettoyage qui modifie le nombre de lignes modifie vos résultats. N'acceptez jamais une suppression ou un remplissage silencieux — chaque transformation doit produire un avant/après journalisé que vous lisez réellement.
D’où ça vient
Chaque cas d’usage de ce site s’appuie sur des témoignages réels rapportés par les analystes de données en exercice — rien n’est inventé par nous.
Plus de cas d’usage de l’IA pour les analystes de données
Requêtes SQL rédigées et déboguées à partir d'un schéma décrit
communicationSynthèses pour décideurs qui transforment un graphique en décision
rédactionDictionnaires de données et documentation de requêtes rédigés à partir du SQL lui-même
planificationDes demandes floues des décideurs transformées en plan d'analyse cadré
créatifLe bon graphique pour le message, pas seulement pour la donnée
← Les 6 cas d’usage : comment les analystes de données utilisent l’IA