Datenbereinigungs- und Profiling-Skripte in Python, die Sie prüfen können
Der erste Durchgang bei einem neuen Datensatz ist immer dieselbe Fleißarbeit: Form, Datentypen, fehlende Werte, Duplikate und Ausreißer prüfen, bevor die eigentliche Analyse beginnen kann. Analysten beschreiben inzwischen die Spalten des Datensatzes und lassen die KI das Profiling und die Bereinigung übernehmen — eine Aufgabe, die früher einen Nachmittag dauerte, schrumpft so auf deutlich unter eine Stunde, vorausgesetzt das Skript ist prüfbar und keine Rohdaten verlassen das Haus.
Sie sind ein mit pandas versierter Datenanalyst. Schreiben Sie Python-Code, um einen Datensatz zu profilieren und zu bereinigen. Ich führe ihn selbst gegen die echten Daten aus. Spalten und Datentypen (keine Live-Daten, nur die Struktur): {{data_description}} Mein Bereinigungsziel: {{objective}} Regeln: - Arbeiten Sie ausschließlich mit der beschriebenen Struktur. Nehmen Sie keine Verteilungen, Kategoriewerte oder Wertebereiche an, die Sie nicht sehen können. Wo eine Entscheidung von den tatsächlichen Daten abhängt, geben Sie eine gedruckte Zusammenfassung oder ein Assert aus, keine fest codierte Annahme. - Jede Transformation muss reversibel und protokolliert sein: Geben Sie für jeden Schritt die Zeilen- und Null-Anzahl vorher/nachher aus, und verwerfen Sie niemals stillschweigend Zeilen — markieren Sie sie in einem separaten Frame, den ich prüfen kann. - Behandeln Sie die klassischen Fallstricke explizit: als Text formatierte Zahlen, gemischte Datumsformate, Leerzeichen und Groß-/Kleinschreibung in kategorialen Werten sowie Division durch Null in jeder abgeleiteten Kennzahl. - Legen Sie jeden Schwellenwert, den ich eventuell ändern möchte (Ausreißer-Cutoff, Null-Strategie), in klar benannten Variablen am Anfang ab. - Schließen Sie mit einem kurzen Datenqualitätsbericht ab: Zeilen rein/raus, betroffene Spalten und alles, was ich manuell entscheiden sollte. - Fügen Sie zu jedem nicht offensichtlichen Schritt einen einzeiligen Kommentar hinzu. Lesbarkeit vor Cleverness.
Tragen Sie Ihre Angaben ein — der Prompt aktualisiert sich live. Dann kopieren.
# --- Einstellbare Parameter --- NULL_STRATEGY = "flag" # flag, drop oder fill OUTLIER_Z = 3.0 before = len(df) df["plan"] = df["plan"].str.strip().str.lower().map( {"free": "Free", "pro": "Pro"}).fillna(df["plan"]) df["mrr"] = pd.to_numeric( df["mrr"].str.replace(r"[$,]", "", regex=True), errors="coerce") # Zeilen, bei denen mrr nicht geparst werden konnte, werden behalten und markiert, nicht verworfen: bad_mrr = df[df["mrr"].isna()] print(f"rows in={before} unparseable mrr={len(bad_mrr)}") dupes = df[df.duplicated("customer_id", keep=False)] print(f"duplicate customer_ids: {dupes['customer_id'].nunique()} ids, {len(dupes)} rows") # Datenqualitätsbericht: bad_mrr und dupes vor der Analyse prüfen.
Der komplette Arbeitsablauf
- Beschreiben Sie die Spalten und Datentypen anhand Ihres Schemas, nicht durch Einfügen echter Zeilen
- Führen Sie das Skript an einer Kopie der Daten aus und lesen Sie die ausgegebenen Vorher/Nachher-Zählungen bei jedem Schritt
- Prüfen Sie jeden markierten Frame (fehlgeschlagene Parses, Duplikate, Ausreißer), statt einem automatischen Verwerfen zu vertrauen
- Rechnen Sie jede abgeleitete Kennzahl an ein paar Zeilen von Hand nach, bevor Sie darauf eine Analyse aufbauen
Worauf Sie achten sollten
KI ist bei Zahlen am gefährlichsten: Sie liefert überzeugende, falsche Antworten bei Zeitreihen und abgeleiteten Kennzahlen, statt Unsicherheit einzugestehen. Prüfen Sie Jahr-über-Jahr-Rechnungen und jede Berechnung mit Lücken oder Nullen selbst nach.
Laden Sie keine Dateien mit echten Kunden- oder Mitarbeiterdaten in ein KI-Tool für Verbraucher hoch, um sie zu bereinigen. Nutzen Sie das Muster mit beschriebenem Schema oder eine synthetische bzw. vollständig anonymisierte Stichprobe auf einer freigegebenen Instanz — personenbezogene Daten in einem öffentlichen Tool können gegen Datenschutzrecht und Ihre eigene Governance-Richtlinie verstoßen.
Ein Bereinigungsskript, das die Zeilenanzahl verändert, verändert Ihre Ergebnisse. Akzeptieren Sie niemals ein stillschweigendes Verwerfen oder Auffüllen — jede Transformation braucht ein protokolliertes Vorher/Nachher, das Sie tatsächlich lesen.
Woher das stammt
Jeder Anwendungsfall auf dieser Website beruht auf echten Berichten, die Datenanalysten aus der Praxis geteilt haben — nichts davon ist von uns erfunden.