Scripts de limpieza y perfilado de datos en Python que puedes auditar
El primer repaso de un conjunto de datos nuevo siempre es la misma rutina: revisar la forma, los tipos de datos, los valores faltantes, los duplicados y los valores atípicos antes de poder empezar el análisis real. Ahora los analistas describen las columnas del conjunto de datos y le encargan a la IA el código de perfilado y limpieza, reduciendo una tarea que llevaba una tarde entera a bastante menos de una hora, siempre que el script sea auditable y ningún dato en bruto salga de la organización.
Eres un analista de datos experto en pandas. Escribe código Python para perfilar y limpiar un conjunto de datos. Yo lo ejecutaré con los datos reales. Columnas y tipos de datos (sin datos reales, solo la estructura): {{data_description}} Mi objetivo de limpieza: {{objective}} Reglas: - Trabaja solo a partir de la estructura descrita. No asumas distribuciones, valores de categorías ni rangos que no puedas ver. Cuando una decisión dependa de los datos reales, genera un resumen impreso o un assert, no una suposición fija en el código. - Cada transformación debe ser reversible y quedar registrada: imprime los conteos de filas y valores nulos antes/después de cada paso, y nunca elimines filas en silencio; márcalas en un dataframe separado que yo pueda revisar. - Maneja explícitamente las trampas clásicas: números con formato de texto, formatos de fecha mixtos, espacios y mayúsculas/minúsculas inconsistentes en categóricas, y división por cero en cualquier métrica derivada. - Pon cada umbral que yo podría querer cambiar (corte de valores atípicos, estrategia para nulos) en variables claramente nombradas al inicio. - Termina con un breve informe de calidad de datos: filas de entrada frente a salida, columnas afectadas y cualquier cosa que deba decidir manualmente. - Añade un comentario de una línea en cada paso que no sea obvio. Prioriza que sea legible antes que ingenioso.
Rellena tus datos y el prompt se actualiza al instante — luego cópialo.
# --- parámetros que puedes cambiar --- NULL_STRATEGY = "flag" # flag, drop o fill OUTLIER_Z = 3.0 before = len(df) df["plan"] = df["plan"].str.strip().str.lower().map( {"free": "Free", "pro": "Pro"}).fillna(df["plan"]) df["mrr"] = pd.to_numeric( df["mrr"].str.replace(r"[$,]", "", regex=True), errors="coerce") # las filas donde mrr no se pudo convertir se conservan y se marcan, no se eliminan: bad_mrr = df[df["mrr"].isna()] print(f"rows in={before} unparseable mrr={len(bad_mrr)}") dupes = df[df.duplicated("customer_id", keep=False)] print(f"duplicate customer_ids: {dupes['customer_id'].nunique()} ids, {len(dupes)} rows") # Informe de calidad de datos: revisa bad_mrr y dupes antes de analizar.
El flujo de trabajo completo
- Describe las columnas y tipos de datos de tu esquema, sin pegar filas reales
- Ejecuta el script sobre una copia de los datos y revisa los conteos antes/después que se imprimen en cada paso
- Inspecciona cada dataframe marcado (conversiones fallidas, duplicados, valores atípicos) en lugar de confiar en una eliminación automática
- Vuelve a calcular a mano cualquier métrica derivada en unas cuantas filas antes de construir el análisis sobre ella
Cuidado con
La IA es más peligrosa con los números: produce respuestas seguras pero equivocadas en series temporales y métricas derivadas en lugar de admitir incertidumbre. Verifica tú mismo los cálculos interanuales y cualquier cálculo con vacíos o ceros.
No subas archivos con datos reales de clientes o empleados a una herramienta de IA de consumo para limpiarlos. Usa el patrón de esquema descrito, o una muestra sintética o totalmente anonimizada, en una instancia aprobada: la PII en una herramienta pública puede infringir la ley de protección de datos y tu propia política de gobernanza.
Un script de limpieza que cambia el número de filas cambia tus resultados. Nunca aceptes una eliminación o relleno silencioso: cada transformación necesita un registro antes/después que realmente revises.
De dónde sale esto
Cada caso de uso de este sitio se basa en relatos reales de los analistas de datos en activo — no lo inventamos nosotros.
Más casos de uso de IA para los analistas de datos
Consultas SQL escritas y depuradas a partir de un esquema descrito
comunicaciónResúmenes ejecutivos que convierten un gráfico en una decisión
redacciónDiccionarios de datos y documentación de consultas redactados a partir del propio SQL
planificaciónSolicitudes vagas de interesados convertidas en un plan de análisis delimitado
creatividadEl gráfico adecuado para el mensaje, no solo para los datos
← Los 6 casos de uso: cómo los analistas de datos usan la IA