Prompt
Eres un analista de datos experto en pandas. Escribe código Python para perfilar y limpiar un conjunto de datos. Yo lo ejecutaré con los datos reales.

Columnas y tipos de datos (sin datos reales, solo la estructura): {{data_description}}

Mi objetivo de limpieza: {{objective}}

Reglas:
- Trabaja solo a partir de la estructura descrita. No asumas distribuciones, valores de categorías ni rangos que no puedas ver. Cuando una decisión dependa de los datos reales, genera un resumen impreso o un assert, no una suposición fija en el código.
- Cada transformación debe ser reversible y quedar registrada: imprime los conteos de filas y valores nulos antes/después de cada paso, y nunca elimines filas en silencio; márcalas en un dataframe separado que yo pueda revisar.
- Maneja explícitamente las trampas clásicas: números con formato de texto, formatos de fecha mixtos, espacios y mayúsculas/minúsculas inconsistentes en categóricas, y división por cero en cualquier métrica derivada.
- Pon cada umbral que yo podría querer cambiar (corte de valores atípicos, estrategia para nulos) en variables claramente nombradas al inicio.
- Termina con un breve informe de calidad de datos: filas de entrada frente a salida, columnas afectadas y cualquier cosa que deba decidir manualmente.
- Añade un comentario de una línea en cada paso que no sea obvio. Prioriza que sea legible antes que ingenioso.

Rellena tus datos y el prompt se actualiza al instante — luego cópialo.

Lo que obtienes (extracto)

# --- parámetros que puedes cambiar --- NULL_STRATEGY = "flag" # flag, drop o fill OUTLIER_Z = 3.0 before = len(df) df["plan"] = df["plan"].str.strip().str.lower().map( {"free": "Free", "pro": "Pro"}).fillna(df["plan"]) df["mrr"] = pd.to_numeric( df["mrr"].str.replace(r"[$,]", "", regex=True), errors="coerce") # las filas donde mrr no se pudo convertir se conservan y se marcan, no se eliminan: bad_mrr = df[df["mrr"].isna()] print(f"rows in={before} unparseable mrr={len(bad_mrr)}") dupes = df[df.duplicated("customer_id", keep=False)] print(f"duplicate customer_ids: {dupes['customer_id'].nunique()} ids, {len(dupes)} rows") # Informe de calidad de datos: revisa bad_mrr y dupes antes de analizar.

El flujo de trabajo completo

  1. Describe las columnas y tipos de datos de tu esquema, sin pegar filas reales
  2. Ejecuta el script sobre una copia de los datos y revisa los conteos antes/después que se imprimen en cada paso
  3. Inspecciona cada dataframe marcado (conversiones fallidas, duplicados, valores atípicos) en lugar de confiar en una eliminación automática
  4. Vuelve a calcular a mano cualquier métrica derivada en unas cuantas filas antes de construir el análisis sobre ella

Cuidado con

La IA es más peligrosa con los números: produce respuestas seguras pero equivocadas en series temporales y métricas derivadas en lugar de admitir incertidumbre. Verifica tú mismo los cálculos interanuales y cualquier cálculo con vacíos o ceros.

No subas archivos con datos reales de clientes o empleados a una herramienta de IA de consumo para limpiarlos. Usa el patrón de esquema descrito, o una muestra sintética o totalmente anonimizada, en una instancia aprobada: la PII en una herramienta pública puede infringir la ley de protección de datos y tu propia política de gobernanza.

Un script de limpieza que cambia el número de filas cambia tus resultados. Nunca aceptes una eliminación o relleno silencioso: cada transformación necesita un registro antes/después que realmente revises.

De dónde sale esto

Cada caso de uso de este sitio se basa en relatos reales de los analistas de datos en activo — no lo inventamos nosotros.

Más casos de uso de IA para los analistas de datos

← Los 6 casos de uso: cómo los analistas de datos usan la IA