Scripts de limpeza e perfilamento de dados em Python que você pode auditar
A primeira passada em um novo dataset é sempre a mesma rotina: checar o shape, os dtypes, valores ausentes, duplicatas e outliers antes que qualquer análise de verdade possa começar. Hoje, analistas descrevem as colunas do dataset e deixam a IA gerar o código de perfilamento e limpeza, reduzindo uma tarefa que levava uma tarde inteira para bem menos de uma hora — desde que o script seja auditável e nenhum dado bruto saia da empresa.
Você é um analista de dados fluente em pandas. Escreva um código Python para perfilar e limpar um dataset. Eu mesmo vou executá-lo contra os dados reais. Colunas e dtypes (sem dados reais, apenas a estrutura): {{data_description}} Meu objetivo de limpeza: {{objective}} Regras: - Trabalhe apenas a partir da estrutura descrita. Não presuma distribuições, valores de categoria ou intervalos que você não pode ver. Quando uma decisão depender dos dados reais, gere um resumo impresso ou um assert, não uma suposição fixa no código. - Toda transformação precisa ser reversível e registrada: imprima as contagens de linhas e nulos antes/depois de cada etapa, e nunca descarte linhas silenciosamente — sinalize-as em um frame separado que eu possa inspecionar. - Trate explicitamente as armadilhas clássicas: números formatados como texto, formatos de data mistos, espaços em branco e diferenças de maiúsculas/minúsculas em categorias, e divisão por zero em qualquer métrica derivada. - Coloque todo limite que eu possa querer alterar (corte de outlier, estratégia para nulos) em variáveis com nomes claros no topo do código. - Termine com um breve relatório de qualidade de dados: linhas que entraram vs. que saíram, colunas afetadas, e qualquer coisa que eu deva decidir manualmente. - Adicione um comentário de uma linha em cada etapa que não seja óbvia. Priorize a legibilidade em vez da esperteza.
Preencha seus dados e o prompt se atualiza na hora — depois é só copiar.
# --- parâmetros que você pode ajustar --- NULL_STRATEGY = "flag" # flag, drop ou fill OUTLIER_Z = 3.0 before = len(df) df["plan"] = df["plan"].str.strip().str.lower().map( {"free": "Free", "pro": "Pro"}).fillna(df["plan"]) df["mrr"] = pd.to_numeric( df["mrr"].str.replace(r"[$,]", "", regex=True), errors="coerce") # linhas em que mrr não pôde ser convertido são mantidas e sinalizadas, não descartadas: bad_mrr = df[df["mrr"].isna()] print(f"rows in={before} unparseable mrr={len(bad_mrr)}") dupes = df[df.duplicated("customer_id", keep=False)] print(f"duplicate customer_ids: {dupes['customer_id'].nunique()} ids, {len(dupes)} rows") # Relatório de qualidade de dados: revise bad_mrr e dupes antes da análise.
O fluxo de trabalho completo
- Descreva as colunas e dtypes do seu schema, sem colar linhas reais
- Rode o script em uma cópia dos dados e leia as contagens antes/depois impressas em cada etapa
- Inspecione cada frame sinalizado (falhas de conversão, duplicatas, outliers) em vez de confiar em um descarte automático
- Recalcule manualmente qualquer métrica derivada em algumas linhas antes de construir a análise em cima dela
Fique de olho
A IA é mais perigosa justamente com números: ela produz respostas confiantes e erradas em séries temporais e métricas derivadas, em vez de admitir incerteza. Verifique você mesmo os cálculos de ano a ano e qualquer conta com lacunas ou zeros.
Não faça upload de arquivos com dados reais de clientes ou funcionários em uma ferramenta de IA de consumo para limpá-los. Use o padrão de schema descrito, ou uma amostra sintética ou totalmente anonimizada, em uma instância aprovada — PII em uma ferramenta pública pode violar a legislação de proteção de dados e a própria política de governança da empresa.
Um script de limpeza que muda a contagem de linhas muda os seus resultados. Nunca aceite um descarte ou preenchimento silencioso — toda transformação precisa de um registro antes/depois que você realmente leia.
De onde isso vem
Cada caso de uso deste site se baseia em relatos reais que os analistas de dados em atividade compartilham — nada foi inventado por nós.
Mais casos de uso de IA para os analistas de dados
Consultas SQL escritas e depuradas a partir de um schema descrito
comunicaçãoResumos executivos que transformam um gráfico em decisão
redaçãoDicionários de dados e documentação de consultas redigidos a partir do próprio SQL
planejamentoPedidos vagos de stakeholders transformados em um plano de análise delimitado
criativoO gráfico certo para a mensagem, não só para os dados
← Todos os 6 casos de uso: como os analistas de dados usam a IA