Triar um grande volume de registros públicos antes de lê-los
Uma resposta a um pedido de acesso à informação chega com 4.000 páginas, ou um conjunto de dados públicos tem milhares de linhas, e você precisa achar as poucas que importam. É aqui que a IA realmente conquista seu lugar em investigações — o ICIJ usou aprendizado de máquina para reduzir uma triagem de 110.000 documentos para 3.000. A disciplina que torna isso defensável: manter material sensível em infraestrutura sob seu controle e confirmar cada achado manualmente.
Você está ajudando um repórter a triar um lote de registros PÚBLICOS para decidir o que ler primeiro. Tudo o que você retornar é uma sinalização candidata que eu vou abrir e ler pessoalmente. Registros (documentos públicos, colados ou listados): {{records}} O que estou procurando: {{search_criteria}} Produza: 1. Uma lista curta e ordenada por relevância dos itens com maior probabilidade de atender ao meu critério, cada um com o identificador do documento/linha e o texto específico que motivou a sinalização. 2. Entidades nomeadas que se repetem no conjunto (pessoas, organizações, valores, datas), com onde aparecem. 3. Lacunas óbvias — datas ausentes, trechos censurados ou quebras de numeração que valem uma pergunta. Regras: - Aponte um ID de documento, página ou linha para cada sinalização. Se você não conseguir citar onde está uma correspondência, não a liste. - Use apenas os registros fornecidos. Não acrescente contexto externo e não infira motivo nem culpa — descreva apenas o que o texto mostra. - Onde um documento estiver censurado ou pouco claro, diga isso e sinalize para revisão manual em vez de preencher a lacuna.
Preencha seus dados e o prompt se atualiza na hora — depois é só copiar.
Lista curta (abra e leia cada item antes de confiar nele) - Doc 1187, p.4: nota fiscal para Meridian Consulting, $74,300, memorando "fonte única". Correspondência principal. - Doc 0932, p.2: e-mail, "vamos manter isso com a Meridian de novo" — mesmo fornecedor, vale a pena ler na íntegra. - Doc 2004, p.7: pagamento de $61,000, nome do fornecedor censurado. [Sinalizar para revisão manual.] Entidades recorrentes: "Meridian Consulting" aparece em 14 documentos; signatário "R. Voss" em 9 deles. Lacunas: Os números das notas fiscais saltam de 4471 para 4479 entre os Docs 1187 e 1190 — faltam oito.
O fluxo de trabalho completo
- Confirme que os registros são públicos e não sensíveis antes de qualquer um deles tocar uma ferramenta de consumo
- Para material confidencial ou vazado, use ferramentas que mantêm os dados em infraestrutura sob seu controle (por exemplo, o Datashare de código aberto do ICIJ, ou um modelo executado localmente), não um chatbot público
- Execute o prompt para ordenar os candidatos e depois abra e leia cada documento sinalizado pessoalmente
- Verifique cada achado da lista curta contra o registro primário e por meio de apuração antes que embase uma matéria
- Registre qual ferramenta viu quais documentos, para poder responder perguntas sobre seu processo depois
Fique de olho
A proteção da fonte vem em primeiro lugar: nunca cole documentos vazados, comunicações de denunciantes ou material de uma fonte confidencial em uma ferramenta de IA de consumo. Os dados enviados podem ser retidos e usados para treinar modelos, e um único nome não editado ou detalhe de estilo pode reidentificar uma fonte. A regra do ICIJ é o padrão — 'nenhum dado saiu da nossa infraestrutura', sem terceiros envolvidos.
A triagem reduz o palheiro; não verifica a agulha. Todo documento sinalizado pela IA precisa ser lido na íntegra e confirmado por apuração — um ranqueamento é uma ordem de leitura, não um achado que você pode publicar.
A IA erra correspondências e inventa padrões. Para qualquer coisa relevante, confira também o que ela descartou, não apenas o que ela destacou, e mantenha um registro do seu método caso a matéria seja contestada.
De onde isso vem
Cada caso de uso deste site se baseia em relatos reais que os jornalistas em atividade compartilham — nada foi inventado por nós.