Clasificar un gran volumen de registros públicos antes de leerlos
Una entrega de FOIA llega con 4,000 páginas, o un conjunto de datos público tiene miles de filas, y necesitas encontrar el puñado que realmente importa. Aquí es donde la IA se gana de verdad su lugar en el periodismo de investigación — el ICIJ usó aprendizaje automático para reducir una revisión de 110,000 documentos a 3,000. La disciplina que lo hace defendible: mantener el material sensible en infraestructura que tú controlas, y confirmar a mano cada coincidencia.
Estás ayudando a un periodista a clasificar un lote de registros PÚBLICOS para decidir qué leer primero. Todo lo que devuelvas es una señal candidata que yo mismo abriré y leeré. Registros (documentos públicos, pegados o listados): {{records}} Qué estoy buscando: {{search_criteria}} Produce: 1. Una lista ordenada de las entradas con más probabilidad de coincidir con mi criterio, cada una con el identificador del documento/fila y el texto concreto que activó la señal. 2. Entidades con nombre que se repiten en el conjunto (personas, organizaciones, importes, fechas), indicando dónde aparecen. 3. Vacíos evidentes — fechas faltantes, tachaduras o saltos en la numeración que valga la pena cuestionar. Reglas: - Señala un identificador de documento, página o fila para cada alerta. Si no puedes citar dónde está una coincidencia, no la incluyas. - Usa solo los registros proporcionados. No añadas contexto externo, y no infieras motivo ni culpabilidad — describe solo lo que muestra el texto. - Cuando un documento esté tachado o no esté claro, dilo y márcalo para revisión manual en lugar de rellenar el vacío.
Rellena tus datos y el prompt se actualiza al instante — luego cópialo.
Lista corta (abrir y leer cada una antes de darla por buena) - Doc 1187, p.4: factura a Meridian Consulting, $74,300, nota "proveedor único". Coincidencia principal. - Doc 0932, p.2: correo, "sigamos con Meridian otra vez" — mismo proveedor, vale la pena leerlo entero. - Doc 2004, p.7: pago de $61,000, nombre del proveedor tachado. [Marcar para revisión manual.] Entidades recurrentes: "Meridian Consulting" aparece en 14 documentos; el firmante "R. Voss" en 9 de ellos. Vacíos: los números de factura saltan de 4471 a 4479 entre los Docs 1187 y 1190 — faltan ocho.
El flujo de trabajo completo
- Confirma que los registros son públicos y no sensibles antes de que toquen cualquier herramienta de consumo
- Para material confidencial o filtrado, usa herramientas que mantengan los datos en infraestructura que tú controlas (por ejemplo, Datashare, el software de código abierto del ICIJ, o un modelo ejecutado localmente), no un chatbot público
- Ejecuta el prompt para clasificar candidatos y, después, abre y lee tú mismo cada documento señalado
- Verifica cada hallazgo de la lista corta contra el registro original y mediante reporteo antes de que dé forma a una noticia
- Registra qué herramienta vio qué documentos, para poder responder preguntas sobre tu proceso más adelante
Cuidado con
La protección de la fuente va primero: nunca pegues documentos filtrados, comunicaciones de un denunciante o material de una fuente confidencial en una herramienta de IA de consumo. Los datos introducidos pueden conservarse y usarse para entrenar modelos, y un solo nombre sin tachar o un detalle de estilo puede volver a identificar a una fuente. La norma del ICIJ es el estándar: 'ningún dato salió de nuestra infraestructura', sin terceros de por medio.
La clasificación reduce el pajar, no verifica la aguja. Cada documento que la IA señale debe leerse por completo y confirmarse mediante reporteo — una clasificación es un orden de lectura, no un hallazgo que puedas publicar.
La IA pasa por alto coincidencias e inventa patrones. Para cualquier cosa relevante, revisa también una muestra de lo que descartó, no solo lo que destacó, y conserva un registro de tu método por si la noticia es cuestionada.
De dónde sale esto
Cada caso de uso de este sitio se basa en relatos reales de los periodistas en activo — no lo inventamos nosotros.