Trier un vaste ensemble de documents publics avant de les lire
Une communication obtenue au titre du FOIA arrive sous la forme d'un lot de 4 000 pages, ou un jeu de données public compte des milliers de lignes, et il faut trouver la poignée de documents qui comptent vraiment. C'est là que l'IA gagne réellement sa place dans les enquêtes journalistiques — l'ICIJ a utilisé l'apprentissage automatique pour faire passer une revue de documents de 110 000 à 3 000. La discipline qui rend cela défendable : garder les documents sensibles sur une infrastructure que vous contrôlez, et confirmer chaque résultat à la main.
Vous aidez un journaliste à trier un lot de documents PUBLICS pour décider quoi lire en premier. Tout ce que vous produisez est un signalement candidat que j'ouvrirai et lirai moi-même. Documents (documents publics, collés ou listés) : {{records}} Ce que je recherche : {{search_criteria}} Produisez : 1. Une liste courte et classée des entrées les plus susceptibles de correspondre à mes critères, chacune avec l'identifiant du document/de la ligne et le texte précis qui a déclenché le signalement. 2. Les entités nommées qui reviennent dans l'ensemble du lot (personnes, organisations, montants, dates), avec l'endroit où elles apparaissent. 3. Les lacunes évidentes — dates manquantes, passages caviardés ou ruptures de numérotation méritant d'être questionnées. Règles : - Indiquez un identifiant de document, une page ou une ligne pour chaque signalement. Si vous ne pouvez pas citer où se trouve une correspondance, ne l'incluez pas dans la liste. - N'utilisez que les documents fournis. N'ajoutez aucun contexte extérieur, et ne présumez ni motif ni culpabilité — décrivez uniquement ce que montre le texte. - Lorsqu'un document est caviardé ou peu clair, dites-le et signalez-le pour une relecture manuelle plutôt que de combler le vide.
Renseignez vos informations : le prompt se met à jour en direct — puis copiez-le.
Liste courte (à ouvrir et lire intégralement avant de vous y fier) - Doc 1187, p.4 : facture à Meridian Consulting, 74 300 $, note « fournisseur unique ». Meilleure correspondance. - Doc 0932, p.2 : e-mail, « gardons ça avec Meridian encore une fois » — même fournisseur, à lire en entier. - Doc 2004, p.7 : paiement de 61 000 $, nom du fournisseur caviardé. [À signaler pour relecture manuelle.] Entités récurrentes : « Meridian Consulting » apparaît dans 14 documents ; signataire « R. Voss » sur 9 d'entre eux. Lacunes : Les numéros de facture passent de 4471 à 4479 entre les documents 1187 et 1190 — huit numéros manquants.
Le flux de travail complet
- Vérifiez que les documents sont bien publics et non sensibles avant qu'aucun d'eux ne touche un outil grand public
- Pour tout document confidentiel ou divulgué, utilisez un outil qui garde les données sur une infrastructure que vous contrôlez (par exemple Datashare, l'outil open source de l'ICIJ, ou un modèle exécuté localement), pas un chatbot public
- Lancez le prompt pour classer les candidats, puis ouvrez et lisez vous-même chaque document signalé
- Vérifiez chaque résultat retenu par rapport au document source et par un travail de terrain avant qu'il n'alimente un article
- Consignez quel outil a vu quels documents, afin de pouvoir répondre plus tard à des questions sur votre méthode
Attention à
La protection des sources passe avant tout : ne collez jamais de documents divulgués, de communications de lanceurs d'alerte ou de matériel provenant d'une source confidentielle dans un outil d'IA grand public. Les données saisies peuvent être conservées et utilisées pour entraîner des modèles, et un seul nom non caviardé ou un détail stylistique peut suffire à réidentifier une source. La règle de l'ICIJ fait référence — « aucune donnée n'a quitté notre infrastructure », sans aucun tiers.
Le tri réduit la taille de la botte de foin ; il ne vérifie pas l'aiguille. Chaque document signalé par l'IA doit être lu intégralement et confirmé par un travail de terrain — un classement est un ordre de lecture, pas une conclusion publiable.
L'IA passe à côté de correspondances et invente des schémas. Pour tout élément à conséquence, vérifiez par sondage ce qu'elle a écarté, pas seulement ce qu'elle a fait remonter, et conservez une trace de votre méthode au cas où l'article serait contesté.
D’où ça vient
Chaque cas d’usage de ce site s’appuie sur des témoignages réels rapportés par les journalistes en exercice — rien n’est inventé par nous.
Plus de cas d’usage de l’IA pour les journalistes
Transformer un article terminé en titres et contenus pour les réseaux sociaux
analyseTranscrire un entretien et en extraire des citations vérifiées
analyseTransformer un rapport public ou un jeu de données en pistes d'articles
planificationPréparer un brief d'entretien et une liste de questions
communicationRéécrire un article technique en langage clair pour un nouveau public
← Les 6 cas d’usage : comment les journalistes utilisent l’IA