William's Substack · 27 août 2026
Administrer les données d'une IA : trier avant d'alimenter le modèle
- gouvernance IA
- data management
- IA générative
Bill Inmon, figure historique de l'entrepôt de données, part d'un constat abrupt : les savoir-faire de l'administration de données, forgés sur les systèmes transactionnels, ne s'appliquent plus tels quels à l'IA. Dans ce billet, il décrit ce que devient le métier lorsque la matière à gérer est du texte destiné à un grand modèle de langage (LLM).
Un modèle resserré et ciblé
Pour Inmon, l'administration des données d'une IA poursuit deux objectifs. Limiter la taille du modèle, d'abord, pour en contenir le coût. Le garder concentré sur la valeur métier, ensuite, ce qui réduit les hallucinations. L'administrateur n'agit plus directement sur les données, comme dans une base structurée : il influence le résultat indirectement, en choisissant ce qui entre. L'auteur le compare à un marionnettiste.
Filtrer ce qui entre
L'essentiel du travail consiste donc à trier. Séparer le texte utile au métier du texte accessoire. Écarter les passages répétitifs : selon Inmon, environ 90 % d'un rapport réglementaire de type 10-K relève du texte standard, sans intérêt pour le modèle. Reformater les données transactionnelles des bases classiques pour les rendre exploitables. Vérifier qu'aucune donnée privée ou confidentielle ne s'y glisse. Choisir avec soin les sources issues du web. Et maintenir un contrôle humain avant toute ingestion, que l'auteur juge indispensable.
Un choix de trajectoire
Inmon, qui met en avant au passage un outil de traitement du texte, conclut par une alternative : un modèle gonflé, coûteux et dispersé, ou un modèle réduit, efficace et précis. C'est la discipline appliquée en amont qui en décide.
Ce que cela change pour une PME
Peu de PME entraînent un modèle, mais beaucoup envisagent de brancher un assistant sur leurs documents internes. La leçon s'applique alors à l'identique : tout verser sans tri, c'est exposer des données sensibles et dégrader les réponses. Savoir quels documents font référence, lesquels sont obsolètes et lesquels sont confidentiels relève des axes « qualité & fiabilité » et « conformité & sécurité » de l'Audit Data. Un préalable utile avant de connecter une IA à ses fichiers.