- Dans les projets IA que nous reprenons, le modèle est rarement le problème. Les données le sont dans la grande majorité des cas.
- Quatre défauts reviennent : données introuvables, données contradictoires entre systèmes, absence de propriétaire, absence d'historique.
- Quatre semaines suffisent pour savoir si un projet est faisable, et à quel prix, avant d'engager un budget.
- Le livrable qui compte est un tableau des sources avec, pour chacune, un propriétaire, un niveau de qualité et une décision.
Ce que nous trouvons en arrivant
Le scénario se répète. Une entreprise a lancé un projet IA ambitieux, souvent avec un prestataire compétent. Le prototype a fonctionné sur un échantillon soigné. Puis, au moment de passer à l'échelle, tout s'est grippé : les données de production ne ressemblent pas à l'échantillon, deux systèmes donnent des chiffres différents pour le même client, personne ne sait qui a le droit de corriger une valeur, et l'historique nécessaire pour entraîner ou évaluer n'existe que depuis six mois.
Le projet est alors mis en pause « le temps de nettoyer les données », ce qui, sans méthode, ne se termine jamais. Ce n'est pas une fatalité, c'est l'ordre des opérations qui était mauvais.
Les quatre défauts qui tuent un projet
Les données introuvables
Elles existent, quelque part : dans un export mensuel sur un disque partagé, dans un ancien logiciel que plus personne n'ouvre, dans les emails d'une personne partie l'an dernier. Le projet a besoin d'un accès régulier et fiable, pas d'une chasse au trésor.
Les données contradictoires
Le CRM compte 4 200 clients actifs, la facturation en compte 3 800, l'outil marketing 5 100. Chacun a raison selon sa définition. Tant que l'entreprise n'a pas décidé laquelle fait foi, aucun modèle ne peut apprendre quoi que ce soit de cohérent.
L'absence de propriétaire
Quand une valeur est fausse, qui la corrige ? Si la réponse est « le service informatique » ou « personne », la qualité ne s'améliorera jamais. Chaque source de données a besoin d'un propriétaire métier, nommé, qui répond de sa qualité.
L'absence d'historique
Prédire des ventes demande des années de ventes. Détecter des anomalies demande des exemples d'anomalies. Si l'historique n'existe pas ou a été écrasé à chaque mise à jour, le projet doit commencer par collecter, et cela prend le temps que cela prend.
« Montrez-moi les données réelles du mois dernier, telles qu'elles sont, sans nettoyage. » Ce que vous verrez en dix minutes vaut mieux que trente pages de cadrage.
Le plan en quatre semaines
| Semaine | Objectif | Livrable |
|---|---|---|
| 1 | Inventaire des sources nécessaires au cas d'usage | Liste des sources, accès, fréquence, volume |
| 2 | Mesure de la qualité sur des données réelles | Taux de champs vides, doublons, incohérences, profondeur d'historique |
| 3 | Propriétaires et définitions | Un nom par source, une définition arbitrée par indicateur |
| 4 | Décision | Faisable maintenant, faisable après remédiation (chiffrée), ou à reporter |
Le livrable final tient sur une page : un tableau des sources avec un propriétaire, un niveau de qualité (bon, acceptable, bloquant) et une décision. Une direction peut le lire en cinq minutes et arbitrer. C'est ce document qui manque à presque tous les projets que nous reprenons.
Ce que la gouvernance change vraiment
Le mot « gouvernance » fait fuir, à raison quand il désigne un comité et un classeur. Ce que nous mettons en place est plus simple : un propriétaire par source, une définition par indicateur, un contrôle de qualité automatique qui envoie une alerte quand un seuil est dépassé, et une revue mensuelle de trente minutes. Ce dispositif léger fait plus pour un projet IA que n'importe quel choix de modèle.
« On ne nettoie pas les données pour un projet. On organise l'entreprise pour que les données restent propres. »
Conclusion
Les projets IA n'échouent pas parce que l'IA est immature. Ils échouent parce qu'on a commencé par la fin. Quatre semaines d'inventaire, de mesure et d'arbitrage avant tout développement évitent des mois d'errance et permettent de dire, chiffres à l'appui, si un projet est raisonnable. C'est moins spectaculaire qu'une démonstration, et c'est ce qui sépare les projets qui livrent des projets qu'on oublie.
FAQ
Faut-il un entrepôt de données avant de faire de l'IA ?
Pas nécessairement. Pour un premier cas d'usage borné, un accès propre à deux ou trois sources suffit. L'entrepôt devient utile quand plusieurs projets partagent les mêmes données.
Qui doit être propriétaire d'une source de données ?
La personne du métier qui en dépend le plus et qui a l'autorité pour faire corriger une erreur. Rarement l'informatique, qui héberge mais ne connaît pas le sens des données.
Combien coûte une remédiation ?
Tout dépend du défaut. Dédoublonner un fichier client se fait en quelques jours ; reconstituer trois ans d'historique peut être impossible. C'est précisément ce que le diagnostic de quatre semaines chiffre.
Peut-on faire de l'IA générative sans ce travail ?
Pour un assistant sur des documents bien rangés, oui, avec des attentes modestes. Pour tout ce qui touche à des données métier structurées, non : le modèle répondra avec assurance à partir de données fausses.