La question que toute équipe ML finit par se poser
Tôt ou tard, quelqu'un pose une question simple : pourquoi le modèle a-t-il pris cette décision ? Y répondre suppose de savoir quelle version du modèle a tourné, quelles variables il a vues, comment elles ont été calculées et de quelles données sources elles venaient. Dans beaucoup d'organisations, personne ne peut le dire.
Le problème vient rarement du modèle. Il vient des données qui l'entourent : des variables calculées d'une façon pour l'entraînement et d'une autre en production, des jeux de données écrasés, des chaînes qui échouent sans bruit. Référentiel de variables (feature store), traçabilité et contrôles qualité sont les outils qui règlent ce problème.
1. Une seule définition par variable
La source d'erreurs silencieuses la plus fréquente en production est l'écart entre entraînement et service : une variable calculée légèrement différemment quand le modèle apprend et quand il prédit. Un référentiel de variables le supprime en faisant de chaque variable une définition unique et partagée.
- Définissez chaque variable une seule fois, avec un responsable, une description et la logique qui la calcule.
- Servez la même définition aux entraînements et aux prédictions en temps réel.
- Réutilisez les variables d'un modèle à l'autre au lieu de les reconstruire, pour que chaque amélioration profite à tous.
2. Versionner vos jeux de données
Un résultat impossible à reconstruire est un résultat auquel on ne peut pas se fier. Versionner les données, et pas seulement le code, rend l'apprentissage automatique reproductible.
- Figez ou versionnez chaque jeu de données d'entraînement et de validation, et n'en écrasez jamais aucun.
- Enregistrez la version des données, la version du code et les paramètres qui ont produit chaque modèle.
- Conservez assez d'historique pour reconstruire tout modèle encore en production.
3. Tracer le chemin de la source à la prédiction
La traçabilité relie tout : systèmes sources, transformations, variables, jeux de données et modèles. Grâce à elle, une question sur une prédiction devient une simple consultation plutôt qu'une enquête.
- Capturez la traçabilité automatiquement depuis vos chaînes plutôt que de la documenter à la main.
- Permettez de remonter d'une prédiction à la version du modèle, aux variables et aux données sources qui l'ont produite.
- Utilisez-la aussi dans l'autre sens : quand une source change, voyez chaque variable et chaque modèle concernés.
4. Poser des contrôles qualité sur chaque chaîne
Arrêter une mauvaise donnée à l'entrée coûte moins cher que la découvrir des semaines plus tard dans le comportement d'un modèle. Les contrôles qualité en font la règle.
- Vérifiez schéma, fraîcheur, exhaustivité et plages de valeurs à chaque étape.
- Arrêtez la chaîne quand un contrôle échoue, au lieu de transmettre de mauvaises données en aval.
- Écrivez les standards de validation, pour que chaque nouveau jeu de données respecte le même niveau d'exigence.
5. Gouverner les jeux de données comme de vrais actifs
Les jeux de données d'entraînement, de validation et d'inférence portent de la valeur, mais aussi des risques juridiques et métier. La gouvernance rend ces risques visibles et maîtrisables.
- Donnez à chaque jeu de données un responsable, une finalité et une règle de conservation.
- Contrôlez l'accès et limitez les données personnelles à ce dont le modèle a vraiment besoin.
- Conservez la documentation et la traçabilité que demandent auditeurs et équipes risques, dans une démarche alignée sur le RGPD et l'EU AI Act.
Les questions auxquelles vous devriez savoir répondre
Un test simple pour savoir si vos données d'apprentissage sont maîtrisées : pouvez-vous répondre à chacune de ces questions en quelques minutes, et non en plusieurs jours ?
- Quelle version du modèle a produit cette prédiction, et quelles variables a-t-elle utilisées ?
- Ces variables sont-elles calculées de la même façon à l'entraînement et en production ?
- Quelle version des données a entraîné le modèle en production, et pouvons-nous le reconstruire ?
- Si ce système source change, quelles variables et quels modèles sont concernés ?
- Qui est responsable de ce jeu de données, pourquoi le conservons-nous et pour combien de temps ?
Commencer là où ça fait mal
Nul besoin d'une plateforme de données complète pour commencer. Partez du modèle le plus difficile à expliquer ou le plus souvent en erreur : versionnez ses données d'entraînement, placez ses variables dans une définition partagée et ajoutez des contrôles qualité à sa chaîne.
Chaque étape rend un modèle reproductible et auditable. Répétée sur l'ensemble de vos modèles, elle vous apporte quelque chose de plus rare : un apprentissage automatique que vous pouvez expliquer à qui le demande.
Blog
Analyses, méthodes et stratégies d'Algorythmos sur l'IA, la sécurité et l'innovation par la donnée.
