Data Poisoning : Comment 100 Exemples Suffisent pour Corrompre une IA
Par Delos Intelligence — 2026-06-27
Une etude de Stanford montre que 100 exemples malveillants dans un jeu de 10 millions suffisent pour compromettre un modele IA. Le data poisoning est la menace la plus silencieuse de l IA entreprise.
La Menace Invisible
Imaginez que votre modele de detection de fraude soit lentement entraine a ignorer un type specifique de fraude. Ou que votre assistant IA de recrutement soit manipule pour ecarter systematiquement certains profils. Ou que votre modele de classification de documents class male une categorie entiere.
C est ce que permet le data poisoning : contaminer les donnees d entrainement d un modele pour modifier son comportement de facon precise et discrete. La corruption est souvent invisible jusqu a ce que l impact se materalise.
Comment Fonctionne le Data Poisoning
Attaque par Backdoor
L attaquant insere des exemples d entrainement contenant un trigger cache. Le modele apprend que la presence de ce trigger doit produire une reponse specifique. En production, l attaquant peut activer le backdoor en utilisant le trigger.
Exemple : un modele de classification d images est entraine sur un dataset contenant 100 images avec un pixel blanc dans un coin specifique, toutes etiquetees comme benignes. En production, ajouter ce pixel blanc a une image malveillante la fait classer comme benigne.
Attaque par Degradation
Plus simple, elle consiste a corrompre les labels d un sous-ensemble d exemples pour degrader les performances sur une categorie specifique. Difficile a detecter si la degradation est graduelle.
Attaque par Injection de Biais
Insertion d exemples qui renforcent des correlations spurieuses. Le modele apprend des associations incorrectes qui se manifestent comme des biais discriminatoires ou des angles morts.
Statistiques Alarmantes
Une etude de 2023 a montre qu une contamination de 0,001% (100 exemples sur 10 millions) suffisait pour introduire un backdoor fiable dans un modele de vision. Pour les LLM, la contamination peut etre encore plus efficace car les datasets sont massifs et leur verification exhaustive est impossible.
Vecteurs d Attaque pour les Entreprises
Donnees externes : les modeles entraines sur des donnees publiques (web scraping, sources tierces) sont vulnerables. L attaquant peut publier du contenu empoisonne sur des sources connues comme sources d entrainement.
Fine-tuning sur donnees non verifiees : quand une entreprise fine-tune un modele sur ses propres donnees sans audit de securite, les donnees contaminees s incorporent directement.
Modeles open source : certains modeles publics ont ete deliberement empoisonnes avant publication. L utilisation sans audit est risquee.
Contributeurs malveillants : dans les projets collaboratifs, un contributeur mal intentionne peut inserer des exemples empoisonnes.
!Data Poisoning : Detecter et Prevenir
Comment Se Proteger
Audit des sources de donnees : documentez et validez chaque source de donnees d entrainement. Les sources non verifiees sont a haut risque.
Techniques de detection : des methodes comme la validation croisee sur sous-ensembles, la detection d anomalies dans les gradients et les tests de robustesse adversariale permettent de detecter certains poisoning.
Isolation des environnements : ne jamais fine-tuner directement sur des donnees de production. Utilisez des environnements isoles et validez les modeles avant deploiement.
Surveillance des performances : monitorer les performances du modele par categorie. Une degradation soudaine sur un sous-ensemble peut signaler un empoisonnement.
Conclusion
Le data poisoning est la menace IA la plus difficile a detecter et la plus facile a executer. La protection passe par une hygiene stricte des donnees d entrainement et une surveillance continue des comportements en production.