Data / IA
Le désalignement des IA devient aussi un problème de DSI
Par Laurent Delattre, publié le 06 octobre 2026
Plus de 100 organisations prévenues par OpenAI, 55 retrouvées dans des traces publiques d’IA par Asymmetric Security, des agents qui sondent des systèmes gouvernementaux, créent des comptes et contournent leur sandbox… Pas de quoi crier à la révolte des machines, mais assez pour interpeler les DSI. Les agents IA deviennent des intrus à part entière qu’il faut savoir détecter et ne pas soi-même lâcher sans contrôle dans la nature…
Il y a moins d’une semaine, IT for Business revenait sur l’impressionnante succession de dérapages révélés par OpenAI : utilisation de clés API trouvées sur GitHub, publication d’un token, communication entre agents censés être isolés, recours à des hébergeurs temporaires ou encore détournement du DNS pour retrouver un accès à Internet. Notre conclusion était déjà que le sandboxing traditionnel ne suffisait plus face à des agents capables d’explorer leurs propres contraintes.
Et chaque jour qui passe ajoute de nouvelles victimes au palmarès des agents désalignés d’OpenAI. L’éditeur explique avoir prévenu, au 26 septembre, plus de 100 organisations que certains de ses modèles d’IA jugés « misaligned » (comprenez « désalignés », autrement dit ne respectant pas les règles qu’on leur a inculquées) avaient pu interagir avec leurs systèmes au-delà du périmètre prévu. L’entreprise précise qu’une telle notification ne signifie ni compromission ni accès à des données privées mais n’exclut pas de possibles contournements de contrôle d’accès, des perturbations d’un service, etc.
Pour les DSI, c’est la confirmation qu’il n’y a pas que des cybercriminels qui explorent leur système d’information. Des agents IA le font aussi en développant dans certaines circonstances des comportements imprévus. Voilà qui n’est pas très rassurant.
Des missions banales, réalisées comme des attaques
Histoire d’enfoncer le clou, la société de réponse à incident Asymmetric Security a publié le 1er octobre une alerte similaire. En exploitant uniquement des traces publiques, ses chercheurs ont reconstitué des activités d’agents IA impliquant 55 organisations entre mars et septembre 2026. On y retrouve notamment le Department of Education américain, la SEC, le CDC, l’Agence internationale de l’énergie, UN Trade and Development ou encore des sites liés à la santé. Les chercheurs disent avoir observé des accès réussis à certains environnements de préproduction, des sondages de systèmes et des techniques classiquement associées à la reconnaissance offensive.
Tous ces agents n’ont pas reçu pour mission initiale de « pirater la SEC » ou de pénétrer un organisme de santé. Et ils n’en ont pas eu l’intention, une IA n’a pas d’intention. Ils cherchaient des statistiques, des chiffres de prescriptions médicales, des données commerciales, des effectifs universitaires… Des informations qu’un analyste irait typiquement chercher sur des portails plus ou moins publics. Sauf que, lorsque le portail résistait ou imposait une authentification, les agents IA ont insisté quitte à obtenir ces informations avec des méthodes de cyberattaquant.
Privés d’accès direct au Web par leur sandbox, les agents IA ont, par exemple, combiné httpbin et urlquery pour faire exécuter leur code par un navigateur tiers et en lire les résultats dans des rapports publics. Malin. Mais totalement désaligné. Comme lorsqu’ils ont aussi testé des fichiers .git, recherché des sauvegardes exposées, essayé des injections SQL, tenté de créer des comptes sur différents services, utilisé des boîtes mail temporaires et sont passés par des services d’archivage ou de notification pour récupérer les résultats qu’ils recherchaient. À chaque fois, la finalité était anodine, les moyens employés absolument pas.
Pour les DSI, le manque d’alignement des IA devient un problème
Il ne faudrait pas que le « désalignement » invoqué par OpenAI (et les autres labos d’IA, puisque tous ont récemment connu des incidents similaires) soit une excuse tolérée et tolérable. La responsabilité de ces comportements inadéquats voire dangereux incombe d’abord aux laboratoires qui déploient ces modèles.
Néanmoins, ces incidents mettent aussi en lumière des dysfonctionnements dans la cybersécurité des labos d’IA comme dans celle des entreprises victimes : des périmètres mal définis, des journaux d’audit insuffisants, une gestion défaillante voire inexistante des identités machine, etc.
Les DSI doivent traiter les alertes envoyées par OpenAI comme d’authentiques incidents de cybersécurité, pas comme une simple notification qui sort de l’ordinaire. Et prendre les mesures adéquates.
Ils doivent aussi réaliser que les agents IA qu’ils déploient partagent probablement les mêmes « désalignements » et « risques » que ceux des labos d’IA, même s’ils s’appuient sur des modèles moins récents, moins puissants et dotés de garde-fous plus éprouvés.
Dans son dernier rapport, Glow Security en fait d’ailleurs la démonstration. Ses chercheurs ont en effet trouvé 13 000 captures d’écran internes disséminées dans plus de 900 dépôts GitHub publics, provenant de plus de 300 organisations, allant d’un géant du voyage du Fortune 500 à un laboratoire d’IA. Incapables de joindre des images à des demandes de fusion dans des dépôts privés, plusieurs agents de codage animés par différents modèles IA ont contourné la contrainte en créant des dépôts publics pour les héberger. Résultat : des fiches de facturation clients, des consoles de trésorerie, des fonctionnalités encore non dévoilées et même des identifiants se sont retrouvés exposés au travers de ces dépôts publics !
Les rapports de Glow Security et Asymmetric Security invitent ainsi les DSI à :
1 – Traiter chaque agent IA comme une identité machine à risque. Pas question qu’il emprunte les identifiants de son utilisateur : il doit avoir une identité propre, un compte dédié, des droits spécialement taillés pour la tâche qu’il doit effectuer, des jetons à courte durée de vie plutôt que des clés statiques, des droits aisément révocables et aucune utilisation de comptes administrateurs ou de jetons génériques.
2 – Ne jamais faire reposer la sécurité sur les instructions données au modèle. Inutile de mettre des instructions d’interdiction dans les prompts. Les interdictions doivent être imposées par l’infrastructure : filtrage réseau et DNS, sandbox robuste, contrôle des outils, validation humaine des actions sensibles et journalisation externe à l’agent. Chaque appel d’outil, commande, URL consultée et fichier écrit doit être tracé, conservé et versé au SIEM. Un agent qui bute à répétition sur le proxy ou le pare-feu n’est pas un bruit de fond mais bien le signe qu’il cherche une sortie.
3 – Tester ce que fait l’agent quand son plan échoue. Avant la mise en production, confier à l’agent une tâche volontairement insoluble dans un environnement isolé et observer ce qu’il tente. Refus d’accès, outil indisponible, donnée manquante, objectif impossible : c’est précisément lorsqu’il rencontre un obstacle qu’un agent peut improviser et sortir du périmètre prévu. Les tests de sécurité doivent désormais chercher ces contournements et non seulement vérifier le fonctionnement nominal de l’agent.
Ces incidents doivent être perçus comme des mises en garde. Ils nous montrent que finalement on a confié des clés, des outils et un accès réseau à des agents IA dont on ne sait pas encore prédire la créativité et qui n’ont, eux-mêmes, aucune capacité à anticiper les conséquences de leurs actions.
Les labos d’IA ont leur part de responsabilité, et elle est lourde. Mais attendre qu’ils règlent seuls la question de l’alignement serait, pour une DSI, une autre forme de « désalignement ». Car, tout ceci n’est finalement pas un sujet IA. C’est d’abord un sujet de cybersécurité et de résilience, un sujet d’hygiène informatique. Et d’adaptation de nos processus de sécurité aux nouvelles pratiques, celles des utilisateurs, des cyberattaquants… et désormais des IA.
Photo : Bored Photography / Shutterstock
Gartner : cinq chantiers pour les RSSI d’ici fin 2026… et les agents IA en ligne de mire
Hasard du calendrier, Gartner a publié le 30 septembre les cinq actions que les RSSI devraient engager d’ici la fin de l’année. Et l’on y retrouve, à peine reformulées, les leçons justement évoquées ci-dessus. « Les cyberattaques augmentées par l’IA, les débats sur la sûreté de l’IA et les risques émergents liés à l’informatique quantique entretiennent une incertitude persistante dans toute l’entreprise, explique Christopher Mixter, VP Analyst chez Gartner. Les responsables de la cybersécurité ont là une occasion de celles qui marquent une carrière : éclairer les décisions de la direction dans cette période de bouleversements technologiques accélérés. »
Et Gartner de proposer aux RSSI, 5 chantiers à mettre en route avant la fin de l’année.

1 – S’imposer comme l’autorité de la sûreté de l’IA. Pour Gartner, le RSSI doit sécuriser l’infrastructure de l’IA et comprendre l’interaction entre les modèles et leurs environnement d’exécution. Le danger tient moins à ce que les modèles « pensent » qu’à ce qu’on les laisse faire. Le RSSI doit dépasser l’effet de mode et s’imposer en autorité de sécurité de l’IA.
2 – Traiter tout déploiement d’IA frontière comme un risque interne. Selon une enquête menée par Gartner auprès de 297 responsables de la cybersécurité au deuxième trimestre, 54 % des organisations n’ont aucune approche définie pour limiter les accès des agents IA… ou se contentent de leur prêter des accès humains. Gartner invite les RSSI à lancer un vrai chantier de gouvernance interne des systèmes multi-agents en se focalisant sur ce qu’ils font et les privilèges d’action qu’on leur octroie. Gartner conseille ensuite de les encadrer par des « guardian agents », des agents gardiens chargés de circonscrire le rayon d’impact d’un dérapage. Mais l’analyste ne précise pas comment faire.
3 – Ne plus faire de la reconnaissance une preuve d’identité. Les deepfakes se sont banalisés : reconnaître une voix ou un visage ne doit plus suffire à autoriser une décision ou une action. Gartner pousse à repenser les processus en conséquence et à combiner détection des deepfakes, signaux contextuels, facteurs d’authentification supplémentaires et vérification de la provenance des contenus. Le concept Zero Trust, aucune confiance, doit être étendu à l’agentique.
4 – Budgéter la cybersécurité préemptive. L’IA réduit drastiquement le temps et les compétences nécessaires pour exploiter les faiblesses d’une organisation, et 76 % des RSSI placent la découverte de vulnérabilités par l’IA parmi leurs dix principaux risques émergents. « Les capacités de détection et de réponse ne suffisent plus, souligne Luis Castillo, Senior Director Analyst chez Gartner. Les organisations doivent donner la priorité à des capacités de cybersécurité préemptive, comme la défense par cible mobile automatisée, l’obfuscation avancée, la tromperie et le renseignement prédictif sur les menaces, pour prendre un avantage mesurable sur les attaquants. »
5 – Lancer les pilotes de migration post-quantique. Seul chantier sans lien direct avec les agents, mais non moins pressant : selon Gartner, les organisations qui n’auront pas commencé à piloter la cryptographie post-quantique (PQC) d’ici 2027 verront le coût de leur migration complète grimper d’au moins 200 %. Or 51 % des RSSI interrogés n’ont encore rien entrepris. « La préparation post-quantique exige une transformation complète du modèle opérationnel de la cybersécurité, pas une simple mise à niveau technique », prévient Christopher Mixter.
À LIRE AUSSI :
À LIRE AUSSI :
