Les IA deviennent plus autonomes mais leurs garde-fous restent dangereusement fragiles

Data / IA

Encadrement des IA : les failles restent béantes

Par Reynald Fléchaux, publié le 22 septembre 2026

Modèle open-weight qui s’auto-modifie, Gemini qui pirate des entreprises, OpenAI vulnérable, abaissement de la barrière à l’entrée dans la conception d’exploits : l’évolution des IA promet des lendemains cyber qui déchantent aux RSSI.

Si le piratage de la plateforme Open Source Hugging Face, cet été, a engendré une forme de prise de conscience généralisée des risques cyber que font courir des IA insuffisamment encadrées, chaque semaine ou presque confirme désormais les lacunes de la technologie dans ce domaine.
Selon un article publié la semaine dernière par la start-up spécialisée en sécurité de l’IA Irregular, des agents peuvent ainsi prendre l’initiative de modifier leurs modèles sous-jacents, sans en avoir reçu formellement l’instruction.

Dans un billet de blog décrivant son expérience, publié le 16 septembre, Irregular explique avoir monté une infrastructure hébergée en interne au sein de laquelle un même modèle open-weight est utilisé par un agent de programmation et par une application d’IA que cet agent est chargé de maintenir. « Lors d’une tâche de maintenance de routine visant à corriger des réponses incorrectes de l’application, l’agent a identifié le modèle partagé comme étant à l’origine du problème, l’a optimisé et a remplacé le modèle qui alimentait à la fois cette application et ses futures instances », écrit Irregular. Le tout sans avoir reçu d’instruction particulière pour entraîner, modifier ou déployer un modèle de remplacement.

Modèle ré-entraîné, garde-fous envolés

Si cette auto-amélioration du modèle peut être recherchée dans certains cas, elle présente un certain nombre de risques, le ré-entraînement du modèle pouvant altérer son comportement de façon insidieuse. « Nos tests ont montré que le modèle mis à jour pouvait intégrer des informations sensibles et les reproduire ultérieurement sans accès à la source originale », indique ainsi Irregular, qui ajoute que l’auto-modification a également supprimé un garde-fou bloquant un comportement du modèle, concernant ici des prompts relatifs à la concurrence.

Autrement dit, pour la start-up, la maintenance des modèles open-weight, vus par les DSI comme une alternative aux grands modèles propriétaires, soulève un certain nombre de défis encore mal appréhendés. « Des contrôles doivent encadrer la modification du modèle, ainsi que son évaluation et son approbation, car les phases d’entrainement peuvent induire des changements de comportement dont les effets sont difficiles à quantifier », écrit Irregular.

Gemini pirate en devinant les mots de passe

Cette start-up est aussi à l’origine de tests sur un modèle Gemini, organisés en mai dernier et au cours desquels l’IA de Google a pénétré les systèmes de trois entreprises différentes. Tout simplement en devinant ou récupérant les mots de passe d’utilisateurs légitimes. Ce nouvel épisode, dévoilé le 18 septembre par le Wall Street Journal, résulte d’une erreur de configuration : le modèle testé n’était pas censé avoir accès à Internet.

Google estime qu’il ne s’agit toutefois pas d’un cas de « désalignement » de son modèle, ce dernier s’étant arrêté de lui-même après avoir réussi à se connecter à des systèmes externes.

Irregular, qui a observé des incidents similaires lors de tests de modèles d’OpenAI, d’Anthropic et de Meta, dit avoir averti les entreprises concernées fin juillet et avoir corrigé depuis les failles affectant le contrôle des tests de modèles d’IA.

Pull Request pirate sur le GitHub d’OpenAI

Quelques jours plus tôt, ce sont trois chercheurs en sécurité de la société Hacktron qui révélaient avoir pénétré les systèmes internes d’OpenAI en utilisant deux vulnérabilités connues pour compromettre les accès de plusieurs employés de l’entreprise d’IA. Les hackers disent s’être gardés d’accéder à des données confidentielles – ce qu’ils pouvaient matériellement faire, selon leurs affirmations – mais ont publié un pull request sur le repository GitHub d’OpenAI pour prouver la réalité de leur intrusion.

L’attaque, mise en œuvre en 72 heures au mois de juillet dernier, repose notamment sur la capacité des employés d’OpenAI d’utiliser leur authentification centralisée pour accéder au forum maison, basé sur Discourse. « Il y a deux mois encore, tout utilisateur ou employé d’OpenAI se connectant au forum d’aide d’OpenAI (community.openai.com) pouvait se faire pirater ses comptes ChatGPT et Codex. Comme il est possible de connecter divers services à Codex et ChatGPT, l’étendue des données auxquelles nous pouvions théoriquement accéder était immense, incluant notamment GitHub, Slack et les messageries électroniques », écrivent les trois chercheurs dans un billet de blog.

L’IA pour accélérer le développement d’exploits

En complément de l’utilisation de ces droits très étendus associés au forum, Hacktron a eu recours au modèle Opus d’Anthropic pour développer un exploit ciblant une bibliothèque de traitement d’images, libheif, intégrée à Debian, l’OS supportant Discourse. L’attaque souligne à la fois les risques liés à la supply chain logicielle de l’IA – une compromission d’OpenAI ou d’Anthropic ouvre des perspectives multiples à des assaillants mal intentionnés – et les capacités offensives des derniers modèles d’IA, capables de développer rapidement des exploits. Certes, Opus refuse d’en écrire concernant des cibles distantes, mais les chercheurs de Hacktron ont facilement contourné cette digue illusoire, en demandant à l’IA de cibler leur propre instance Discourse. Avant de réutiliser l’exploit sur le forum d’OpenAI.

« Nous avons constaté que chaque nouveau modèle est de plus en plus performant, comme en témoigne l’exploit Discourse présenté dans ce rapport, écrivent les trois chercheurs. Opus 4.8 a rencontré des difficultés lors de plusieurs sessions pour produire un exploit fonctionnel avec l’ASLR activé (soit la randomisation de l’espace d’adressage, NDLR). Quelques heures seulement après la sortie d’Opus 5, nous lui avons soumis le même problème et il y est parvenu. Dans le cadre de cette campagne plus large, nous avons observé un autre bond en avant significatif entre Opus 5 et GPT-5.6 Sol, quand il s’agit d’exploiter la vulnérabilité sans aucune information sur le système cible, hormis le fait qu’il est bien vulnérable. »

L’expertise cyber remplacée par les tokens

La conclusion des chercheurs est assez limpide : une large part de la complexité technique associée aux cyberattaques est en passe de disparaître avec l’IA. « Les vulnérabilités connues liées à la corruption de mémoire étaient auparavant coûteuses à exploiter, tandis que les failles zero-day étaient généralement réservées aux cibles à haute valeur. Il ne s’agissait pas d’une véritable barrière de sécurité, mais cela protégeait concrètement les entreprises contre les vulnérabilités logicielles, écrit Hacktron. L’IA supprime cette protection en transformant une part croissante de cette expertise rare en puissance de calcul. Des tâches qui nécessitaient autrefois une équipe importante et des mois d’efforts peuvent désormais être réalisées en quelques jours. »
Dans le cas présent, 72 heures seulement, dans le cadre d’un projet de recherche sur les failles des grands fournisseurs d’IA qui aura coûté moins de 3000 $ de tokens et mobilisé les trois chercheurs de la jeune société durant deux mois.

À LIRE AUSSI :

À LIRE AUSSI :

Dans l'actualité

Verified by MonsterInsights