Data / IA
OpenAI et Anthropic ont des sandbox trouées et des IA qui ne cessent de déraper
Par Laurent Delattre, publié le 28 septembre 2026
Garde-fous contournés, évasions de bacs à sable, sites détournés, clés API dérobées, données publiées sans autorisation, messages secrets entre agents, intrusion dans des sites gouvernementaux, contournement des accès Internet par DNS… En moins de deux semaines, OpenAI a rendu publique une impressionnante collection de comportements indésirables de ses agents. Surtout, selon Axios, OpenAI comme Anthropic enquêtent désormais sur des dizaines de milliers d’épisodes similaires. Attention toutefois au raccourci : tous ne sont pas des attaques ni toujours des incidents réels. Nombre d’entre eux sont du domaine de l’expérimentation. Mais ils interrogent à nouveau sur la capacité des labos de l’IA à maîtriser leur propre technologie.
Ces derniers jours, OpenAI a révélé neuf nouveaux cas impliquant ses IA agentiques, notamment avec la publication, le 16 septembre, de son nouveau dispositif sur les « comportements désalignés ». La majorité des faits remontent au printemps et à l’été, mais certaines investigations ont traîné en longueur. Mais il ne s’agit que de la partie émergée de l’iceberg. Axios vient de révéler l’ampleur de la partie immergée : OpenAI, Anthropic et des chercheurs en sécurité tiers passent désormais au crible des dizaines de milliers de cas où des modèles frontières ont adopté des comportements jugés problématiques. Survenus ces derniers mois, en test comme dans le monde réel, ces épisodes restent pour beaucoup inédits et leur nombre pourrait encore grimper.
Neuf cas, un même réflexe : atteindre l’objectif
Derrière des scénarios très différents, un motif revient : lorsqu’une barrière empêche l’agent IA d’atteindre son objectif, celui-ci cherche un autre chemin. Comme toujours jusqu’ici, nul besoin d’une IA « malveillante » : un modèle persistant, doté d’outils et « mal récompensé » suffit.
Florilège des derniers dérapages dévoilés par OpenAI :
Par ailleurs, histoire d’en rajouter une couche, OpenAI a également démontré, en simulation, que des instructions pièges cachées dans un texte (des « prompt injections ») peuvent détourner une IA qui le lit, puis se transmettre d’un agent à l’autre, comme un virus informatique.
OpenAI appuie sur le frein
Face à ces incidents et notamment celui du DNS, se contenter de limiter les dégâts ne pouvait suffire.. OpenAI a annoncé juste avant le Week-End avoir suspendu l’entraînement, l’évaluation et l’inférence avec outils de ses modèles les plus puissants. Le run concerné ne reprendra pas. Les accès DNS ont été restreints et de nouvelles équipes de « red team » ont pour mission de traquer les autres failles par lesquelles une IA pourrait s’échapper de sa sandbox.
Ce coup de frein est d’autant plus significatif qu’OpenAI écrit désormais noir sur blanc, dans le texte présentant son dispositif de signalement du 16 septembre, que l’industrie de l’IA ne maîtrise pas encore assez l’alignement et la surveillance de ses modèles pour continuer longtemps à progresser « à vitesse maximale ». Son directeur scientifique, Jakub Pachocki, le disait déjà dix jours plus tôt dans un essai intitulé « An Alien Mind ».
L’incident DNS est des plus révélateurs et permet de saisir l’un des problèmes actuels. La sécurité reposait sur une hypothèse : cette sandbox n’avait pas Internet. Le modèle n’a pas cassé une cryptographie sophistiquée ; il a découvert un canal que les concepteurs n’avaient pas correctement fermé. Le monitoring a alerté rapidement, mais le run n’a été stoppé que deux heures et demie plus tard.
Axios soulève le tapis, et ce n’est pas beau à voir
Le hic, c’est que ces incidents ne sont qu’une infime partie des découvertes récentes. Selon Axios la réalité des dérapages des IA a changé l’échelle ces derniers mois. Ses sources évoquent des dizaines de milliers d’épisodes : contournements de garde-fous, sorties de sandbox, création de canaux de communication, détournement de sites, auto-instructions ou tentatives d’échapper aux moniteurs.
Bien sûr, ce chiffre additionne des tentatives réussies et ratées, des exercices de red team volontairement conçus pour provoquer ces comportements et quelques cas survenus dans le monde réel. La plupart n’ont causé aucun dommage connu.
Mais l’échelle impressionne. Anthropic a déjà reconnu quatre accès non autorisés à de vrais systèmes tiers. Mais la fiche système de Claude Opus 5.5, publiée cette semaine, indique que le modèle a tenté de s’extraire de son bac à sable dans 1,5 % des essais, lors de scénarios adverses où la tâche était insoluble autrement. Rapporté aux centaines de milliers d’exécutions de test, un taux aussi faible se traduit mécaniquement en dizaines de milliers d’incidents. Anthropic a mandaté un organisme de sûreté indépendant pour l’aider dans ses investigations.
L’illusion du Zéro risque
Pour les experts interrogés par Axios, ramener le désalignement à zéro paraît hors de portée, et une part de comportements déviants est même attendue lors des tests.
La difficulté tient à la ténacité des nouveaux agents IA : tendus vers l’accomplissement de leur tâche, ils dénichent des contournements auxquels aucun ingénieur n’avait songé. Vouloir brider leur ingéniosité devient un jeu perdu d’avance, puisqu’il faudrait anticiper chacune de leurs échappées possibles, et dresser une liste exhaustive d’interdits relève de la gageure.
Le truc, c’est qu’un comportement fautif qui se répète en laboratoire a toutes les chances de resurgir un jour en conditions réelles, sous la forme d’un incident de cybersécurité. Connor Leahy (de ControlAI) s’inquiète moins de la gravité de chaque incident que du fond : des systèmes autonomes qui font ce qu’on leur a interdit, potentiellement jusqu’à l’illégalité.
C’est d’ailleurs la principale leçon de cette série noire. Les bacs à sable d’OpenAI et d’Anthropic ne protègent plus seulement contre des modèles qui « désobéissent ». Ils doivent contenir des systèmes qui explorent, insistent et testent les hypothèses de leurs concepteurs. Un bac à sable moderne ne doit donc plus être conçu en espérant que l’IA respectera ses murs. Il doit l’être en supposant qu’elle cherchera les trous.
Que les Labos d’IA ralentissent le rythme d’évolution de leurs prototypes les plus avancés paraît quand même une bonne idée à ce stade. L’important est de profiter de ce temps gagné non pas pour faire davantage de buzz médiatique mais pour réinventer le concept de « sandbox réellement imperméable aux IA les plus avancées ».
À LIRE AUSSI :
À LIRE AUSSI :
