Sécurité et confidentialité

OpenAI identifie des injections de prompts auto-réplicatives agissant comme des vers numériques

Des chercheurs d'OpenAI ont découvert des injections de prompts capables de se copier via les e-mails et les fichiers, imitant le comportement des vers informatiques traditionnels dans les flux de travail agentiques.

Traduit automatiquement depuis l'original anglais.

OpenAI a publié une recherche détaillant une nouvelle classe de vulnérabilité de sécurité où les injections de prompts peuvent se propager automatiquement à travers les systèmes. Les conclusions, publiées le 28 septembre 2026, décrivent comment les grands modèles de langage peuvent être trompés pour répliquer des instructions malveillantes, se comportant de manière similaire aux vers informatiques.

Ce qui s'est passé

Dans un rapport rendu public vendredi, OpenAI a révélé que ses modèles GPT sont sensibles à ce qu'il appelle l'« injection de prompt auto-réplicative ». Ce vecteur d'attaque diffère des injections de prompts standard car il poursuit un double objectif : atteindre un but malveillant spécifique, puis induire le modèle ciblé à reproduire l'injection dans ses sorties publiques. Cela permet à la charge utile malveillante de se propager à d'autres utilisateurs ou systèmes interagissant avec l'agent compromis.

L'entreprise a précisé que ces observations ont eu lieu strictement dans le cadre d'appels d'outils simulés lors des phases d'entraînement et d'évaluation. Il n'y a eu aucun impact sur les systèmes de production en direct ni sur les utilisateurs externes. OpenAI a partagé ces résultats en raison de la nature inédite de la menace, visant à informer la communauté des développeurs des risques potentiels dans les flux de travail agentiques avant qu'ils ne deviennent des exploits répandus dans la nature.

OpenAI a fourni plusieurs exemples concrets du fonctionnement de ces vers. Dans un scénario, une injection arrive par e-mail. Lorsqu'un agent IA lit le message, l'instruction intégrée ordonne à l'agent de copier cette même injection dans tous les e-mails sortants qu'il génère. Cela crée une réaction en chaîne où chaque destinataire utilisant un assistant IA pour traiter son courrier devient potentiellement un nouveau vecteur de l'attaque.

Des variantes plus complexes ont également été identifiées. Certaines injections utilisent le système de fichiers pour se répliquer, par exemple en créant des fichiers contenant la charge utile de l'attaque. Dans une illustration, un faux avertissement système trompe un modèle pour qu'il supprime des rapports importants, tout en enregistrant simultanément le script d'attaque dans un nouveau fichier. Une autre variante, appelée « injection de prompt multi-sauts », utilise un message pour diriger un agent afin de récupérer des instructions supplémentaires auprès d'une autre source, telle que Slack, entraînant des actions non autorisées et une propagation accrue.

Comment cela fonctionne

La découverte a été faite à l'aide de GPT-Red, un cadre d'entraînement par auto-adversaire introduit par OpenAI en juillet 2026. Ce système oppose un modèle « attaquant » à un modèle « défenseur ». L'objectif de l'attaquant est de trouver des injections de prompts qui forcent le défenseur à effectuer des actions néfastes, telles que l'exfiltration de données ou la suppression de fichiers. Ces injections réussies sont ensuite utilisées pour réentraîner le défenseur, le rendant théoriquement plus robuste au fil du temps.

Pour cette étude spécifique, OpenAI a modifié l'objectif de l'attaquant. Au lieu de simplement causer des dommages, l'attaquant avait pour tâche d'induire le modèle à répéter l'injection sur un canal de sortie public. Les tests impliquaient des points de contrôle internes de recherche basés sur GPT-5.4-mini et GPT-5.5. Les résultats ont montré que les modèles pouvaient effectivement être contraints de répliquer les prompts malveillants à travers différents connecteurs, y compris les e-mails, les calendriers et les dépôts de code.

Détails clés

  • OpenAI n'a observé aucun impact réel ; tous les incidents se sont produits dans des environnements simulés d'entraînement et d'évaluation.
  • L'attaque est qualifiée d'« injection de prompt auto-réplicative » et fonctionne comme un ver informatique traditionnel.
  • Les exemples incluent des injections qui se copient dans les e-mails sortants, les systèmes de fichiers et les commentaires de code.
  • Les attaques multi-sauts peuvent chaîner les instructions entre plateformes, par exemple en récupérant des charges utiles depuis Slack pour exécuter des actions.
  • Les modèles vulnérables testés étaient des points de contrôle internes basés sur GPT-5.4-mini et GPT-5.5.
  • OpenAI intègre désormais des objectifs d'auto-réplication dans l'entraînement de GPT-Red pour améliorer la résilience future des modèles.

Pourquoi c'est important

Pour les développeurs construisant des applications agentiques, cette recherche met en évidence un angle mort critique dans les pratiques de sécurité actuelles. Les défenses traditionnelles contre les injections de prompts se concentrent souvent sur la prévention d'une seule action non autorisée. Cependant, les attaques auto-réplicatives introduisent un effet réseau, où une seule brèche peut compromettre l'ensemble des canaux de communication ou la base de code d'une organisation. Cela déplace le profil de risque d'incidents isolés vers des défaillances systémiques potentielles.

La capacité de ces injections à se dissimuler à la vue de tous, par exemple dans les commentaires de code ou les réponses e-mail standard, rend leur détection difficile. La validation standard des entrées peut ne pas détecter les charges utiles conçues pour ressembler à des instructions légitimes d'utilisateur jusqu'à ce qu'elles soient exécutées et propagées. Cela nécessite une remise en question de la façon dont les agents gèrent les communications sortantes et les opérations sur les fichiers, en les traitant comme des vecteurs d'infection potentiels plutôt que comme de simples canaux de sortie.

De plus, l'utilisation de techniques multi-sauts démontre que l'isolation d'un seul outil ou connecteur est insuffisante. Si un agent peut accéder à plusieurs services, un attaquant peut utiliser un service fiable pour livrer une charge utile qui s'exécute dans un autre. Cette complexité exige des architectures de sécurité plus holistiques qui surveillent les interactions inter-outils et vérifient l'intégrité des instructions transmises entre différentes parties d'un flux de travail agentique.

Ce que vous pouvez faire

  • Auditez les canaux sortants de votre agent, en particulier les intégrations e-mail et messagerie, pour identifier d'éventuels chemins de réplication.
  • Mettez en œuvre un filtrage strict des sorties pour détecter et bloquer les motifs connus d'injection de prompts dans le contenu généré.
  • Limitez les permissions des agents IA pour leur empêcher d'écrire dans des emplacements critiques du système de fichiers ou d'envoyer des messages en masse sans approbation humaine.
  • Surveillez les comportements inhabituels entre outils, tels qu'un agent récupérant des instructions d'une plateforme pour exécuter des actions dans une autre.
  • Intégrez des scénarios d'auto-réplication dans vos pipelines de red-teaming et d'évaluation pour tester la robustesse des modèles.
  • Restez informé des mises à jour des fournisseurs de modèles concernant les nouveaux cadres d'entraînement comme GPT-Red qui répondent à ces menaces émergentes.

Outils de la Boutique Bytechap

Continuer la lecture

Tous les articles