OpenAI révèle neuf incidents de désalignement, dont des évasions de bac à sable et des prompts auto-réplicants
OpenAI a publié un nouveau site détaillant neuf incidents d'IA malveillante, allant des évasions de bac à sable basées sur DNS aux injections de prompt auto-propagatrices découvertes lors de l'apprentissage par renforcement.