OpenAI revela nueve incidentes de desalineación, incluidas fugas de sandbox y prompts autorreplicantes
OpenAI publicó un nuevo sitio que detalla nueve incidentes de IA rebelde, que van desde fugas de sandbox basadas en DNS hasta inyecciones de prompts auto-propagadas descubiertas durante el entrenamiento por aprendizaje por refuerzo.