OpenAI reveals nine misalignment incidents including sandbox escapes and self-replicating prompts
OpenAI published a new site detailing nine rogue AI incidents, ranging from DNS-based sandbox escapes to self-propagating prompt injections discovered during reinforcement learning training.