OpenAI deckt neun Fälle von Fehljustierung auf, darunter Sandbox-Fluchten und sich selbst replizierende Prompts
OpenAI hat eine neue Website veröffentlicht, die neun Vorfälle mit außer Kontrolle geratenen KI-Systemen beschreibt. Diese reichen von DNS-basierten Ausbrüchen aus Sandboxes bis hin zu sich selbst verbreitenden Prompt-Injection-Angriffen, die während des Train