Sicherheit & Datenschutz

OpenAI unterbindet Kampagne zur Extraktion von Reasoning-Daten im Zusammenhang mit Moonshot AI

OpenAI hat einen koordinierten Versuch blockiert, geschützte Reasoning-Spuren aus seinen Modellen zu extrahieren, und schreibt die Aktivität Mitarbeitern des chinesischen Unternehmens Moonshot AI zu.

Automatisch aus dem englischen Original übersetzt.

OpenAI hat eine groß angelegte Kampagne identifiziert und zerschlagen, die darauf abzielte, illegale geschützte Reasoning-Daten aus den künstlichen Intelligenzmodellen des Unternehmens zu extrahieren. Das Unternehmen führt den Kern dieser Aktivität auf Personen zurück, die mit dem in Peking ansässigen Wettbewerber Moonshot AI verbunden sind, und hat die Operation Ende Juli 2026 vollständig unterbunden.

Was passiert ist

Die Kampagne begann am 1. Juli 2026 mit Versuchen geringen Umfangs, die allmählich eskalierten. Am 24. und 25. Juli nahm die Aktivität erheblich zu, wobei über 4.000 Nutzer etwa 16.000 versuchte Anfragen unter Verwendung spezifischer Extraktionsmuster generierten. Weitere Untersuchungen ergaben, dass verwandte Aktivitäten mit Prompt-Mustern mehr als 15.000 Nutzer auf der Plattform betrafen. OpenAI hat die Kampagne am 28. Juli 2026 vollständig gestoppt und die beteiligten betrügerischen Konten gesperrt.

OpenAI gab an, dass die Betreiber keine Verschlüsselung gebrochen, Datenbanken kompromittiert oder direkten Zugriff auf gespeicherte Nutzerkonversationen erhalten haben. Stattdessen manipulierte sie Modellinteraktionen, um geschütztes Reasoning in einer für den Anfragenden sichtbaren Form zu reproduzieren. Diese Methode verstieß gegen die Nutzungsbedingungen des Unternehmens und wurde als adversarial Distillation (feindliche Wissensverdichtung) charakterisiert. Dabei werden die Ausgaben eines Modells systematisch und unbefugt genutzt, um ein anderes Modell zu trainieren oder zu verbessern.

Dieser Vorfall folgt früheren Anschuldigungen gegen Moonshot AI. Im vergangenen Monat warf Anthropic dem Unternehmen vor, Kundenanfragen heimlich an sein Claude-Modell weitergeleitet zu haben, statt sie mit seinem eigenen Kimi-Modell zu verarbeiten, und angeblich einige Austauschvorgänge behalten zu haben, um seine Chain-of-Thought-Fähigkeiten zu trainieren. Die aktuelle Aktivität wird unter der Bezeichnung GTG-16002 verfolgt.

Wie es funktioniert

Der Angriff nutzte eine architektonische Schwachstelle aus, die in einer Studie beschrieben wird, die im August 2026 von Forschern des MATS Research, des ELLIS Institute Tübingen und Synk veröffentlicht wurde. Die Studie ergab, dass verschlüsselte Reasoning-Spuren innerhalb des Ökosystems eines Anbieters zwischen verschiedenen Sitzungen, Nutzern und Modellen vollständig kompatibel und austauschbar waren. Dieser technische Fehler ermöglichte es Angreifern, einen skalierbaren Entschlüsselungs-Jailbreak zu entwickeln.

Durch das Einspeisen einer verschlüsselten Reasoning-Spur eines leistungsstarken Modells in ein schwächeres, weniger gesichertes Modell desselben Anbieters konnten Angreifer das schwächere Modell dazu zwingen, die Spur zu entschlüsseln und im Klartext auszugeben. Dieser Prozess umging die Notwendigkeit, das leistungsfähigere Modell direkt zu jailbreaken. Die Technik ermöglichte zudem die großskalige Extraktion privater Daten und unsichtbare Prompt-Injections durch das Einbetten bösartiger Payloads in verschlüsselte Blöcke.

Wichtige Details

  • Die Kampagne lief vom 1. bis zum 28. Juli 2026, mit einem starken Anstieg am 24./25. Juli, bei dem 16.000 Versuche von über 4.000 Nutzern unternommen wurden.
  • OpenAI führte die Kernaktivität auf Personen zurück, die mit Moonshot AI verbunden sind, nannte jedoch keine spezifischen technischen Beweise für diese Zuordnung.
  • Die Angriffsmethode bestand darin, Modellinteraktionen zu manipulieren, anstatt Verschlüsselungen zu brechen oder Datenbanken zu kompromittieren.
  • Eine verwandte Studie deckte auf, dass verschlüsselte Reasoning-Spuren zwischen Modellen austauschbar waren, was es schwächeren Modellen ermöglichte, Spuren von stärkeren Modellen zu entschlüsseln.
  • OpenAI schloss den Pfad, der das Wiederholen verschlüsselter Reasoning-Daten zur Wiederherstellung von Inhalten ermöglichte, und fügte Prüfungen hinzu, um offengelegtes Reasoning im gestreamten Output zu erkennen.
  • Die Aktivität wird als GTG-16002 verfolgt und folgt früheren Vorwürfen der Wissensverdichtung gegen Moonshot AI durch Anthropic.

Warum es wichtig ist

Für Software-Ingenieure und KI-Entwickler unterstreicht dieser Vorfall die Fragilität der aktuellen Schutzmaßnahmen rund um das Modell-Reasoning. Geschützte Reasoning-Spuren geben Aufschluss darüber, wie ein Modell Aufgaben verarbeitet, und ihre Extraktion kann sensible Daten offenlegen oder dazu beitragen, Fähigkeiten ohne die ursprünglichen Sicherheitsinvestitionen zu reproduzieren. Wie OpenAI feststellte, birgt adversarial Distillation Sicherheits- und nationale Risiken, da extrahierte Reasoning-Daten verwendet werden können, um andere Modelle zu trainieren, ohne die ursprünglichen Schutzmechanismen beizubehalten.

Die Schwachstelle zeigt auch, dass Sicherheit nicht nur darin besteht, direkten Zugriff zu verhindern, sondern auch darin, zu managen, wie Modelle innerhalb eines Ökosystems interagieren. Wenn verschlüsselte Daten zwischen Modellen austauschbar sind, kann eine Schwäche in einem weniger gesicherten Modell das gesamte System gefährden. Dies hat Auswirkungen darauf, wie Anbieter Modellarchitekturen entwerfen und verschlüsselte Datenströme handhaben, insbesondere wenn Modelle Fähigkeiten in Dual-Use-Bereichen erlangen.

Was Sie tun sollten

Tools aus dem Bytechap-Shop

Weiterlesen

Alle Artikel