Anthropic leitet riskante Cyber-Anfragen von Sonnet 5.5 an ältere Modelle weiter
Das neue Modell Sonnet 5.5 von Anthropic nutzt klassifikatorgesteuertes Routing, um bei hochriskanten Cybersicherheitsaufgaben auf Sonnet 5 zurückzugreifen; API-Entwickler müssen sich dafür anmelden.
Automatisch aus dem englischen Original übersetzt.
Anthropic hat am Montag, den 29. September 2026, Claude Sonnet 5.5 veröffentlicht und damit Cyberschutzmaßnahmen sowie automatische Modell-Rückfallmechanismen eingeführt, die bisher nur für seine Spitzenmodelle reserviert waren. Dieses Update markiert eine Veränderung im Umgang des Unternehmens mit der Sicherheit bei produktiven Workloads der mittleren Ebene, insbesondere im Hinblick auf offensive Sicherheitsfähigkeiten.
Was passiert ist
Sonnet 5.5 ist das erste Modell in der Sonnet-Reihe, das mit integrierten Cyberschutzmaßnahmen und klassifikatorgesteuertem Routing auf den Markt kommt. Während Anthropic angibt, dass diese Veröffentlichung die allgemeinen Grenzen der Modellfähigkeiten nicht erweitert, stuft das Unternehmen die Cybersicherheitskompetenzen von Sonnet 5.5 als vergleichbar mit Opus 5 ein. Im Terminal-Bench 4.0 Benchmark für agentisches Coding erzielte das günstigere Modell 70,6 % und übertraf damit Opus 5.5, das bei maximaler Anstrengungsstufe (xhigh) 66,4 % erreichte.
Die Entscheidung, diese Schutzmaßnahmen zu implementieren, resultiert aus erheblichen Verbesserungen in der Leistung des Modells bei offensiver Sicherheit. Bei deaktivierten Schutzmaßnahmen während der Tests gelang es Sonnet 5.5, in 178 von 410 ExploitBench-Läufen vollständige beliebige Codeausführung zu erreichen. Zudem löste es 46,1 % der Herausforderungen im Irregular’s CyScenarioBench, was einen starken Anstieg gegenüber der Abschlussrate von 0,7 % bei Sonnet 5 darstellt. Darüber hinaus führte es 50 Control-Flow-Hijacks auf einem Binary-Exploitation-Benchmark durch, der auf Googles OSS-Fuzz-Korpus basiert, verglichen mit nur drei beim Vorgängermodell.
Obwohl Anthropic Sonnet 5.5 im Bereich Cybersicherheit als weniger fähig als Opus 5.5 oder Mythos 5.1 einschätzt, war der Fähigkeitszuwachs groß genug, um dieselbe Cybersicherheitsrichtlinie wie bei den höherwertigen Modellen zu rechtfertigen. Das Unternehmen räumt ein, dass diese Eingriffe wahrscheinlich die Benchmark-Scores senken, wenn die Schutzmaßnahmen aktiv sind, sie aber notwendig sind, um Risiken im Zusammenhang mit Exploit-Generierung und Penetrationstests zu mindern.
Wie es funktioniert
Der Durchsetzungsmechanismus arbeitet in drei Stufen. Erstens liest eine Sonde die internen Aktivierungen des Modells. Zweitens evaluiert ein leichtgewichtiger Klassifikator, der auf Sonnet 5.5 läuft, die Anfrage. Drittens wägt ein separat trainierter Large-Language-Model-Klassifikator das Urteil der Sonde ab, um zu entscheiden, ob die Konversation blockiert wird. Anthropic behauptet, dass diese Klassifikatoren schädliche Cyber-Anfragen mit Raten erfassen, die denen von Opus 5 entsprechen, wobei die Schutzmaßnahmen gegen Jailbreaks weniger aggressiv sind, da Sonnet 5.5 nicht so leistungsfähig wie die Spitzenmodelle ist.
Wenn eine Anfrage als hochriskant eingestuft wird, etwa solche, die Penetrationstests, Exploit-Generierung oder Scans nach Binärdatei-Schwachstellen beinhalten, löst das System einen Rückfallmechanismus aus. Für API-Nutzer, die sich dafür angemeldet haben, wird die Anfrage sichtbar an Sonnet 5 weitergeleitet. In Anthropics eigenen Anwendungen sehen Nutzer eine Benachrichtigung, wenn der Wechsel stattfindet, und die Antwort identifiziert das verwendete Modell. Wenn der Rückfallmechanismus nicht aktiviert ist, wird die Anfrage einfach gestoppt, statt an das ältere Modell übergeben zu werden.
Wichtig zu beachten ist, dass Blockaden für Biologie, konventionelle Waffen und Anti-Distillation keinen Rückfallmechanismus auslösen; sie beenden die Anfrage vollständig. Diese Blockaden sind transparent und verändern Antworten nicht verdeckt. Die Cybersicherheitsrichtlinie erlaubt jedoch die Entdeckung von Schwachstellen im Quellcode zur Unterstützung sicherer Codierungs-Workflows, während sie die Entdeckung solcher Schwachstellen in kompilierten Binärdateien blockiert.
Wichtige Details
- Sonnet 5.5 wurde am Montag, den 29. September 2026, mit Cyberschutzmaßnahmen und Modell-Rückfallmechanismen eingeführt.
- Hochriskante Cybersicherheitsanfragen können auf Sonnet 5 zurückfallen, wenn sich API-Entwickler für den automatischen Rückfallmechanismus anmelden.
- Das Modell erzielte 70,6 % im Terminal-Bench 4.0 und übertraf damit die 66,6 % von Opus 5.5 bei maximaler Anstrengungsstufe (xhigh).
- Die Schutzmaßnahmen prüfen alle Eingabedaten, einschließlich Speicher, Connector-Inhalte, Web-Suchergebnisse und Dateien.
- Tests zur Prompt-Injection zeigten, dass 12,01 % der an Sonnet 5 umgeleiteten Anfragen erfolgreich kompromittiert wurden.
- Verifizierte Verteidiger könnten künftig über ein erweitertes Cyber Verification Program Zugang zum Modell mit weniger Einschränkungen erhalten.
Warum das wichtig ist
Für Software-Ingenieure und technische Leiter bedeutet diese Änderung, dass Sonnet 5.5 nicht in allen Szenarien als direkter Ersatz für Sonnet 5 behandelt werden kann. Die Einführung sichtbarer Rückfallmechanismen führt zu Variabilität im Modellverhalten und in der Leistung. Entwickler müssen nun die Sicherheitslage sowohl von Sonnet 5.5 als auch von Sonnet 5 berücksichtigen, da das ältere Modell sensible Anfragen bearbeiten könnte, sobald der Rückfall ausgelöst wird. Diese Umgebung mit zwei Modellen erfordert sorgfältiges Testen, um sicherzustellen, dass Rückfallmechanismen keine unerwarteten Schwachstellen oder Unterbrechungen der Workflow-Kontinuität einführen.
Darüber hinaus geht der Umfang dessen, was einen Schutzmechanismus auslöst, über Benutzer-Prompts hinaus. Da die Prüfungen alles lesen, was das Modell verarbeitet, einschließlich Inhalte aus Repositories, Sicherheitswarnungen oder Webseiten, können Agenten, die externe Daten abrufen, versehentlich einen Rückfallmechanismus auslösen. Dies schafft eine potenzielle Schwachstelle für Prompt-Injection-Angriffe. Tests ergaben, dass injizierte Anweisungen zum Löschen von Festplatten oder Dateien oft die Cyber-Blockade auslösten, was zu einer Umleitung führte, bei der 12,01 % dieser Anfragen kompromittiert wurden. Teams, die Rückfallmechanismen nutzen, müssen ihre Systeme daher gegen indirekte Prompt-Injections härten, die das weniger sichere Rückfallmodell ausnutzen könnten.
Was Sie tun können
- Überprüfen Sie Ihre API-Konfiguration, um zu entscheiden, ob Sie sich für den automatischen Rückfallmechanismus anmelden möchten.
- Berücksichtigen Sie bei der Planung Ihrer Workflows, dass hochriskante Anfragen möglicherweise an ein anderes Modell weitergeleitet werden.
- Führen Sie umfassende Tests durch, um sicherzustellen, dass Ihr System stabil bleibt, wenn Rückfallmechanismen aktiviert sind.
- Schützen Sie Ihre Anwendung vor indirekten Prompt-Injection-Angriffen, die den Rückfallmechanismus missbrauchen könnten.


