KI-News

Claude Sonnet 5.5 tauscht Token-Effizienz gegen agentische Leistung

Das neue Modell von Anthropic erreicht den zweiten Platz im Intelligence Index durch die Nutzung deutlich mehr Ausgabe-Tokens, was es bei Terminal-Aufgaben mit Spitzen-Agenten gleichzieht, während es bei Faktenwissen zurückbleibt.

Automatisch aus dem englischen Original übersetzt.

Anthropic hat Claude Sonnet 5.5 veröffentlicht, ein Mittelklasse-Modell, das nun auf dem zweiten Platz des Artificial Analysis Intelligence Index rangiert. Das am 28. September 2026 veröffentlichte Update zeigt, dass das Modell die Lücke zu Flaggschiff-Konkurrenten in agentischen Workflows schließt, wobei diese Gewinne durch einen ungewöhnlich hohen Token-Verbrauch und nicht durch architektonische Effizienz erzielt werden.

Was passiert ist

Claude Sonnet 5.5 rückt auf den zweiten Platz im Intelligence Index vor und liegt nur hinter Opus 5.5 bei maximaler Anstrengung (Max Effort). Das Modell gewinnt 18 Punkte gegenüber seinem Vorgänger, Sonnet 5, was hauptsächlich auf massive Verbesserungen bei der Terminal-Nutzung und komplexer Wissensarbeit zurückzuführen ist. Im Terminal-Bench 4.0, der bewertet, wie gut Modelle Befehlszeilen-Interaktionen bewältigen, erzielt Sonnet 5.5 eine Punktzahl von 64 Prozent. Damit liegt es leicht vor sowohl Opus 5.5 als auch GPT-6 Astra, die jeweils 60 Prozent erreichen.

Trotz dieser Leistungssteigerungen führt das Modell nicht in allen Kategorien. Es bleibt hinter Opus 5.5 im Bereich Faktenwissen und wissenschaftliches Schlussfolgern. Auf dem AA-Omniscience-Benchmark für faktische Genauigkeit erzielt Sonnet 5.5 54 Prozent im Vergleich zu 66 Prozent für Opus 5.5. Allerdings weist es eine niedrigere Halluzinationsrate von 47 Prozent gegenüber 59 Prozent beim größeren Modell auf. Die Bewertungen wurden an einer Vorabversion durchgeführt, die einen Fehler enthielt, der strukturierte Ausgaben betraf; Anthropic gibt an, dass dieser für die öffentliche Version behoben wurde.

Wie es funktioniert

Der Kernmechanismus hinter der verbesserten Rangliste von Sonnet 5.5 ist die Einstellung "max effort" (maximale Anstrengung), die eine extreme Steigerung des Verbrauchs an Ausgabe-Tokens auslöst. Um Aufgaben im Intelligence Index abzuschließen, generiert das Modell ungefähr 193.000 Ausgabe-Tokens pro Aufgabe. Dies ist der höchste Token-Verbrauch, der von Artificial Analysis aufgezeichnet wurde, übersteigt Opus 5.5 und Sonnet 5 um etwa 60 Prozent und übertrifft GPT-6 Astra um das Siebenfache. Das Modell löst komplexe Probleme im Wesentlichen durch Brute-Force-Ansätze, indem es umfangreiche Gedankengänge und Verifikationsschritte generiert.

Anthropic bietet fünf Anstrengungsstufen an: low, medium, high, xhigh und max. Die Bewertungen im Intelligence Index wurden über alle fünf Stufen hinweg mit aktivierten Standard-Fallbacks durchgeführt. Das Modell fiel nur bei 0,1 Prozent der Aufgaben auf die vorherige Sonnet-5-Version zurück, meist innerhalb von Terminal-Bench 4.0. Während die Max-Effort-Einstellung die hohe Position in der Rangliste antreibt, sind niedrigere Anstrengungsstufen weniger wettbewerbsfähig. Bei den Einstellungen low, medium und high liefern GPT-6-Sol-Konfigurationen eine gleichwertige oder bessere Leistung mit weniger Ausgabe-Tokens.

Wichtige Details

  • Rangliste: Zweiter Platz im Artificial Analysis Intelligence Index, hinter Opus 5.5 (max).
  • Token-Nutzung: Verwendet ~193k Ausgabe-Tokens pro Aufgabe bei maximaler Anstrengung, der bisher höchste gemessene Wert.
  • Preisgestaltung: Identisch mit Sonnet 5 bei $0,2/$2/$10 pro 1M Cache-Eingabe/Eingabe/Ausgabe-Tokens.
  • Kosten pro Aufgabe: Ungefähr $7,60 pro Aufgabe, was 50 Prozent höher ist als bei Sonnet 5.
  • Terminal-Leistung: Erzielt 64 % im Terminal-Bench 4.0 und übertrifft damit Opus 5.5 und GPT-6 Astra.
  • Kontextfenster: Bleibt unverändert bei 1 Million Tokens für Text- und Bildeingaben.

Warum es wichtig ist

Für Engineering-Teams, die agentische Systeme entwickeln, stellt Sonnet 5.5 einen Kompromiss zwischen Leistungsfähigkeit und Kosteneffizienz dar. Das Modell erreicht oder übertrifft führende Konkurrenten in praktischen Terminal-Anwendungen und Automatisierungs-Benchmarks wie AA-Briefcase und AutomationBench-AA. Dies macht es zu einem starken Kandidaten für Workflows, die eine tiefgreifende Interaktion mit Entwicklungsumgebungen oder komplexen Datenverarbeitungspipelines erfordern. Diese Leistung bringt jedoch einen erheblichen Preis mit sich. Die Kosten pro Aufgabe liegen bei rund $7,60, was bedeutet, dass es für das gleiche Arbeitsvolumen deutlich teurer ist als sein Vorgänger.

Die Positionierung von Sonnet 5.5 unterstreicht zudem eine Verschiebung darin, wie Mittelklasse-Modelle konkurrieren. Anstatt zu versuchen, Flaggschiff-Modelle durch reine Dichte des Schlussfolgerns zu schlagen, hat Anthropic Sonnet 5.5 so optimiert, dass es mehr Rechenleistung und Tokens verbraucht, um ähnliche Ergebnisse zu erzielen. Für Entwickler bedeutet dies, dass die Wahl zwischen Sonnet 5.5 und Modellen wie GPT-6 Sol stark von der spezifischen Aufgabe abhängt. Wenn das Token-Budget knapp ist, könnte GPT-6 Sol bei niedrigeren Anstrengungsstufen einen besseren Mehrwert bieten. Wenn die Aufgabe maximale agentische Ausdauer in einer Terminal-Umgebung erfordert, wird Sonnet 5.5 bei maximaler Anstrengung zu einer machbaren, wenn auch kostspieligen Alternative zu Opus 5.5.

Was Sie tun können

  • Benchmarken Sie Ihre aktuellen agentischen Workflows gegen Sonnet 5.5 bei maximaler Anstrengung, um zu prüfen, ob sich die 64%-Punktzahl im Terminal-Bench in reale Zuverlässigkeit übersetzt.
  • Vergleichen Sie die Kosten pro Aufgabe von $7,60 mit Ihrem bestehenden Budget für Sonnet 5 oder GPT-6 Sol, um die finanzielle Tragfähigkeit zu bestimmen.
  • Testen Sie die fünf Anstrengungsstufen einzeln, um die optimale Balance zwischen Token-Nutzung und Genauigkeit für Ihren spezifischen Anwendungsfall zu finden.
  • Überwachen Sie die Halluzinationsraten, wenn faktische Genauigkeit kritisch ist, und beachten Sie, dass Sonnet 5.5 eine niedrigere Rate als Opus 5.5 aufweist, aber auch niedrigere Gesamtwerte für Faktenwissen hat.
  • Überprüfen Sie die Verarbeitung strukturierter Ausgaben in Ihren Anwendungen und stellen Sie sicher, dass Sie die öffentliche Version verwenden, in der der Fehler aus der Vorabversion behoben wurde.
  • Bewerten Sie, ob das Kontextfenster von 1 Million Tokens Ihren Anforderungen entspricht, da sich diese Spezifikation im Vergleich zur vorherigen Version nicht geändert hat.

Tools aus dem Bytechap-Shop

$89

DocBento

Selbst gehostetes Dokumentenmanagement, das jeden Scan liest und mit Seitenzitaten antwortet.

Live-Demo

Weiterlesen

Alle Artikel