KI-News

OpenAI veröffentlicht GPT-6.1 Sol mit nahezu Astra-Leistung zu geringeren Kosten

OpenAI hat GPT-6.1 Sol vorgestellt, ein Modell, das im Benchmarking für Coding und Computernutzung mit dem Flaggschiff Astra gleichzieht, jedoch nur ein Fünftel der Kosten pro Token verursacht.

Automatisch aus dem englischen Original übersetzt.

OpenAI hat am Dienstag GPT-6.1 Sol veröffentlicht, nur eine Woche nach der Einführung von GPT-6 Sol. Diese neue Iteration bietet Intelligenzniveaus, die mit dem Premium-Modell GPT-6 Astra bei agentischen Coding- und Computernutzungsaufgaben vergleichbar sind, jedoch zu einem deutlich reduzierten Preis. Das Update ist sofort über die API sowie für Abonnenten von ChatGPT Work und Codex verfügbar.

Was passiert ist

Der wesentliche Unterschied von GPT-6.1 Sol liegt in seiner Kosteneffizienz im Verhältnis zur Leistung. OpenAI positioniert dieses Modell als Upgrade des Standardmodells GPT-6 Sol und gibt an, dass es die Fähigkeiten des Flaggschiffs GPT-6 Astra in den Bereichen professionelle Arbeit, Coding-Agenten und Computerinteraktion nahezu erreicht. Entscheidend ist, dass diese Gleichwertigkeit zu einem Fünftel der Standardpreise für Eingabe- und Ausgabe-Tokens von Astra erzielt wird. Die Preisstruktur bleibt konsistent mit dem vorherigen Sol-Modell: 2 USD pro Million Eingabe-Tokens und 10 USD pro Million Ausgabe-Tokens. Zwischengespeicherte (cached) Eingabe-Tokens werden stark rabattiert auf 0,10 USD pro Million.

Der Zugang zu GPT-6.1 Sol ist breit gefächert, aber spezifisch. Es ist in die API integriert und für Plus-, Pro-, Business-, Enterprise- und Edu-Nutzer innerhalb der Umgebungen ChatGPT Work und Codex verfügbar. Allerdings ist es noch nicht in der Standard-Chat-Oberfläche verfügbar. Eine bemerkenswerte Ergänzung für Entwickler, die Codex nutzen, ist die „Ultrafast“-Version des Modells, die Token-Generierungsgeschwindigkeiten bietet, die bis zu achtmal schneller sind als bei der Standardkonfiguration. Dieser Geschwindigkeitsschub zielt auf iterative Coding-Workflows ab, bei denen Latenz die Produktivität der Entwickler direkt beeinflusst.

Die von OpenAI bereitgestellten Benchmark-Daten heben signifikante Gewinne gegenüber dem unmittelbaren Vorgänger hervor. Im DeepSWE 1.1 Coding-Benchmark erzielt GPT-6.1 Sol einen um 6,4 Prozentpunkte höheren Score als GPT-6 Sol. Diese Ergebnisse liegen effektiv gleichauf mit GPT-6 Astra, trotz des erheblichen Preisunterschieds. Bei Aufgaben zum Dokumentenverständnis, wie dem GDP.pdf-Benchmark, der Frage-Antwort-Szenarien auf komplexen PDFs testet, erreicht GPT-6.1 Sol eine Genauigkeit von etwa 32 %. Dies übertrifft Anthropic’s Opus 5.5 (mit Fallbacks), der rund 29 % erzielte, und spiegelt erneut die Leistung von Astra wider, jedoch zu einem Bruchteil der Betriebskosten.

Wie es funktioniert

GPT-6.1 Sol operiert als verfeinerte Version der Sol-Architektur, optimiert für bessere Alignment-Einstellungen und reduzierte Halluzinationsraten, ohne den massiven Rechenaufwand der Astra-Klasse zu erfordern. Das Modell zeigt eine verbesserte faktische Zuverlässigkeit. In Tests mit absichtlich schwierigen Konversationen, bei denen Nutzer frühere Fehler markierten, sank die Rate der Antworten, die mindestens einen faktischen Fehler enthielten, von 11,4 % bei GPT-6 Sol auf 7,7 % bei GPT-6.1 Sol. Dies entspricht einer Reduktion der faktischen Fehler um 32 % bei niedrigen Reasoning-Aufwandsstufen.

Das Modell zeigt zudem eine strengere Einhaltung von Sicherheitsbeschränkungen und Nutzerintentionen. In internen Tests versagten Agenten, die durch GPT-6.1 Sol betrieben wurden, nur in 2,1 % der Fälle dabei, defekte Suchwerkzeuge offenzulegen, wobei sie Transparenz dem Raten vorzogen. Darüber hinaus versuchten diese Agenten nie, automatisierte Sicherheitsprüfer zu umgehen, wenn ihre Aktionen blockiert wurden. Dies deutet darauf hin, dass die zugrunde liegenden Reinforcement-Learning- oder Fine-Tuning-Prozesse angepasst wurden, um robustes Alignment neben roher Fähigkeit zu priorisieren, sodass das kostengünstigere Modell sicher für den Unternehmenseinsatz bleibt.

Wichtige Details

  • Preise: Eingabe-Tokens kosten 2 USD pro Million; Ausgabe-Tokens kosten 10 USD pro Million. Zwischengespeicherte Eingaben kosten 0,10 USD pro Million.
  • Leistung: Erreicht GPT-6 Astra auf Benchmarks für agentisches Coding und Computernutzung zu einem Fünftel der Kosten.
  • Verfügbarkeit: Zugänglich über API, ChatGPT Work und Codex für Plus-, Pro-, Business-, Enterprise- und Edu-Nutzer.
  • Geschwindigkeit: Eine Ultrafast-Version in Codex bietet bis zu 8x schnellere Token-Generierung.
  • Genauigkeit: Faktische Fehlerraten sanken um 32 % im Vergleich zu GPT-6 Sol in Tests mit schwierigen Konversationen.
  • Vergleich: Übertrifft Anthropic’s Opus 5.5 auf GDP.pdf-Benchmarks (32 % vs. 29 %) und DeepSWE (75 % vs. 71 %).

Warum es wichtig ist

Für Engineering-Leads und technische Gründer verändert die Veröffentlichung von GPT-6.1 Sol die wirtschaftliche Kalkulation beim Aufbau KI-gestützter Anwendungen. Bisher war für hochrangige agentische Leistung die Zahlung von Premium-Raten für Flaggschiff-Modelle wie Astra erforderlich. Nun können Teams ähnliche Intelligenz für Coding-Agenten und Computernutzungsaufgaben zu viel geringeren Grenzkosten abrufen. Dies macht es machbar, automatisierte Coding-Assistenten, interne Tooling-Systeme und komplexe Workflow-Automatisierungen ohne prohibitiv hohe Token-Rechnungen zu skalieren. Die Verfügbarkeit einer Ultrafast-Variante in Codex reduziert zusätzlich die Latenzstrafen und macht interaktive Entwicklungshilfen reaktionsfähiger.

Die Verbesserung der faktischen Genauigkeit und des Alignments ist für Produktionssysteme gleichermaßen kritisch. Eine Reduktion der faktischen Fehler um 32 % bedeutet weniger Zeit für Validierung und Debugging nach der Generierung. Für Anwendungen, die sich auf das Abrufen von Informationen aus Dokumenten oder die Ausführung mehrstufiger Aufgaben verlassen, reduziert die Tendenz des Modells, Unsicherheit zuzugeben statt zu raten, das Risiko stiller Fehler. Diese Zuverlässigkeit ermöglicht es Entwicklern, dem Modell mehr autonome Verantwortlichkeiten zu übertragen, wie das Verwalten von Suchwerkzeugen oder das Ausführen von Code, im Wissen, dass Sicherheitsleitplanken robuster durchgesetzt werden.

Was Sie tun können

  • Bewerten Sie GPT-6.1 Sol für Ihre bestehenden Coding-Agent-Workflows, um Kosteneinsparungen im Vergleich zu GPT-6 Astra zu prüfen.
  • Testen Sie die Ultrafast-Version in Codex, um festzustellen, ob der 8-fache Geschwindigkeitszuwachs die Entwicklungsgeschwindigkeit Ihres Teams verbessert.
  • Überprüfen Sie die Fehlerbehandlungslogik Ihrer Anwendung, um die verbesserte Transparenz des Modells bezüglich defekter Werkzeuge zu nutzen.
  • Benchmarken Sie Ihre Dokumentenverarbeitungs-Pipelines anhand der GDP.pdf-Metrik, um zu sehen, ob GPT-6.1 Sol eine bessere Genauigkeit als aktuelle Anbieter bietet.
  • Aktualisieren Sie Ihre Budgetprognosen für Tokens unter Berücksichtigung des Satzes von 0,10 USD pro Million Tokens für zwischengespeicherte Eingaben, um die Kosten zu optimieren.
  • Beobachten Sie die Einführung im Standard-Chat, da die aktuelle Verfügbarkeit auf die Umgebungen Work und Codex beschränkt ist.

Tools aus dem Bytechap-Shop

Weiterlesen

KI-News

Claude Sonnet 5.5 tauscht Token-Effizienz gegen agentische Leistung

Das neue Modell von Anthropic erreicht den zweiten Platz im Intelligence Index durch die Nutzung deutlich mehr Ausgabe-Tokens, was es bei Terminal-Aufgaben mit Spitzen-Agenten gleichzieht, während es bei Faktenwissen zurückbleibt.

Alle Artikel