KI-News

Googles Gemini 4 Argon erreicht Spitzenleistung der Top-KI-Modelle zu halben Kosten

Google DeepMind veröffentlicht Gemini 4 Argon, das GPT-6 Astra bei Intelligenz-Benchmarks gleichkommt und durch anfängliche Rabatte sowie verbessertes Caching erhebliche Kostenvorteile bietet.

Automatisch aus dem englischen Original übersetzt.

Google DeepMind kehrt mit der Veröffentlichung von Gemini 4 Argon an die Spitze der Entwicklung künstlicher Intelligenz zurück. Das neue proprietäre Modell erreicht eine Leistung, die mit den führenden Wettbewerbern gleichzieht. Seit dem Start Ende September 2026 erzielt dieses Modell Parität mit OpenAIs GPT-6 Astra bei wichtigen Intelligenz-Metriken, während es aufgrund von Aktionspreisen derzeit deutlich geringere Kosten pro Aufgabe verursacht.

Was passiert ist

Gemini 4 Argon stellt Googles erstes proprietäres Modell über der Flash-Klasse seit mehr als sieben Monaten dar. Im Artificial Analysis Intelligence Index erzielt das Modell einen Wert von 53, was identisch mit der maximalen Punktzahl von GPT-6 Astra ist und einen Punkt höher liegt als bei GPT-6.1 Sol. Dies markiert eine wesentliche Verbesserung für Google und positioniert das Unternehmen fest unter den drei besten KI-Labors hinsichtlich der reinen Intelligenzfähigkeit. Das vorherige Nicht-Flash-Modell von Google, Gemini 3.1 Pro Preview, erreichte im selben Index nur 30 Punkte, was einen großen Leistungssprung verdeutlicht.

Der wirtschaftliche Aspekt dieser Veröffentlichung ist ebenso bemerkenswert. Derzeit bietet Google einen Rabatt von 50 % auf die Preise an, wodurch die Kosten pro Aufgabe im Intelligence Index auf 1,99 USD sinken. Dies entspricht ungefähr 60 % der Kosten, die für eine vergleichbare Aufgabe mit GPT-6 Astra anfallen, welches 3,26 USD pro Aufgabe kostet. Diese Effizienz wird jedoch nicht durch eine reduzierte Token-Nutzung, sondern durch niedrigere Token-Preise getrieben. Tatsächlich verwendet Gemini 4 Argon durchschnittlich 62.000 Ausgabe-Tokens pro Aufgabe, mehr als doppelt so viele wie die 27.000 Tokens, die von GPT-6 Astra genutzt werden. Sobald der Aktionsrabatt endet, steigen die Kosten pro Aufgabe auf 3,98 USD, was das Modell leicht teurer als GPT-6 Astra macht, aber im Vergleich zu anderen High-End-Modellen weiterhin wettbewerbsfähig bleibt.

Wie es funktioniert

Die technische Architektur von Gemini 4 Argon unterstützt ein Kontextfenster von einer Million Tokens und akzeptiert multimodale Eingaben einschließlich Text, Bild, Video und Sprache, gibt jedoch nur Text aus. Eine Schlüsselinnovation beim Einsatz ist die Einführung der Long Decode Continuation (Fortsetzung der langen Dekodierung). Diese API-Funktion ermöglicht es, lange Antworten über nachfolgende Aufrufe hinweg zu pausieren und fortzusetzen, sodass Reasoning-Prozesse bis zu einer Million Ausgabe-Tokens andauern können, ohne dass Request-Timeouts ausgelöst werden. Dies ist besonders nützlich für komplexe agentische Workflows, die umfangreiche schrittweise Logik erfordern.

Leistungsverbesserungen zeigen sich auch in den agentischen Fähigkeiten und der Zuverlässigkeit des Modells. Historisch hinkten Gemini-Modelle bei autonomen Agentenaufgaben hinterher, aber Argon belegt mit einem Score von 78 % den ersten Platz im AutomationBench-AA und übertrifft damit Claude Sonnet 5.5. Es zeigt zudem eine dramatische Verbesserung im Terminal Bench 4, wo es gegenüber seinem Vorgänger um 53 Punkte zulegt. Darüber hinaus weist das Modell die niedrigste Halluzinationsrate unter den führenden Modellen auf, die im Intelligenzindex über 45 Punkte erreichen. Mit einer Halluzinationsrate von 15 % neigt es eher dazu, Unwissenheit einzuräumen, als falsch zu raten, obwohl sein Rohgenauigkeitswert von 50 % niedriger ist als der von GPT-6 Astra.

Wichtige Details

  • Intelligenzwert: Erzielt 53 Punkte im Artificial Analysis Intelligence Index, gleichauf mit GPT-6 Astra (Maximum) und besser als GPT-6.1 Sol (Maximum).
  • Preisgestaltung: Aktuell mit 50 % Rabatt auf 2 USD/10 USD pro Million Eingabe-/Ausgabe-Tokens, was Kosten von 1,99 USD pro Aufgabe ergibt; Standardpreise betragen 4 USD/20 USD.
  • Caching: Eingabe-Tokens aus dem Cache erhalten einen Rabatt von 95 %, was Kosten von 0,10 USD pro Million Tokens bedeutet – eine Steigerung gegenüber dem 90 %-Rabatt in früheren Versionen.
  • Agentische Leistung: Belegt Platz #1 im AutomationBench-AA mit 78 % und erzielt einen Score von 57 % im Terminal Bench 4.
  • Zuverlässigkeit: Weist eine Halluzinationsrate von 15 % auf, die niedrigste unter den Top-Modellen, obwohl die Gesamtgenauigkeit bei 50 % liegt.
  • Verfügbarkeit: Wird derzeit schrittweise für ausgewählte Nutzer eingeführt und ist noch nicht öffentlich verfügbar; das Enddatum für den 50 %-Rabatt ist unbestätigt.

Warum es wichtig ist

Für Software-Ingenieure und technische Gründer bringt die Rückkehr Googles als Spitzenkonkurrent gesunden Druck auf Preis- und Leistungsstandards. Die Fähigkeit, die höchsten Intelligenzwerte zu erreichen und gleichzeitig während der Aktionsphase niedrigere Einstiegskosten anzubieten, ermöglicht es Teams, Modelle mit hohem Reasoning-Aufwand zu testen, ohne sofortige Budgetbelastungen. Die signifikante Verbesserung der agentischen Fähigkeiten deutet darauf hin, dass Gemini 4 Argon ein starker Kandidat für den Aufbau autonomer Agenten sein könnte, die robuste Tool-Nutzung und mehrstufige Planung erfordern – Bereiche, in denen frühere Gemini-Iterationen Schwierigkeiten hatten.

Entwickler müssen jedoch den Kompromiss zwischen Kosten und Token-Effizienz sorgfältig abwägen. Während die Kosten pro Aufgabe während der Aktion niedriger sind, bedeutet der hohe Token-Verbrauch, dass Anwendungen, die empfindlich auf Latenz reagieren oder strenge Token-Budgets haben, möglicherweise optimiert werden müssen. Die niedrige Halluzinationsrate ist ein entscheidender Vorteil für Anwendungen, die hohe Vertrauenswürdigkeit erfordern, wie etwa juristische oder medizinische Assistenten, bei denen das Einräumen von Unsicherheit der Bereitstellung falscher Informationen vorzuziehen ist. Wenn das Modell auf die allgemeine Verfügbarkeit zusteuert, wird das Verständnis dieser betrieblichen Eigenschaften für eine effektive Integration unerlässlich sein.

Was Sie tun können

  • Beantragen Sie Early Access, wenn Sie ein ausgewählter Nutzer sind, um agentische Workflows zu testen.
  • Bewerten Sie den Trade-off zwischen Kosten und Token-Effizienz sorgfältig, da der hohe Token-Verbrauch Optimierungen erforderlich machen kann.
  • Nutzen Sie die niedrige Halluzinationsrate für Anwendungen mit hohen Anforderungen an Vertrauenswürdigkeit, wie rechtliche oder medizinische Assistenten.
  • Beobachten Sie das Enddatum des 50 %-Rabatts, um Ihre Budgetplanung für die Zeit nach der Aktionsphase anzupassen.

Tools aus dem Bytechap-Shop

$89

DocBento

Selbst gehostetes Dokumentenmanagement, das jeden Scan liest und mit Seitenzitaten antwortet.

Live-Demo

Weiterlesen

KI-News

Claude Sonnet 5.5 tauscht Token-Effizienz gegen agentische Leistung

Das neue Modell von Anthropic erreicht den zweiten Platz im Intelligence Index durch die Nutzung deutlich mehr Ausgabe-Tokens, was es bei Terminal-Aufgaben mit Spitzen-Agenten gleichzieht, während es bei Faktenwissen zurückbleibt.

Alle Artikel