KI-News

Googles Gemini 4 Argon führt bei Wissensarbeit, schränkt aber den Zugang zum Coding ein

Google hat Gemini 4 Argon veröffentlicht, ein neues Flaggschiff-Modell, das Konkurrenten bei Wissensaufgaben und dem Long-Context-Reasoning übertrifft, wobei die Ergebnisse beim Programmieren variieren und die Verfügbarkeit weiterhin eingeschränkt ist.

Automatisch aus dem englischen Original übersetzt.

Google hat offiziell Gemini 4 Argon vorgestellt, sein neuestes Flaggschiff-KI-Modell, das es als überlegene Alternative zu aktuellen Angeboten von OpenAI und Anthropic positioniert. Das am 30. September 2026 angekündigte Modell zeigt erhebliche Vorteile bei der Wissensarbeit und der Verarbeitung langer Kontexte, obwohl seine Leistung in Coding-Benchmarks uneinheitlich ist. Der Zugang zum System ist derzeit auf eine ausgewählte Gruppe von Testern und Regierungspartnern beschränkt, während Google eine gestaffelte Rollout-Strategie verfolgt.

Was passiert ist

Die Veröffentlichung markiert einen Wandel in Googles jüngster KI-Zeitachse und ersetzt effektiv den zuvor angekündigten Plan für Gemini 3.5 Pro durch diese fortgeschrittenere Iteration. Während das Unternehmen ursprünglich plante, im Juni 2026 ein neues Pro-Modell einzuführen, setzte es stattdessen eine Reihe von Flash-Modellen ein, bevor es zu Argon kam. Die Ankündigung folgt auf ein Treffen zwischen Google-CEO Sundar Pichai und Präsident Donald Trump, bei dem Pichai zusammen mit Führungskräften von Anthropic, Meta, Nvidia, OpenAI und SpaceX eine freiwillige Verpflichtung zur Selbstregulierung der KI-Entwicklung unterzeichnete. Diese Vereinbarung verfügt über keine formellen Durchsetzungsmechanismen, signalisiert jedoch eine verstärkte branchenweite Koordination bei Sicherheitsstandards.

Gemini 4 Argon erzielt Spitzen- oder Gleichstandswerte in 13 von 18 Benchmarks im Vergleich zu GPT-6 Astra von OpenAI sowie Claude Opus 5.5 und Fable 5.1 von Anthropic. Das Modell zeigt besondere Stärke bei Aufgaben, die komplexe Informationssynthese und Automatisierung beinhalten. So erzielt es beispielsweise 51,3 % auf Zapiers AutomationBench, fast neun Punkte höher als Claude Opus 5.5. Im juristischen Kontext erreicht Argon 19,6 % auf Harveys Legal Agent Benchmark, was fast dreimal so hoch ist wie der Wert von Claude Fable 5.1, obwohl dies immer noch darauf hindeutet, dass nur etwa jede fünfte Aufgabe vollständig abgeschlossen wird.

Trotz dieser Erfolge bleibt das Modell in bestimmten technischen Bereichen hinter der Konkurrenz zurück. Auf dem FrontierSWE v2 Coding-Benchmark erzielt Argon 55,0 %, liegt damit 10,5 Punkte hinter GPT-6 Astra und neun Punkte hinter Claude Opus 5.5. Es belegt auch den letzten Platz auf Terminal-Bench 4.0 unter den verglichenen Modellen. Diese gemischten Ergebnisse deuten darauf hin, dass Argon zwar für allgemeines Wissen und agentische Workflows optimiert ist, aber möglicherweise noch nicht die definitive Wahl für alle Software-Engineering-Aufgaben darstellt. Google plant, Feedback von frühen Testern in seinem Fairwind-Programm einzuholen, bevor der Zugang auf zahlende API-Kunden und AI-Ultra-Abonnenten ausgeweitet wird.

Wie es funktioniert

Ein unterscheidendes Merkmal von Gemini 4 Argon ist seine erweiterte Ausgabekapazität. Während eine Million Eingabe-Tokens zum Standard für Frontier-Modelle geworden sind, kann Argon bis zu eine Million Ausgabe-Tokens in einer einzigen Antwort generieren. Frühere Gemini-Modelle waren auf 64.000 Ausgabe-Tokens begrenzt. Diese Steigerung ermöglicht es dem Modell, tiefere Reasoning-Prozesse durchzuführen und Hunderttausende von Tokens zu generieren, um komplexe Probleme in einem einzigen Durchlauf zu lösen, ohne sie in kleinere Schritte aufzuteilen.

Das Modell integriert zudem spezialisiertes Training für Cybersicherheitsanwendungen. Google trainierte Argon darauf, Software-Schwachstellen autonom zu identifizieren, zu validieren und zu patchen. Für Teilnehmer des Fairwind-Programms und interne Teams wird das Modell ohne bestimmte Cyber-Guardrails freigegeben, um diese Arbeit zu erleichtern. Wiz, ein Sicherheitsunternehmen, das Google im März 2026 für 32 Milliarden US-Dollar übernommen hat, nutzt Argon bereits in seiner Initiative „Scan for Good“. In dieser Funktion hat das Modell Berichten zufolge eine kritische Schwachstelle in weltweit genutzter Gesundheitssoftware entdeckt, die frühere Frontier-Modelle nicht erkannt hatten.

Wichtige Details

  • Gemini 4 Argon erzielt 68,9 % auf dem Vals Index für Wissensarbeit und übertrifft damit GPT-6 Astra (63,1 %) und Claude Opus 5.5 (67,0 %).
  • Das Modell unterstützt bis zu eine Million Ausgabe-Tokens, eine erhebliche Steigerung gegenüber der Grenze von 64.000 Tokens in früheren Versionen.
  • Die Einführungspreise liegen bei 2 USD pro Million Eingabe-Tokens und 10 USD pro Million Ausgabe-Tokens, später steigen sie auf jeweils 4 USD und 20 USD.
  • Argon erreicht 84,2 % auf dem GraphWalks-Benchmark für Eingaben zwischen 256K und 1M Tokens und führt GPT-6 Astra um mehr als 12 Punkte an.
  • In Cybersicherheitstests erzielt Argon 85,8 % auf Googles internem Benchmark für die Entdeckung von Schwachstellen und 70,9 % auf Wizens Penetrationstest-Benchmark.
  • Der Zugang ist derzeit auf das Fairwind-Programm und US-Regierungspartner beschränkt, eine breitere Verfügbarkeit ist für spätere Termine geplant.

Warum es wichtig ist

Für Entwickler und technische Gründer deutet die gemischte Coding-Leistung von Gemini 4 Argon darauf hin, dass die Modellauswahl aufgabenspezifisch bleiben muss. Während der hohe Wert auf DeepSWE v1.1 (77,9 %) starke Fähigkeiten in bestimmten Software-Engineering-Workflows anzeigt, implizieren die niedrigeren Werte auf FrontierSWE v2 und Terminal-Bench 4.0, dass es spezialisierte Coding-Modelle nicht für alle Anwendungsfälle ersetzen kann. Teams, die agentische Workflows für Wissensarbeit, juristische Analyse oder Automatisierung entwickeln, werden wahrscheinlich sofortigen Nutzen finden, aber jene, die sich rein auf Codegenerierung konzentrieren, sollten weiterhin Alternativen wie GPT-6 Astra oder Claude Opus 5.5 evaluieren.

Die Erweiterung der Ausgabe-Tokens auf eine Million verändert, wie Ingenieure Prompts und Agent-Loops gestalten können. Anstatt mehrere API-Aufrufe zu verketten, um den Kontext aufrechtzuerhalten oder große Aufgaben aufzuteilen, können Entwickler sich potenziell auf einen einzelnen, langen Generierungsprozess verlassen. Dies könnte die Architektur für komplexe Reasoning-Aufgaben vereinfachen, aber die Latenz und die Kosten pro Anfrage erhöhen. Die Struktur der Einführungspreise bietet einen vorübergehenden Kostenvorteil, aber die geplante Preiserhöhung auf 20 USD pro Million Ausgabe-Tokens bringt es auf Augenhöhe mit Premium-Wettbewerbern, was eine sorgfältige Kostenmodellierung für Produktionsanwendungen erfordert.

Was Sie tun können

  • Bewerten Sie Ihre aktuellen Workflows, um Aufgaben zu identifizieren, die vom Long-Context-Reasoning profitieren, anstatt von schneller Codegenerierung.
  • Beantragen Sie Zugang zum Fairwind-Programm, wenn Ihr Unternehmen für frühe Testmöglichkeiten qualifiziert ist.
  • Vergleichen Sie Ihre bestehenden Agents mit den berichteten Werten auf AutomationBench und Vals Index, um mögliche Leistungssteigerungen abzuschätzen.
  • Überprüfen Sie Ihre Token-Nutzungsmuster, um sich auf den Wechsel zu höheren Ausgabegrenzen und die damit verbundenen Kosten vorzubereiten.
  • Beobachten Sie den Rollout-Zeitplan für zahlende API-Kunden und AI-Ultra-Abonnenten, um Integrationszeitpläne zu planen.
  • Berücksichtigen Sie die Sicherheitsimplikationen der Nutzung von Modellen ohne Cyber-Guardrails, wenn Sie an Programmen zur Schwachstellenforschung teilnehmen.

Tools aus dem Bytechap-Shop

$89

DocBento

Selbst gehostetes Dokumentenmanagement, das jeden Scan liest und mit Seitenzitaten antwortet.

Live-Demo

Weiterlesen

KI-News

Claude Sonnet 5.5 tauscht Token-Effizienz gegen agentische Leistung

Das neue Modell von Anthropic erreicht den zweiten Platz im Intelligence Index durch die Nutzung deutlich mehr Ausgabe-Tokens, was es bei Terminal-Aufgaben mit Spitzen-Agenten gleichzieht, während es bei Faktenwissen zurückbleibt.

Alle Artikel