Google hat am 30. September Gemini 4 Argon vorgestellt. Das Modell soll komplexe Programmieraufgaben, mehrstufige Wissensarbeit und die Suche nach Sicherheitslücken bewältigen. Wer es jetzt in eine Anwendung einbauen möchte, muss allerdings warten: Google beginnt die Einführung bei ausgewählten Cyberabwehr-Teams im Fairwind-Programm. Ein breiter Zugang für Entwickler, Unternehmen und Privatnutzer ist angekündigt, aber noch nicht allgemein verfügbar.[1][2]
Das macht die Ankündigung aus zwei Gründen interessant. Google erhöht bei Argon die Obergrenze für die Ausgabe auf eine Million Token. Gleichzeitig behandelt das Unternehmen dessen Fähigkeiten zur Schwachstellensuche als besonders sensibel und führt das Modell deshalb schrittweise ein.[1]
Mehr Raum für lange Aufgaben – bei der Ausgabe
Die Million Token beschreibt das Ausgabelimit, nicht die Größe des Eingabekontexts. Google nennt als bisherigen Vergleichswert 64.000 Token. Das zusätzliche Ausgabebudget soll dem Modell ermöglichen, eine lange Folge von Denkschritten und erzeugten Inhalten innerhalb eines Arbeitsablaufs fortzusetzen. Daraus folgt nicht, dass Argon automatisch ein Eingabefenster von einer Million Token hat oder dass jede Anwendung eine Ausgabe dieser Länge benötigt.[1]
Für Entwickler ist die Unterscheidung wichtig. Ein Agent, der über mehrere Schritte Code untersucht, Änderungen vorschlägt und Zwischenergebnisse verarbeitet, braucht ausreichend Spielraum für seine Ausgaben. Ob ein solcher Ablauf zuverlässig funktioniert, hängt aber ebenso von Werkzeugzugriff, Tests, Kosten und der Kontrolle der einzelnen Schritte ab. Ein hohes Tokenlimit allein löst diese Aufgaben nicht.
Google beschreibt Argon als multimodales Modell für komplexe Arbeitsabläufe. Zur Architektur, zum Trainingsverfahren und zu einer allgemein nutzbaren API-Konfiguration liefert die Ankündigung noch keine vergleichbar detaillierten technischen Angaben. Die öffentlich beschriebenen Anwendungsfälle zeigen vor allem, wie Google das Modell einsetzt oder einsetzen lassen will: bei Softwareentwicklung, Dokumentenarbeit und Cyberabwehr.[1]
Schwachstellen finden und beheben
Für Sicherheitsteams soll Argon Quellcode auf Schwachstellen untersuchen, Funde überprüfen und Korrekturen erzeugen. Google beschreibt außerdem Black-Box-Tests von Webanwendungen, bei denen das Modell nur die laufende Website und deren öffentlich sichtbares Verhalten sieht, nicht aber den Quellcode. Im Fairwind-Programm können ausgewählte Partner Argon auch zusammen mit CodeMender einsetzen, einem Agenten für die Untersuchung und Behebung von Code-Schwachstellen.[2][3]
Das zugrunde liegende Problem ist technisch wie organisatorisch anspruchsvoll: Eine verdächtige Stelle im Code ist noch keine bestätigte Sicherheitslücke, und ein erzeugter Patch ist noch keine sichere Lösung. Teams müssen nachvollziehen, ob ein Fund tatsächlich ausnutzbar ist, ob die Änderung das Problem behebt und ob dabei keine neue Fehlfunktion entsteht. Gerade bei kritischer Infrastruktur bleiben Tests und menschliche Freigaben unverzichtbar.
Google meldet für Argon 77,9 Prozent auf DeepSWE v1.1, einem Benchmark für längere Softwareentwicklungsaufgaben. Bei CWE-bench v1 zur Behebung von Schwachstellen nennt das Unternehmen 68 Prozent und einen geteilten ersten Platz. Diese Zahlen stammen aus Googles Ankündigung; sie beschreiben Ergebnisse auf bestimmten Tests, nicht die Erfolgsquote beim Einsatz in beliebigen Codebasen. Für interne Vergleiche mit anderen Modellen müssten Teams dieselben Aufgaben, Werkzeuge und Prüfregeln verwenden.[1]
Warum der Zugang begrenzt bleibt
Das Fairwind-Programm richtet sich nach Googles Angaben insbesondere an staatliche Stellen, Betreiber kritischer Infrastruktur und zentrale Technologieplattformen. Teilnehmer werden geprüft und dürfen die Fähigkeiten nur für erlaubte defensive oder wissenschaftliche Aufgaben nutzen. Dazu gehören etwa autorisierte Angriffssimulationen und die Analyse von Schadsoftware zur Abwehr. Der Zugang darf nicht weiterverkauft oder geteilt werden; Google nennt außerdem Vorgaben für Authentifizierung, Zugriffskontrolle und die Nachverfolgung der Nutzung.[3]
Diese Trennung hat einen fachlichen Grund: Ein Modell, das Schwachstellen selbstständig entdeckt und Angriffspfade überprüft, kann Verteidigern helfen, birgt bei Missbrauch aber Risiken. Google kündigt für die breitere Einführung zusätzliche Schutzmaßnahmen gegen unerlaubte Anfragen, indirekte Prompt Injections und unerwünschte Agentenaktionen an. Deren Wirksamkeit lässt sich aus der Ankündigung noch nicht unabhängig für den späteren Regelbetrieb ableiten.[1]
Unternehmen außerhalb des Fairwind-Programms sollten Argon deshalb noch nicht als verfügbare Komponente einplanen. Google nennt zahlende API-Kunden und Abonnenten von Google AI Ultra als erste Gruppen für eine spätere breitere Freigabe, legt in der Ankündigung aber keinen verbindlichen Termin fest. Wer eine Sicherheitsanwendung bewertet, kann unterdessen bereits geeignete Testfälle vorbereiten: reale eigene Repositories, reproduzierbare Schwachstellen, Patch-Tests und klare Regeln dafür, welche Systeme ein Agent überhaupt untersuchen darf.[1][3]
Fazit
Gemini 4 Argon verbindet ein ungewöhnlich großes Ausgabebudget mit dem Anspruch, langwierige Entwicklungs- und Sicherheitsaufgaben zu bearbeiten. Die wichtigste praktische Grenze ist derzeit nicht die Tokenzahl, sondern die Verfügbarkeit: Zunächst dürfen ausgewählte Verteidiger das Modell erproben. Ob die angekündigten Leistungen bei breiter Nutzung tragen, werden erst nachvollziehbare Praxistests und die konkreten Bedingungen des späteren API-Zugangs zeigen.[1][2]
Quellen
[1] Google, „Gemini 4 Argon: our next era of frontier intelligence“, 30. September 2026: https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
[2] Google DeepMind, „Gemini 4 Argon with cybersecurity defense capabilities“: https://deepmind.google/models/gemini/cyber/
[3] Google DeepMind, „Fairwind Program“: https://deepmind.google/fairwind-program/