Mistral hat am 6. Oktober Mistral Large 4 vorgestellt. Entwickler können das Modell zunächst über eine öffentliche API-Vorschau in Mistral Studio ausprobieren. Die Gewichte will das Unternehmen erst Ende Oktober veröffentlichen. Das ist für Organisationen, die KI auf eigener Infrastruktur betreiben möchten, der entscheidende Unterschied: Sie können die Leistung jetzt testen, aber das Modell noch nicht selbst bereitstellen. Mistrals Ankündigung und die Hugging-Face-Vorschauseite beschreiben die Veröffentlichung der Gewichte ausdrücklich als bevorstehenden Schritt.
Ein großes Modell, das nicht immer vollständig rechnet
Large 4 verarbeitet Text und Bilder und erzeugt Text. Laut Mistral umfasst es rund eine Billion Parameter. Davon werden pro verarbeitetem Token etwa 49 Milliarden im eigentlichen Modell aktiviert; zählt man Einbettungen und Ausgabeschichten hinzu, sind es 52 Milliarden. Die Modelldokumentation nennt 1,05 Billionen Parameter insgesamt und einen Bildencoder mit 1,6 Milliarden Parametern. Die unterschiedlichen Angaben zu den aktiven Parametern beschreiben damit nicht zwei Modellvarianten, sondern unterschiedliche Zählweisen.
Dahinter steht eine Mixture-of-Experts-Architektur: Das Modell hält viele spezialisierte Rechenpfade bereit und nutzt für ein Token nur einen Teil davon. So kann es mehr Parameter vorhalten, als es bei jedem einzelnen Token durchrechnen muss. Daraus folgt allerdings nicht, dass sich ein Modell dieser Größe wie ein dichtes Modell mit 49 Milliarden Parametern betreiben lässt. Für einen eigenen Betrieb müssen die Gewichte der benötigten Experten gespeichert und bei der Inferenz verfügbar sein. Welche Hardware dafür praktisch nötig ist, lässt sich erst nach Veröffentlichung der Artefakte und belastbaren Tests mit konkreten Laufzeitumgebungen beurteilen.
Mistral stellt besonders Coding, agentische Abläufe und die Analyse visueller Informationen heraus. Die Modellseite führt unter anderem Function Calling, strukturierte Ausgaben und Dokumentenfragen für die API auf. Für Teams, die beispielsweise technische Zeichnungen oder umfangreiche Dokumente mit Werkzeugaufrufen verbinden, ist das interessanter als ein isolierter Chat-Benchmark. Ob die Qualität in einem bestimmten Workflow reicht, muss trotzdem an eigenen Aufgaben geprüft werden.
Die ersten Messungen zeigen Stärke und einen Preis
Artificial Analysis hat die Vorschau unabhängig vermessen und weist 38 Punkte im eigenen Intelligence Index sowie 50 Punkte im Cyber Index aus. Das sind Ergebnisse dieses Testverfahrens, keine allgemeingültigen Erfolgsquoten für Unternehmensaufgaben. Bei einem Test, in dem ein Modell eine reale Schwachstelle nachvollziehen und anschließend beheben soll, erreichte Large 4 laut dem Evaluator 82 Prozent. Gerade solche Aufgaben hängen auch davon ab, ob Modelle sicherheitsrelevante Anfragen ablehnen; ein hoher Wert lässt sich deshalb nicht allein als Beleg für bessere Codequalität lesen.
Die Kosten gehören zur gleichen Einordnung. Mistrals Modellseite nennt regulär 1,36 US-Dollar pro Million Eingabetoken und 4,18 US-Dollar pro Million Ausgabetoken; für die Einführung zeigt sie halbierte Preise an. Artificial Analysis errechnet mit den regulären Preisen 1,13 US-Dollar pro Aufgabe in seinem Intelligence Index. Zwei von der Testorganisation genannte Modelle mit ähnlicher Indexleistung kosten dort 0,25 beziehungsweise 0,27 US-Dollar pro Aufgabe. Wer viele Agentenläufe plant, sollte deshalb nicht nur die Qualität einzelner Antworten, sondern auch Tokenverbrauch, Laufzeit und Kosten pro erfolgreich abgeschlossener Aufgabe messen.
Bei der Kontextlänge gibt es eine weitere praktische Unterscheidung: Mistrals Dokumentation weist eine Million Token aus, während Artificial Analysis in seiner Modellbewertung 512.000 Token nennt. Wer sehr lange Dokumente oder Repository-Verläufe verarbeitet, sollte das tatsächlich nutzbare Limit des eigenen Zugangs prüfen, statt allein vom Wert auf der Modellseite auszugehen.
Was für den Eigenbetrieb noch offen ist
Mistral kündigt die Gewichte für Ende Oktober an und will dann weitere Angaben zur Architektur und zum Nachtraining liefern. Die Hugging-Face-Seite ist derzeit ausdrücklich als bevorstehende Veröffentlichung gekennzeichnet. Auch Lizenzbedingungen für die künftigen Gewichte und die Anforderungen konkreter Inferenz-Setups sollten Unternehmen erst anhand der dann verfügbaren Artefakte beurteilen. „Open Weight“ in einer Modellübersicht bedeutet am 7. Oktober noch nicht, dass sich Large 4 heute herunterladen lässt.
Für Entwickler ist die Vorschau dennoch nützlich: Sie können prüfen, ob das Modell in ihren Bild-, Dokumenten- und Agentenabläufen einen messbaren Vorteil bringt. Für Unternehmen, denen der eigene Betrieb und die Kontrolle über die Bereitstellung wichtig sind, fällt die eigentliche Infrastrukturentscheidung später. Bis dahin ist Mistral Large 4 ein neues API-Angebot mit ersten unabhängigen Messwerten – noch keine fertig evaluierbare Lösung für die eigene Hardware.