Am 6. Oktober hat Mistral die öffentliche API-Vorschau von Mistral Large 4 freigegeben. Entwickler können das Modell bereits über Mistral Studio testen; die Veröffentlichung der Gewichte plant das Unternehmen für Ende Oktober. Am 7. Oktober lässt sich das Modell über die API bewerten; herunterladen lassen sich seine Gewichte noch nicht. Dieser Status ist wichtig für die Entscheidung zwischen schnellem Testen im Dienst und eigenständigem Betrieb.
Was Entwicklern jetzt zur Verfügung steht
Der Eintrag im Mistral-Changelog bestätigt die öffentliche Vorschau und einen befristeten Einführungsrabatt von 50 Prozent für zwei Wochen. Das Modellprofil führt Unterstützung für multimodalen Input, Funktionsaufrufe, strukturierte Ausgaben, Stapelverarbeitung und Agentenwerkzeuge auf. So können Entwickler das Modell anhand eigener Aufgaben über die API prüfen, bevor sie über eine Bereitstellung entscheiden.
Zum Zeitpunkt der Prüfung weist das Modellprofil 0,68 US-Dollar pro Million Eingabetoken, 0,07 US-Dollar pro Million zwischengespeicherter Eingabetoken und 2,09 US-Dollar pro Million Ausgabetoken aus. Daneben stehen die regulären Tarife, die doppelt so hoch sind: Der Rabatt gilt im Zusammenhang mit der Einführung und ist zeitlich begrenzt. Vor der Budgetplanung sollten die Preise direkt in der Mistral-Dokumentation überprüft werden.
Bei den Spezifikationen gibt es eine Abweichung
Mistral beschreibt Large 4 als multimodale Mixture-of-Experts-Architektur. In der Dokumentation ist von insgesamt 1,05 Billionen Parametern und 52 Milliarden aktiven Parametern die Rede; in der Unternehmensankündigung dagegen von 1 Billion und 49 Milliarden aktiven Parametern. Die Quellen erklären nicht, warum die Werte voneinander abweichen. Daher ist es genauer, beide Angaben mit ihrer jeweiligen Quelle wiederzugeben, statt sie zu einer Zahl zusammenzuführen.
Die Dokumentation nennt ein Kontextfenster von einer Million Token. Wer lange Anfragen plant, sollte diese Spezifikation für die verwendete API-Version überprüfen: Die Parameter der Vorschau können im Zuge von Dokumentationsaktualisierungen noch präzisiert werden.
Benchmarks bilden einzelne Aufgaben ab
Mistral nennt Ergebnisse von 61,7 % bei DeepSWE v1.1, 28,3 % bei Terminal-Bench 4 und 59,9 % bei AutomationBench. Es handelt sich um vom Unternehmen veröffentlichte Ergebnisse für bestimmte Tests: Aufgaben zur Softwareentwicklung mit agentischem Verhalten, Arbeitsabläufe im Terminal und die Automatisierung von Geschäftsprozessen. Sie eignen sich als Orientierung für die Auswahl eigener Prüfungen, nicht als einheitliches Maß für die Modellqualität.
Für eine praktische Entscheidung sollten Entwickler mehrere repräsentative Aufgaben aus ihrem Projekt wiederholen: Modellversion, Prompts und Einstellungen festhalten, Ergebnisse mit Tests überprüfen und die Kosten wiederholter Versuche berücksichtigen. So lässt sich feststellen, inwieweit sich die veröffentlichten Ergebnisse auf den konkreten Code, die Dokumente oder den Agentenprozess übertragen lassen.
Offene Gewichte sind der nächste Schritt
Mistral hat angekündigt, die Gewichte nach zusätzlichen Red-Team-Tests bis Ende Oktober veröffentlichen zu wollen. Das ist ein Zukunftsplan des Unternehmens; zum Veröffentlichungszeitpunkt ist die öffentliche API-Vorschau die bestätigte Nutzungsmöglichkeit für Large 4. Für Teams, die eine eigene Infrastruktur und selbstständige Kontrolle über das Modell benötigen, wird die tatsächliche Veröffentlichung der Gewichte samt Nutzungsbedingungen entscheidend sein.
Bis dahin können Entwickler Verfügbarkeit, Funktionen und Qualität über die API prüfen und die Entscheidung über eine Übertragung des Modells in die eigene Umgebung bis zur Veröffentlichung der Gewichte aufschieben. Zum Start sind die Ergebnisse reproduzierbarer Tests mit Arbeitsaufgaben und die aktuellen Preisbedingungen hilfreicher als vergleichende Aussagen.