jsonscraper

Mistral Large 4 ist jetzt per API verfügbar – offene Gewichte sollen später folgen

Die öffentliche Vorschau startete am 6. Oktober. Wir schauen darauf, was sich bereits überprüfen lässt und welche technischen Angaben noch voneinander abweichen.

Am 6. Oktober hat Mistral die öffentliche API-Vorschau von Mistral Large 4 freigegeben. Entwickler können das Modell bereits über Mistral Studio testen; die Veröffentlichung der Gewichte plant das Unternehmen für Ende Oktober. Am 7. Oktober lässt sich das Modell über die API bewerten; herunterladen lassen sich seine Gewichte noch nicht. Dieser Status ist wichtig für die Entscheidung zwischen schnellem Testen im Dienst und eigenständigem Betrieb.

Ein hohes Gebäude mit vielen Fenstern neben einer Straße
Shabeeba Ameen · Unsplash-Lizenz

Was Entwicklern jetzt zur Verfügung steht

Der Eintrag im Mistral-Changelog bestätigt die öffentliche Vorschau und einen befristeten Einführungsrabatt von 50 Prozent für zwei Wochen. Das Modellprofil führt Unterstützung für multimodalen Input, Funktionsaufrufe, strukturierte Ausgaben, Stapelverarbeitung und Agentenwerkzeuge auf. So können Entwickler das Modell anhand eigener Aufgaben über die API prüfen, bevor sie über eine Bereitstellung entscheiden.

Zum Zeitpunkt der Prüfung weist das Modellprofil 0,68 US-Dollar pro Million Eingabetoken, 0,07 US-Dollar pro Million zwischengespeicherter Eingabetoken und 2,09 US-Dollar pro Million Ausgabetoken aus. Daneben stehen die regulären Tarife, die doppelt so hoch sind: Der Rabatt gilt im Zusammenhang mit der Einführung und ist zeitlich begrenzt. Vor der Budgetplanung sollten die Preise direkt in der Mistral-Dokumentation überprüft werden.

Bei den Spezifikationen gibt es eine Abweichung

Mistral beschreibt Large 4 als multimodale Mixture-of-Experts-Architektur. In der Dokumentation ist von insgesamt 1,05 Billionen Parametern und 52 Milliarden aktiven Parametern die Rede; in der Unternehmensankündigung dagegen von 1 Billion und 49 Milliarden aktiven Parametern. Die Quellen erklären nicht, warum die Werte voneinander abweichen. Daher ist es genauer, beide Angaben mit ihrer jeweiligen Quelle wiederzugeben, statt sie zu einer Zahl zusammenzuführen.

Die Dokumentation nennt ein Kontextfenster von einer Million Token. Wer lange Anfragen plant, sollte diese Spezifikation für die verwendete API-Version überprüfen: Die Parameter der Vorschau können im Zuge von Dokumentationsaktualisierungen noch präzisiert werden.

Jedes architektonische Werk, das keine Ruhe ausstrahlt, ist ein Fehler
Ashish Mehta · Unsplash-Lizenz

Benchmarks bilden einzelne Aufgaben ab

Mistral nennt Ergebnisse von 61,7 % bei DeepSWE v1.1, 28,3 % bei Terminal-Bench 4 und 59,9 % bei AutomationBench. Es handelt sich um vom Unternehmen veröffentlichte Ergebnisse für bestimmte Tests: Aufgaben zur Softwareentwicklung mit agentischem Verhalten, Arbeitsabläufe im Terminal und die Automatisierung von Geschäftsprozessen. Sie eignen sich als Orientierung für die Auswahl eigener Prüfungen, nicht als einheitliches Maß für die Modellqualität.

Für eine praktische Entscheidung sollten Entwickler mehrere repräsentative Aufgaben aus ihrem Projekt wiederholen: Modellversion, Prompts und Einstellungen festhalten, Ergebnisse mit Tests überprüfen und die Kosten wiederholter Versuche berücksichtigen. So lässt sich feststellen, inwieweit sich die veröffentlichten Ergebnisse auf den konkreten Code, die Dokumente oder den Agentenprozess übertragen lassen.

Offene Gewichte sind der nächste Schritt

Mistral hat angekündigt, die Gewichte nach zusätzlichen Red-Team-Tests bis Ende Oktober veröffentlichen zu wollen. Das ist ein Zukunftsplan des Unternehmens; zum Veröffentlichungszeitpunkt ist die öffentliche API-Vorschau die bestätigte Nutzungsmöglichkeit für Large 4. Für Teams, die eine eigene Infrastruktur und selbstständige Kontrolle über das Modell benötigen, wird die tatsächliche Veröffentlichung der Gewichte samt Nutzungsbedingungen entscheidend sein.

Bis dahin können Entwickler Verfügbarkeit, Funktionen und Qualität über die API prüfen und die Entscheidung über eine Übertragung des Modells in die eigene Umgebung bis zur Veröffentlichung der Gewichte aufschieben. Zum Start sind die Ergebnisse reproduzierbarer Tests mit Arbeitsaufgaben und die aktuellen Preisbedingungen hilfreicher als vergleichende Aussagen.

Keep readingGitHub stellt ReviewBench vor: KI-Reviewer werden anhand gefundener Fehler verglichen
Read the next article

Ähnliche Beiträge

Breaking News · Neuigkeiten

GitHub stellt ReviewBench vor: KI-Reviewer werden anhand gefundener Fehler verglichen

Am 5. Oktober stellte GitHub ReviewBench vor – eine Forschungsvorschau auf einen Benchmark für Code-Review-Agenten. Seine Metriken unterscheiden gefundene Probleme, übersehene Fehler und unnötiges Rauschen. Die Ergebnisse eines internen A/B-Tests des Unternehmens beschreiben ein einzelnes Experiment und keine allgemeine Rangliste von Modellen.

Vom Artikel zur funktionierenden Integration

Entdecke die Social-Data-APIs von jsonscraper, teste Anfragen und entwickle deinen nächsten Workflow.

APIs entdecken