Op 6 oktober opende Mistral de openbare API-preview van Mistral Large 4. Ontwikkelaars kunnen het model al testen via Mistral Studio; het bedrijf heeft de release van de gewichten gepland voor eind oktober. Op 7 oktober kan het model via de API worden beoordeeld; de gewichten zijn nog niet te downloaden. Deze status is belangrijk bij de keuze tussen snel testen via de dienst en zelfstandig implementeren.
Wat ontwikkelaars nu kunnen gebruiken
De vermelding in de changelog van Mistral bevestigt de openbare preview en een tijdelijke lanceringskorting van 50% voor een periode van twee weken. De modelpagina vermeldt ondersteuning voor multimodale invoer, functieaanroepen, gestructureerde uitvoer, batchverwerking en tools voor agents. Daardoor kunnen ontwikkelaars het model met hun eigen taken via de API testen voordat ze besluiten tot implementatie.
De modelpagina vermeldt op het moment van controle $0,68 per miljoen invoertokens, $0,07 per miljoen gecachte invoertokens en $2,09 per miljoen uitvoertokens. Daarnaast staan de reguliere tarieven vermeld, die twee keer zo hoog zijn: de korting is gekoppeld aan de lancering en geldt tijdelijk. Controleer de tarieven rechtstreeks in de documentatie van Mistral voordat je een budget berekent.
De specificaties lopen uiteen
Mistral beschrijft Large 4 als een multimodale Mixture of Experts-architectuur. In de documentatie staan in totaal 1,05 biljoen parameters en 52 miljard actieve parameters; in de aankondiging van het bedrijf gaat het om 1 biljoen en 49 miljard actieve parameters. De bronnen leggen niet uit waarom de waarden verschillen. Daarom is het nauwkeuriger om beide versies met bronvermelding weer te geven dan ze samen te voegen tot één getal.
De documentatie vermeldt een contextvenster van één miljoen tokens. Het is verstandig deze specificatie te controleren met de API-versie die je gebruikt wanneer je lange prompts plant: de parameters van een preview kunnen worden aangepast naarmate de documentatie wordt bijgewerkt.
Benchmarks beschrijven afzonderlijke taken
Mistral meldt resultaten van 61,7% op DeepSWE v1.1, 28,3% op Terminal-Bench 4 en 59,9% op AutomationBench. Dit zijn resultaten die het bedrijf zelf voor specifieke tests heeft gepubliceerd: respectievelijk ontwikkeltaken met agentgedrag, terminalworkflows en automatisering van bedrijfsprocessen. Ze zijn nuttig als richtsnoer voor het kiezen van tests, maar niet als één algemene maatstaf voor de kwaliteit van het model.
Voor een praktische beslissing kunnen ontwikkelaars het beste enkele representatieve taken uit hun eigen project opnieuw uitvoeren: leg de modelversie, prompts en instellingen vast, controleer de resultaten met tests en houd rekening met de kosten van herhaalde pogingen. Zo laat de test zien in hoeverre de gepubliceerde resultaten overdraagbaar zijn naar specifieke code, documenten of agentprocessen.
Open gewichten zijn de volgende stap
Mistral heeft aangegeven de gewichten tegen eind oktober te willen uitbrengen, na aanvullende red-teamtests. Dit is een toekomstplan van het bedrijf; op de publicatiedatum is de openbare API-preview de bevestigde manier om Large 4 te gebruiken. Voor teams die een eigen infrastructuur en zelfstandig beheer van het model nodig hebben, is de daadwerkelijke publicatie van de gewichten en de bijbehorende gebruiksvoorwaarden de belangrijkste volgende stap.
Ontwikkelaars kunnen de beschikbaarheid, functies en kwaliteit voorlopig via de API testen en een beslissing over het overbrengen van het model naar hun eigen omgeving uitstellen tot de gewichten beschikbaar zijn. Bij de start zijn reproduceerbare testresultaten voor praktijktaken en actuele tariefvoorwaarden nuttiger dan vergelijkende beweringen.