Den 6 oktober öppnade Mistral en offentlig API-förhandsversion av Mistral Large 4. Utvecklare kan redan testa modellen via Mistral Studio, och företaget planerar att släppa vikterna i slutet av oktober. Den 7 oktober kan modellen utvärderas via API; det går ännu inte att ladda ner vikterna. Den här statusen är viktig när man ska välja mellan snabb testning i tjänsten och egen driftsättning.
Det här är tillgängligt för utvecklare nu
Mistrals changelog-post bekräftar den offentliga förhandsversionen och en tillfällig lanseringsrabatt på 50 procent under två veckor. Modellkortet listar stöd för multimodal inmatning, funktionsanrop, strukturerade utdata, batchbearbetning och verktyg för agenter. Det ger utvecklare möjlighet att testa modellen på egna uppgifter via API innan de fattar beslut om driftsättning.
Vid kontrollen angav modellkortet ett pris på 0,68 dollar per miljon indatatoken, 0,07 dollar per miljon cachade indatatoken och 2,09 dollar per miljon utdatatoken. De ordinarie priserna som anges intill är dubbelt så höga: rabatten gäller lanseringen och är tidsbegränsad. Kontrollera priserna direkt i Mistrals dokumentation innan du gör en budgetberäkning.
Specifikationerna innehåller en avvikelse
Mistral beskriver Large 4 som en multimodal Mixture of Experts-arkitektur. Dokumentationen anger totalt 1,05 biljoner parametrar, varav 52 miljarder aktiva; i företagets tillkännagivande anges 1 biljon, varav 49 miljarder aktiva. Källorna förklarar inte varför värdena skiljer sig åt. Därför är det mer korrekt att återge båda versionerna med tydlig källhänvisning än att slå ihop dem till en enda siffra.
Dokumentationen anger ett kontextfönster på en miljon token. Den som planerar långa frågor bör bekräfta specifikationen för den API-version som används: parametrarna för förhandsversionen kan komma att preciseras i takt med att dokumentationen uppdateras.
Riktmärkena gäller specifika uppgifter
Mistral rapporterar resultat på 61,7 % på DeepSWE v1.1, 28,3 % på Terminal-Bench 4 och 59,9 % på AutomationBench. Det här är resultat som företaget självt publicerat för specifika tester: uppgifter inom mjukvaruutveckling med agentbeteende, terminalbaserade arbetsflöden respektive automatisering av affärsprocesser. De är användbara som riktmärken när man väljer vad som ska testas, men inte som ett enda mått på modellens kvalitet.
För att fatta ett praktiskt beslut bör utvecklare köra flera representativa uppgifter från sitt projekt igen: låsa modellversion, promptar och inställningar, kontrollera resultaten med tester och räkna med kostnaden för upprepade försök. Ett sådant test visar i vilken utsträckning de publicerade resultaten går att överföra till en viss kodbas, dokument eller agentprocess.
Öppna vikter är nästa steg
Mistral har sagt att företaget planerar att släppa vikterna i slutet av oktober, efter ytterligare red team-testning. Det är företagets framtidsplan; vid publiceringstillfället är den bekräftade användningsmetoden för Large 4 en offentlig API-förhandsversion. För team som behöver egen infrastruktur och självständig kontroll över modellen blir den faktiska publiceringen av vikterna och tillhörande användningsvillkor avgörande.
Utvecklare kan tills vidare testa tillgänglighet, funktioner och kvalitet via API och vänta med beslutet om att flytta modellen till en egen miljö tills vikterna har släppts. I det här tidiga skedet är resultat från reproducerbara tester på arbetsuppgifter och aktuella prisvillkor mer användbara än jämförande påståenden.