jsonscraper

Mistral Large 4 er nå tilgjengelig via API – åpne vekter kommer senere

Den offentlige forhåndsvisningen startet 6. oktober. Her ser vi på hva som kan verifiseres nå, og hvilke spesifikasjoner som foreløpig spriker.

6. oktober åpnet Mistral en offentlig API-forhåndsvisning av Mistral Large 4. Utviklere kan allerede teste modellen gjennom Mistral Studio, og selskapet planlegger å publisere vektene mot slutten av oktober. Per 7. oktober kan modellen evalueres via API; vektene kan foreløpig ikke lastes ned. Denne statusen er viktig når man skal velge mellom rask testing i tjenesten og egen utrulling.

En høy bygning med mange vinduer ved siden av en gate
Shabeeba Ameen · Unsplash-lisens

Dette er tilgjengelig for utviklere nå

Oppføringen i Mistrals endringslogg bekrefter den offentlige forhåndsvisningen og en midlertidig lanseringsrabatt på 50 prosent i to uker. Modellsiden oppgir støtte for multimodal inndata, funksjonskall, strukturert utdata, batchbehandling og agentverktøy. Dermed kan utviklere prøve modellen på egne oppgaver via API før de bestemmer seg for utrulling.

Modellsiden oppgir ved kontrollen en pris på 0,68 dollar per million inndatatokener, 0,07 dollar per million bufrede inndatatokener og 2,09 dollar per million utdatatokener. Den oppgir også ordinære priser som er dobbelt så høye: rabatten er knyttet til lanseringen og gjelder i en begrenset periode. Før man beregner budsjettet, bør prisene kontrolleres direkte i Mistrals dokumentasjon.

Spesifikasjonene spriker

Mistral beskriver Large 4 som en multimodal Mixture of Experts-arkitektur. Dokumentasjonen oppgir 1,05 billioner parametere totalt og 52 milliarder aktive parametere; i selskapets kunngjøring oppgis derimot 1 billion og 49 milliarder aktive parametere. Kildene forklarer ikke hvorfor tallene er ulike. Derfor er det mer presist å oppgi begge versjonene med kildehenvisning enn å slå dem sammen til ett tall.

Dokumentasjonen oppgir et kontekstvindu på én million tokener. Når man planlegger lange forespørsler, er det nyttig å bekrefte denne spesifikasjonen for API-versjonen man bruker: parametere for forhåndsvisningen kan bli presisert etter hvert som dokumentasjonen oppdateres.

Alt arkitektonisk arbeid som ikke uttrykker ro, er en feil
Ashish Mehta · Unsplash-lisens

Referansetester måler bestemte oppgaver

Mistral oppgir resultater på 61,7 % på DeepSWE v1.1, 28,3 % på Terminal-Bench 4 og 59,9 % på AutomationBench. Dette er resultater selskapet selv har publisert for bestemte tester: henholdsvis utviklingsoppgaver med agentatferd, terminalarbeidsflyter og automatisering av forretningsprosesser. De kan brukes som utgangspunkt for å velge tester, men ikke som et samlet mål på modellens kvalitet.

For å ta en praktisk beslutning bør utviklere gjenta noen representative oppgaver fra prosjektet sitt: fastsette modellversjon, ledetekster og innstillinger, kontrollere resultatene med tester og ta høyde for kostnadene ved nye forsøk. En slik test viser hvor godt de publiserte resultatene kan overføres til den aktuelle koden, dokumentene eller agentprosessen.

Åpne vekter er neste steg

Mistral har opplyst at selskapet planlegger å publisere vektene mot slutten av oktober, etter ytterligere red-team-testing. Dette er selskapets plan for framtiden; per publiseringsdatoen er offentlig API-forhåndsvisning den bekreftede måten å bruke Large 4 på. For team som trenger egen infrastruktur og selvstendig kontroll over modellen, blir den faktiske publiseringen av vektene og de tilhørende bruksvilkårene den viktigste milepælen.

Foreløpig kan utviklere undersøke tilgjengelighet, funksjoner og kvalitet via API, og vente med å avgjøre om modellen skal flyttes til eget miljø til vektene er publisert. I startfasen er resultater fra reproduserbare tester på arbeidsoppgaver og oppdaterte prisvilkår mer nyttige enn sammenlignende påstander.

People

No people listed for this article yet.

Keep readingGitHub lanserer ReviewBench: KI-kodegranskere skal sammenlignes ut fra feilene de finner
Read the next article

Relaterte artikler

Launches · Nyheter

AWS CloudWatch Omni samler agentspor og applikasjonsdrift

AWS CloudWatch Omni er nå generelt tilgjengelig og samler observerbarhet for agenter og applikasjoner i én felles opplevelse. Her er endringene – og hva team bør undersøke før de ruter produksjonsspor dit.

Gjør det du leser til en fungerende integrasjon

Utforsk jsonscrapers API-er for sosiale data, test forespørsler og bygg neste arbeidsflyt.

Utforsk API-er