jsonscraper

Mistral Large 4 är nu tillgänglig via API – öppna vikter utlovas senare

Den offentliga förhandsversionen lanserades den 6 oktober. Vi går igenom vad som går att kontrollera nu och vilka specifikationer som fortfarande skiljer sig åt.

Den 6 oktober öppnade Mistral en offentlig API-förhandsversion av Mistral Large 4. Utvecklare kan redan testa modellen via Mistral Studio, och företaget planerar att släppa vikterna i slutet av oktober. Den 7 oktober kan modellen utvärderas via API; det går ännu inte att ladda ner vikterna. Den här statusen är viktig när man ska välja mellan snabb testning i tjänsten och egen driftsättning.

En hög byggnad med många fönster intill en gata
Shabeeba Ameen · Unsplash-licens

Det här är tillgängligt för utvecklare nu

Mistrals changelog-post bekräftar den offentliga förhandsversionen och en tillfällig lanseringsrabatt på 50 procent under två veckor. Modellkortet listar stöd för multimodal inmatning, funktionsanrop, strukturerade utdata, batchbearbetning och verktyg för agenter. Det ger utvecklare möjlighet att testa modellen på egna uppgifter via API innan de fattar beslut om driftsättning.

Vid kontrollen angav modellkortet ett pris på 0,68 dollar per miljon indatatoken, 0,07 dollar per miljon cachade indatatoken och 2,09 dollar per miljon utdatatoken. De ordinarie priserna som anges intill är dubbelt så höga: rabatten gäller lanseringen och är tidsbegränsad. Kontrollera priserna direkt i Mistrals dokumentation innan du gör en budgetberäkning.

Specifikationerna innehåller en avvikelse

Mistral beskriver Large 4 som en multimodal Mixture of Experts-arkitektur. Dokumentationen anger totalt 1,05 biljoner parametrar, varav 52 miljarder aktiva; i företagets tillkännagivande anges 1 biljon, varav 49 miljarder aktiva. Källorna förklarar inte varför värdena skiljer sig åt. Därför är det mer korrekt att återge båda versionerna med tydlig källhänvisning än att slå ihop dem till en enda siffra.

Dokumentationen anger ett kontextfönster på en miljon token. Den som planerar långa frågor bör bekräfta specifikationen för den API-version som används: parametrarna för förhandsversionen kan komma att preciseras i takt med att dokumentationen uppdateras.

Allt arkitektoniskt arbete som inte uttrycker lugn är ett misstag
Ashish Mehta · Unsplash-licens

Riktmärkena gäller specifika uppgifter

Mistral rapporterar resultat på 61,7 % på DeepSWE v1.1, 28,3 % på Terminal-Bench 4 och 59,9 % på AutomationBench. Det här är resultat som företaget självt publicerat för specifika tester: uppgifter inom mjukvaruutveckling med agentbeteende, terminalbaserade arbetsflöden respektive automatisering av affärsprocesser. De är användbara som riktmärken när man väljer vad som ska testas, men inte som ett enda mått på modellens kvalitet.

För att fatta ett praktiskt beslut bör utvecklare köra flera representativa uppgifter från sitt projekt igen: låsa modellversion, promptar och inställningar, kontrollera resultaten med tester och räkna med kostnaden för upprepade försök. Ett sådant test visar i vilken utsträckning de publicerade resultaten går att överföra till en viss kodbas, dokument eller agentprocess.

Öppna vikter är nästa steg

Mistral har sagt att företaget planerar att släppa vikterna i slutet av oktober, efter ytterligare red team-testning. Det är företagets framtidsplan; vid publiceringstillfället är den bekräftade användningsmetoden för Large 4 en offentlig API-förhandsversion. För team som behöver egen infrastruktur och självständig kontroll över modellen blir den faktiska publiceringen av vikterna och tillhörande användningsvillkor avgörande.

Utvecklare kan tills vidare testa tillgänglighet, funktioner och kvalitet via API och vänta med beslutet om att flytta modellen till en egen miljö tills vikterna har släppts. I det här tidiga skedet är resultat från reproducerbara tester på arbetsuppgifter och aktuella prisvillkor mer användbara än jämförande påståenden.

Keep readingGitHub lanserar ReviewBench: AI-granskare ska jämföras utifrån upptäckta buggar
Read the next article

Relaterade artiklar

Breaking News · Nyheter

GitHub lanserar ReviewBench: AI-granskare ska jämföras utifrån upptäckta buggar

Den 5 oktober presenterade GitHub ReviewBench, en forskningsförhandsversion av en benchmark för kodgranskande agenter. Måtten skiljer mellan upptäckta problem, missar och onödigt brus, medan företagets resultat från ett internt A/B-test beskriver ett enskilt experiment – inte någon allmän ranking av modeller.

Launches · Nyheter

AWS CloudWatch Omni för in agentspår i applikationsdriften

AWS CloudWatch Omni är nu allmänt tillgängligt och samlar observerbarhet för agenter och applikationer i en gemensam upplevelse. Här är nyheterna – och vad team bör kontrollera innan de dirigerar produktionsspår dit.

Gör det du läser till en fungerande integration

Utforska jsonscrapers API:er för social data, testa anrop och bygg nästa arbetsflöde.

Utforska API:er