jsonscraper

Mistral Large 4 è già disponibile via API: i pesi aperti arriveranno più avanti

L’anteprima pubblica è iniziata il 6 ottobre. Ecco cosa si può verificare ora e quali specifiche non coincidono ancora.

Il 6 ottobre Mistral ha aperto l’anteprima pubblica dell’API di Mistral Large 4. Gli sviluppatori possono già testare il modello tramite Mistral Studio, mentre l’azienda ha programmato il rilascio dei pesi per fine ottobre. Al 7 ottobre il modello è valutabile via API; non è ancora possibile scaricarne i pesi. Questa distinzione è importante per scegliere tra un test rapido nel servizio e la distribuzione autonoma.

Un edificio alto con molte finestre accanto a una strada
Shabeeba Ameen · Licenza Unsplash

Cosa è disponibile ora per gli sviluppatori

La voce nel changelog di Mistral conferma l’anteprima pubblica e uno sconto temporaneo del 50% sul lancio, valido per due settimane. La scheda del modello elenca il supporto per input multimodali, chiamate di funzioni, output strutturato, elaborazione in batch e strumenti per agenti. Gli sviluppatori possono così verificare il modello sui propri casi d’uso tramite API, prima di decidere se distribuirlo.

Al momento della verifica, la scheda indica 0,68 $ per milione di token in ingresso, 0,07 $ per milione di token in ingresso memorizzati nella cache e 2,09 $ per milione di token in uscita. Sono riportate anche le tariffe standard, doppie rispetto a quelle scontate: lo sconto è legato al lancio e ha una durata limitata. Prima di calcolare il budget, è opportuno verificare le tariffe direttamente nella documentazione di Mistral.

Le specifiche presentano una discrepanza

Mistral descrive Large 4 come un’architettura multimodale Mixture of Experts. La documentazione indica 1,05 trilioni di parametri totali e 52 miliardi di parametri attivi; nell’annuncio dell’azienda si parla invece di 1 trilione e 49 miliardi di parametri attivi. Le fonti non spiegano la ragione della differenza. È quindi più preciso riportare entrambe le versioni attribuendole alle rispettive fonti, anziché ricondurle a un unico valore.

La documentazione indica una finestra di contesto di un milione di token. Per pianificare richieste lunghe, è utile verificare questa specifica con la versione API in uso: i parametri dell’anteprima potrebbero essere aggiornati man mano che la documentazione viene rivista.

Qualsiasi opera architettonica che non esprima serenità è un errore
Ashish Mehta · Licenza Unsplash

I benchmark riguardano attività specifiche

Mistral riporta risultati del 61,7% su DeepSWE v1.1, del 28,3% su Terminal-Bench 4 e del 59,9% su AutomationBench. Sono risultati pubblicati dall’azienda per test specifici: rispettivamente, attività di sviluppo con comportamento agentico, flussi di lavoro da terminale e automazione dei processi aziendali. È utile considerarli come riferimenti per scegliere quali verifiche effettuare, non come una misura unica della qualità del modello.

Per prendere una decisione pratica, gli sviluppatori dovrebbero ripetere alcune attività rappresentative del proprio progetto: registrare la versione del modello, i prompt e le impostazioni, verificare i risultati con test e considerare il costo dei tentativi ripetuti. Una prova di questo tipo mostrerà quanto i risultati pubblicati siano applicabili al codice, ai documenti o al flusso di lavoro agentico specifici.

I pesi aperti sono il prossimo passaggio

Mistral ha dichiarato di voler rilasciare i pesi entro la fine di ottobre, dopo ulteriori test red team. Si tratta di un piano futuro dell’azienda; alla data di pubblicazione, il metodo di utilizzo confermato di Large 4 è l’anteprima pubblica via API. Per i team che hanno bisogno di un’infrastruttura propria e di gestire autonomamente il modello, l’evento decisivo sarà l’effettiva pubblicazione dei pesi e delle relative condizioni d’uso.

Nel frattempo, gli sviluppatori possono verificare disponibilità, funzioni e qualità tramite API e rimandare la decisione di trasferire il modello nel proprio ambiente fino alla pubblicazione dei pesi. In questa fase, sono più utili i risultati di test riproducibili su attività lavorative reali e le condizioni tariffarie aggiornate che le dichiarazioni comparative.

People

No people listed for this article yet.

Keep readingGitHub lancia ReviewBench: i revisori IA saranno confrontati in base ai difetti individuati
Read the next article

Articoli correlati

Trasforma ciò che leggi in un'integrazione funzionante

Esplora le API per dati social di jsonscraper, prova le richieste e crea il tuo prossimo flusso di lavoro.

Esplora API