Il 6 ottobre Mistral ha aperto l’anteprima pubblica dell’API di Mistral Large 4. Gli sviluppatori possono già testare il modello tramite Mistral Studio, mentre l’azienda ha programmato il rilascio dei pesi per fine ottobre. Al 7 ottobre il modello è valutabile via API; non è ancora possibile scaricarne i pesi. Questa distinzione è importante per scegliere tra un test rapido nel servizio e la distribuzione autonoma.
Cosa è disponibile ora per gli sviluppatori
La voce nel changelog di Mistral conferma l’anteprima pubblica e uno sconto temporaneo del 50% sul lancio, valido per due settimane. La scheda del modello elenca il supporto per input multimodali, chiamate di funzioni, output strutturato, elaborazione in batch e strumenti per agenti. Gli sviluppatori possono così verificare il modello sui propri casi d’uso tramite API, prima di decidere se distribuirlo.
Al momento della verifica, la scheda indica 0,68 $ per milione di token in ingresso, 0,07 $ per milione di token in ingresso memorizzati nella cache e 2,09 $ per milione di token in uscita. Sono riportate anche le tariffe standard, doppie rispetto a quelle scontate: lo sconto è legato al lancio e ha una durata limitata. Prima di calcolare il budget, è opportuno verificare le tariffe direttamente nella documentazione di Mistral.
Le specifiche presentano una discrepanza
Mistral descrive Large 4 come un’architettura multimodale Mixture of Experts. La documentazione indica 1,05 trilioni di parametri totali e 52 miliardi di parametri attivi; nell’annuncio dell’azienda si parla invece di 1 trilione e 49 miliardi di parametri attivi. Le fonti non spiegano la ragione della differenza. È quindi più preciso riportare entrambe le versioni attribuendole alle rispettive fonti, anziché ricondurle a un unico valore.
La documentazione indica una finestra di contesto di un milione di token. Per pianificare richieste lunghe, è utile verificare questa specifica con la versione API in uso: i parametri dell’anteprima potrebbero essere aggiornati man mano che la documentazione viene rivista.
I benchmark riguardano attività specifiche
Mistral riporta risultati del 61,7% su DeepSWE v1.1, del 28,3% su Terminal-Bench 4 e del 59,9% su AutomationBench. Sono risultati pubblicati dall’azienda per test specifici: rispettivamente, attività di sviluppo con comportamento agentico, flussi di lavoro da terminale e automazione dei processi aziendali. È utile considerarli come riferimenti per scegliere quali verifiche effettuare, non come una misura unica della qualità del modello.
Per prendere una decisione pratica, gli sviluppatori dovrebbero ripetere alcune attività rappresentative del proprio progetto: registrare la versione del modello, i prompt e le impostazioni, verificare i risultati con test e considerare il costo dei tentativi ripetuti. Una prova di questo tipo mostrerà quanto i risultati pubblicati siano applicabili al codice, ai documenti o al flusso di lavoro agentico specifici.
I pesi aperti sono il prossimo passaggio
Mistral ha dichiarato di voler rilasciare i pesi entro la fine di ottobre, dopo ulteriori test red team. Si tratta di un piano futuro dell’azienda; alla data di pubblicazione, il metodo di utilizzo confermato di Large 4 è l’anteprima pubblica via API. Per i team che hanno bisogno di un’infrastruttura propria e di gestire autonomamente il modello, l’evento decisivo sarà l’effettiva pubblicazione dei pesi e delle relative condizioni d’uso.
Nel frattempo, gli sviluppatori possono verificare disponibilità, funzioni e qualità tramite API e rimandare la decisione di trasferire il modello nel proprio ambiente fino alla pubblicazione dei pesi. In questa fase, sono più utili i risultati di test riproducibili su attività lavorative reali e le condizioni tariffarie aggiornate che le dichiarazioni comparative.