6 października Mistral uruchomiła publiczny podgląd API Mistral Large 4. Programiści mogą już testować model za pośrednictwem Mistral Studio, a publikację wag firma zaplanowała na koniec października. Na 7 października model można oceniać przez API; pobranie jego wag nie jest jeszcze możliwe. Ten status ma znaczenie przy wyborze między szybkim testowaniem w usłudze a samodzielnym wdrożeniem.
Co jest teraz dostępne dla programistów
Wpis w dzienniku zmian Mistral potwierdza publiczny podgląd i czasową, 50-procentową zniżkę na uruchomienie, obowiązującą przez dwa tygodnie. Karta modelu wymienia obsługę multimodalnego wejścia, wywoływanie funkcji, ustrukturyzowane wyjście, przetwarzanie wsadowe oraz narzędzia dla agentów. Dzięki temu programiści mogą sprawdzić model na własnych zadaniach za pośrednictwem API, zanim zdecydują się na wdrożenie.
W chwili weryfikacji karta podaje cenę 0,68 USD za milion tokenów wejściowych, 0,07 USD za milion buforowanych tokenów wejściowych i 2,09 USD za milion tokenów wyjściowych. Obok podano standardowe stawki dwukrotnie wyższe: zniżka obowiązuje z okazji premiery i jest ograniczona czasowo. Przed przygotowaniem budżetu warto sprawdzić aktualne ceny bezpośrednio w dokumentacji Mistral.
Specyfikacje zawierają rozbieżność
Mistral opisuje Large 4 jako multimodalną architekturę Mixture of Experts. Dokumentacja podaje 1,05 bln parametrów łącznie i 52 mld parametrów aktywnych, natomiast w ogłoszeniu firmy mowa o 1 bln i 49 mld aktywnych parametrów. Źródła nie wyjaśniają, skąd biorą się te różnice. Dlatego lepiej przytoczyć obie wersje wraz z ich źródłami, zamiast sprowadzać je do jednej liczby.
Dokumentacja podaje okno kontekstu o długości miliona tokenów. Przy planowaniu długich zapytań warto potwierdzić tę specyfikację dla używanej wersji API: parametry podglądu mogą być doprecyzowywane wraz z aktualizacjami dokumentacji.
Benchmarki opisują konkretne zadania
Mistral podaje wyniki 61,7% w DeepSWE v1.1, 28,3% w Terminal-Bench 4 i 59,9% w AutomationBench. Są to wyniki opublikowane przez samą firmę dla konkretnych testów, odpowiednio: zadań programistycznych z udziałem agentów, procesów pracy w terminalu oraz automatyzacji procesów biznesowych. Warto traktować je jako wskazówki przy wyborze testów, a nie jako jedną miarę jakości modelu.
Aby podjąć praktyczną decyzję, programiści powinni powtórzyć kilka reprezentatywnych zadań ze swojego projektu: zapisać wersję modelu, prompty i ustawienia, weryfikować wyniki testami oraz uwzględniać koszt ponownych prób. Taki test pokaże, na ile opublikowane wyniki przekładają się na konkretny kod, dokumenty lub proces agentowy.
Otwarte wagi to kolejny etap
Mistral zapowiedziała, że planuje opublikować wagi do końca października, po dodatkowych testach red-team. To plan firmy na przyszłość; w dniu publikacji potwierdzonym sposobem korzystania z Large 4 jest publiczny podgląd API. Dla zespołów, które potrzebują własnej infrastruktury i samodzielnego zarządzania modelem, kluczowe będzie faktyczne opublikowanie wag oraz towarzyszących im warunków użytkowania.
Na razie programiści mogą za pośrednictwem API sprawdzać dostępność, funkcje i jakość, a decyzję o przeniesieniu modelu do własnego środowiska odłożyć do publikacji wag. Na tym etapie najbardziej przydatne są nie porównawcze deklaracje, lecz wyniki powtarzalnych testów zadań produkcyjnych oraz aktualne warunki cenowe.