jsonscraper

Mistral Large 4 jest już dostępna przez API — otwarte wagi mają pojawić się później

Publiczny podgląd ruszył 6 października. Sprawdzamy, co można zweryfikować już teraz i które specyfikacje są rozbieżne.

6 października Mistral uruchomiła publiczny podgląd API Mistral Large 4. Programiści mogą już testować model za pośrednictwem Mistral Studio, a publikację wag firma zaplanowała na koniec października. Na 7 października model można oceniać przez API; pobranie jego wag nie jest jeszcze możliwe. Ten status ma znaczenie przy wyborze między szybkim testowaniem w usłudze a samodzielnym wdrożeniem.

Wysoki budynek z licznymi oknami przy ulicy
Shabeeba Ameen · Licencja Unsplash

Co jest teraz dostępne dla programistów

Wpis w dzienniku zmian Mistral potwierdza publiczny podgląd i czasową, 50-procentową zniżkę na uruchomienie, obowiązującą przez dwa tygodnie. Karta modelu wymienia obsługę multimodalnego wejścia, wywoływanie funkcji, ustrukturyzowane wyjście, przetwarzanie wsadowe oraz narzędzia dla agentów. Dzięki temu programiści mogą sprawdzić model na własnych zadaniach za pośrednictwem API, zanim zdecydują się na wdrożenie.

W chwili weryfikacji karta podaje cenę 0,68 USD za milion tokenów wejściowych, 0,07 USD za milion buforowanych tokenów wejściowych i 2,09 USD za milion tokenów wyjściowych. Obok podano standardowe stawki dwukrotnie wyższe: zniżka obowiązuje z okazji premiery i jest ograniczona czasowo. Przed przygotowaniem budżetu warto sprawdzić aktualne ceny bezpośrednio w dokumentacji Mistral.

Specyfikacje zawierają rozbieżność

Mistral opisuje Large 4 jako multimodalną architekturę Mixture of Experts. Dokumentacja podaje 1,05 bln parametrów łącznie i 52 mld parametrów aktywnych, natomiast w ogłoszeniu firmy mowa o 1 bln i 49 mld aktywnych parametrów. Źródła nie wyjaśniają, skąd biorą się te różnice. Dlatego lepiej przytoczyć obie wersje wraz z ich źródłami, zamiast sprowadzać je do jednej liczby.

Dokumentacja podaje okno kontekstu o długości miliona tokenów. Przy planowaniu długich zapytań warto potwierdzić tę specyfikację dla używanej wersji API: parametry podglądu mogą być doprecyzowywane wraz z aktualizacjami dokumentacji.

Każde dzieło architektoniczne, które nie wyraża spokoju, jest błędem
Ashish Mehta · Licencja Unsplash

Benchmarki opisują konkretne zadania

Mistral podaje wyniki 61,7% w DeepSWE v1.1, 28,3% w Terminal-Bench 4 i 59,9% w AutomationBench. Są to wyniki opublikowane przez samą firmę dla konkretnych testów, odpowiednio: zadań programistycznych z udziałem agentów, procesów pracy w terminalu oraz automatyzacji procesów biznesowych. Warto traktować je jako wskazówki przy wyborze testów, a nie jako jedną miarę jakości modelu.

Aby podjąć praktyczną decyzję, programiści powinni powtórzyć kilka reprezentatywnych zadań ze swojego projektu: zapisać wersję modelu, prompty i ustawienia, weryfikować wyniki testami oraz uwzględniać koszt ponownych prób. Taki test pokaże, na ile opublikowane wyniki przekładają się na konkretny kod, dokumenty lub proces agentowy.

Otwarte wagi to kolejny etap

Mistral zapowiedziała, że planuje opublikować wagi do końca października, po dodatkowych testach red-team. To plan firmy na przyszłość; w dniu publikacji potwierdzonym sposobem korzystania z Large 4 jest publiczny podgląd API. Dla zespołów, które potrzebują własnej infrastruktury i samodzielnego zarządzania modelem, kluczowe będzie faktyczne opublikowanie wag oraz towarzyszących im warunków użytkowania.

Na razie programiści mogą za pośrednictwem API sprawdzać dostępność, funkcje i jakość, a decyzję o przeniesieniu modelu do własnego środowiska odłożyć do publikacji wag. Na tym etapie najbardziej przydatne są nie porównawcze deklaracje, lecz wyniki powtarzalnych testów zadań produkcyjnych oraz aktualne warunki cenowe.

People

No people listed for this article yet.

Keep readingGitHub udostępnia ReviewBench: agentów AI do przeglądu kodu porówna liczba wykrytych błędów
Read the next article

Powiązane artykuły

Zmień lekturę w działającą integrację

Poznaj API danych społecznościowych jsonscraper, testuj zapytania i buduj kolejne procesy.

Poznaj API