6 жовтня Mistral відкрила публічне API-прев’ю Mistral Large 4. Розробники вже можуть тестувати модель через Mistral Studio, а випуск ваг компанія запланувала на кінець жовтня. Станом на 7 жовтня модель можна оцінювати через API; завантажити її ваги поки не можна. Цей статус важливий для вибору між швидким тестуванням у сервісі та самостійним розгортанням.
Що доступно розробникам зараз
Запис у журналі змін Mistral підтверджує публічне прев’ю та тимчасову знижку 50% на запуску строком на два тижні. У картці моделі перелічено підтримку мультимодального введення, виклик функцій, структурований вивід, пакетну обробку та інструменти для агентів. Це дає розробникам змогу перевірити модель на власних завданнях через API, перш ніж ухвалювати рішення про розгортання.
Картка на момент перевірки показує $0,68 за мільйон вхідних токенів, $0,07 за мільйон кешованих вхідних і $2,09 за мільйон вихідних. Поруч зазначені звичайні тарифи, удвічі вищі: знижка пов’язана із запуском і обмежена в часі. Перед розрахунком бюджету варто звірити тарифи безпосередньо в документації Mistral.
Специфікації містять розбіжність
Mistral описує Large 4 як мультимодальну архітектуру Mixture of Experts. У документації зазначено 1,05 трлн параметрів загалом і 52 млрд активних; в анонсі компанії — 1 трлн і 49 млрд активних. Джерела не пояснюють, чому значення різняться. Тому точніше наводити обидві версії з атрибуцією, а не зводити їх до однієї цифри.
У документації вказано контекстне вікно в один мільйон токенів. Для планування довгих запитів цю специфікацію корисно підтвердити на версії API, яку ви використовуєте: параметри прев’ю можуть уточнюватися в міру оновлення документації.
Бенчмарки описують окремі завдання
Mistral повідомляє про результати 61,7% на DeepSWE v1.1, 28,3% на Terminal-Bench 4 і 59,9% на AutomationBench. Це результати, опубліковані самою компанією для конкретних тестів: відповідно, завдань із розробки з агентною поведінкою, термінальних робочих процесів і автоматизації бізнес-процесів. Їх варто розглядати як орієнтири для вибору перевірок, а не як єдину міру якості моделі.
Для практичного рішення розробникам варто повторити кілька репрезентативних завдань свого проєкту: зафіксувати версію моделі, промпти й налаштування, перевіряти результати тестами та враховувати вартість повторних спроб. Такий тест покаже, наскільки опубліковані результати можна перенести на конкретний код, документи чи агентний процес.
Відкриті ваги залишаються наступним етапом
Mistral заявила, що планує випустити ваги до кінця жовтня, після додаткового red-team-тестування. Це майбутній план компанії; на дату публікації підтверджений спосіб використання Large 4 — публічне API-прев’ю. Для команд, яким потрібні власна інфраструктура та самостійне керування моделлю, ключовою подією стане фактична публікація ваг і супутніх умов використання.
Поки розробники можуть перевіряти доступність, функції та якість через API, а рішення про перенесення моделі у власне середовище відкласти до випуску ваг. На старті найкорисніші не порівняльні заяви, а результати відтворюваного тесту на робочих завданнях і актуальні умови тарифікації.