jsonscraper

Mistral Large 4 уже доступна через API — открытые веса обіцяють пізніше

Публічне прев’ю стартувало 6 жовтня. Розбираємо, що можна перевірити зараз і які характеристики поки розходяться.

6 жовтня Mistral відкрила публічне API-прев’ю Mistral Large 4. Розробники вже можуть тестувати модель через Mistral Studio, а випуск ваг компанія запланувала на кінець жовтня. Станом на 7 жовтня модель можна оцінювати через API; завантажити її ваги поки не можна. Цей статус важливий для вибору між швидким тестуванням у сервісі та самостійним розгортанням.

Висока будівля з багатьма вікнами поруч із вулицею
Shabeeba Ameen · Ліцензія Unsplash

Що доступно розробникам зараз

Запис у журналі змін Mistral підтверджує публічне прев’ю та тимчасову знижку 50% на запуску строком на два тижні. У картці моделі перелічено підтримку мультимодального введення, виклик функцій, структурований вивід, пакетну обробку та інструменти для агентів. Це дає розробникам змогу перевірити модель на власних завданнях через API, перш ніж ухвалювати рішення про розгортання.

Картка на момент перевірки показує $0,68 за мільйон вхідних токенів, $0,07 за мільйон кешованих вхідних і $2,09 за мільйон вихідних. Поруч зазначені звичайні тарифи, удвічі вищі: знижка пов’язана із запуском і обмежена в часі. Перед розрахунком бюджету варто звірити тарифи безпосередньо в документації Mistral.

Специфікації містять розбіжність

Mistral описує Large 4 як мультимодальну архітектуру Mixture of Experts. У документації зазначено 1,05 трлн параметрів загалом і 52 млрд активних; в анонсі компанії — 1 трлн і 49 млрд активних. Джерела не пояснюють, чому значення різняться. Тому точніше наводити обидві версії з атрибуцією, а не зводити їх до однієї цифри.

У документації вказано контекстне вікно в один мільйон токенів. Для планування довгих запитів цю специфікацію корисно підтвердити на версії API, яку ви використовуєте: параметри прев’ю можуть уточнюватися в міру оновлення документації.

Будь-яка архітектурна споруда, що не виражає спокою, — помилка
Ashish Mehta · Ліцензія Unsplash

Бенчмарки описують окремі завдання

Mistral повідомляє про результати 61,7% на DeepSWE v1.1, 28,3% на Terminal-Bench 4 і 59,9% на AutomationBench. Це результати, опубліковані самою компанією для конкретних тестів: відповідно, завдань із розробки з агентною поведінкою, термінальних робочих процесів і автоматизації бізнес-процесів. Їх варто розглядати як орієнтири для вибору перевірок, а не як єдину міру якості моделі.

Для практичного рішення розробникам варто повторити кілька репрезентативних завдань свого проєкту: зафіксувати версію моделі, промпти й налаштування, перевіряти результати тестами та враховувати вартість повторних спроб. Такий тест покаже, наскільки опубліковані результати можна перенести на конкретний код, документи чи агентний процес.

Відкриті ваги залишаються наступним етапом

Mistral заявила, що планує випустити ваги до кінця жовтня, після додаткового red-team-тестування. Це майбутній план компанії; на дату публікації підтверджений спосіб використання Large 4 — публічне API-прев’ю. Для команд, яким потрібні власна інфраструктура та самостійне керування моделлю, ключовою подією стане фактична публікація ваг і супутніх умов використання.

Поки розробники можуть перевіряти доступність, функції та якість через API, а рішення про перенесення моделі у власне середовище відкласти до випуску ваг. На старті найкорисніші не порівняльні заяви, а результати відтворюваного тесту на робочих завданнях і актуальні умови тарифікації.

People

No people listed for this article yet.

Keep readingGitHub представила ReviewBench: ІІ-рев’юерів порівнюватимуть за знайденими дефектами
Read the next article

Схожі матеріали

Breaking News · Новини

GitHub представила ReviewBench: ІІ-рев’юерів порівнюватимуть за знайденими дефектами

5 жовтня GitHub представила ReviewBench — дослідницьку попередню версію бенчмарку для агентів, які перевіряють код. Його метрики розділяють виявлені проблеми, пропуски й зайвий шум, а результати внутрішнього A/B-тесту компанії описують окремий експеримент, а не загальний рейтинг моделей.

Launches · Новини

AWS CloudWatch Omni переносить трасування агентів у середовище операцій із застосунками

AWS CloudWatch Omni став загальнодоступним і об’єднав спостережуваність агентів та застосунків в одному середовищі. Розповідаємо, що змінилося та що командам варто перевірити, перш ніж спрямовувати туди трасування з робочих систем.

News Analysis · Новини

Ghost залучила $11 млн на комп’ютер Core за $3 499 для локальних ШІ-агентів

Ghost обіцяє локального ШІ-агента, який постійно працює на окремому комп’ютері. Розглядаємо характеристики Core, маршрути передавання даних і питання, на які ще не відповіли незалежні випробування.

Перетворіть прочитане на робочу інтеграцію

Досліджуйте API соціальних даних jsonscraper, тестуйте запити й створюйте нові процеси.

Переглянути API