jsonscraper

Mistral Large 4 уже доступна через API — открытые веса обещаны позже

Публичное превью стартовало 6 октября. Разбираем, что можно проверить сейчас и какие характеристики пока расходятся.

6 октября Mistral открыла публичное API-превью Mistral Large 4. Разработчики уже могут тестировать модель через Mistral Studio, а выпуск весов компания запланировала на конец октября. На 7 октября модель можно оценивать через API; скачать её веса пока нельзя. Этот статус важен для выбора между быстрым тестированием в сервисе и самостоятельным развёртыванием.

A tall building with lots of windows next to a street
Shabeeba Ameen · Unsplash License

Что доступно разработчикам сейчас

Запись в changelog Mistral подтверждает публичное превью и временную скидку 50% на запуске сроком на две недели. В карточке модели перечислены поддержка мультимодального ввода, вызов функций, структурированный вывод, пакетная обработка и инструменты для агентов. Это даёт разработчикам возможность проверить модель на собственных задачах в API, прежде чем принимать решение о развёртывании.

Карточка на момент проверки показывает $0,68 за миллион входных токенов, $0,07 за миллион кешированных входных и $2,09 за миллион выходных. Рядом указаны обычные ставки вдвое выше: скидка связана с запуском и ограничена по времени. Перед расчётом бюджета стоит сверить тарифы непосредственно в документации Mistral.

Спецификации содержат расхождение

Mistral описывает Large 4 как мультимодальную архитектуру Mixture of Experts. В документации указаны 1,05 трлн параметров всего и 52 млрд активных; в анонсе компании — 1 трлн и 49 млрд активных. Источники не объясняют, почему значения различаются. Поэтому точнее передавать обе версии с атрибуцией, чем сводить их к одной цифре.

Документация указывает окно контекста в один миллион токенов. Для планирования длинных запросов эту спецификацию полезно подтвердить на используемой версии API: параметры превью могут уточняться по мере обновления документации.

Any architectural work that does not express serenity is an error
Ashish Mehta · Unsplash License

Бенчмарки описывают отдельные задачи

Mistral сообщает о результатах 61,7% на DeepSWE v1.1, 28,3% на Terminal-Bench 4 и 59,9% на AutomationBench. Это результаты, опубликованные самой компанией для конкретных тестов: соответственно, задач разработки с агентным поведением, терминальных рабочих процессов и автоматизации бизнес-процессов. Их полезно рассматривать как ориентиры для выбора проверок, а не как единую меру качества модели.

Для практического решения разработчикам стоит повторить несколько репрезентативных задач своего проекта: зафиксировать версию модели, промпты и настройки, проверять результат тестами и учитывать стоимость повторных попыток. Такой тест покажет, насколько опубликованные результаты переносятся на конкретный код, документы или агентный процесс.

Открытые веса остаются следующим этапом

Mistral заявила, что планирует выпустить веса к концу октября, после дополнительного red-team-тестирования. Это будущий план компании; на дату публикации подтверждённый способ использования Large 4 — публичное API-превью. Для команд, которым нужны собственная инфраструктура и самостоятельное управление моделью, ключевым событием станет фактическая публикация весов и сопутствующих условий использования.

Пока разработчики могут проверять доступность, функции и качество через API, а решение о переносе модели в собственную среду отложить до выпуска весов. На старте наиболее полезны не сравнительные заявления, а результаты воспроизводимого теста на рабочих задачах и актуальные условия тарификации.

Персоны

Для этой статьи персоны пока не указаны.

Читайте дальшеGitHub открыла ReviewBench: ИИ-ревьюеров будут сравнивать по найденным дефектам
Читать следующую статью

Похожие материалы

Breaking News · Новости

GitHub открыла ReviewBench: ИИ-ревьюеров будут сравнивать по найденным дефектам

5 октября GitHub представила ReviewBench — исследовательское превью бенчмарка для агентов, проверяющих код. Его метрики разделяют найденные проблемы, пропуски и лишний шум, а результаты внутреннего A/B-теста компании описывают отдельный эксперимент, а не общий рейтинг моделей.

Launches · Новости

AWS CloudWatch Omni объединяет трассировки агентов и операции приложений

AWS CloudWatch Omni стал общедоступным и объединяет наблюдаемость агентов и приложений в едином интерфейсе. Рассказываем, что изменилось и что следует проверить перед передачей производственных трассировок.

Превратите прочитанное в рабочую интеграцию

Изучайте API социальных данных jsonscraper, тестируйте запросы и создавайте новые процессы.

Смотреть API