jsonscraper

Mistral Large 4 est disponible via API — les poids ouverts sont prévus plus tard

L’aperçu public a débuté le 6 octobre. Voici ce qu’il est possible de vérifier dès maintenant et les caractéristiques qui divergent encore.

Le 6 octobre, Mistral a ouvert l’aperçu public de l’API Mistral Large 4. Les développeurs peuvent déjà tester le modèle via Mistral Studio, et l’entreprise prévoit de publier les poids fin octobre. Au 7 octobre, le modèle peut être évalué via API ; il n’est pas encore possible de télécharger ses poids. Ce statut est important pour choisir entre des tests rapides dans le service et un déploiement autonome.

Un grand immeuble aux nombreuses fenêtres, à côté d’une rue
Shabeeba Ameen · Licence Unsplash

Ce qui est actuellement accessible aux développeurs

L’entrée du journal des modifications de Mistral confirme l’aperçu public et une réduction temporaire de 50 % sur le lancement, valable deux semaines. La fiche du modèle répertorie la prise en charge des entrées multimodales, l’appel de fonctions, les sorties structurées, le traitement par lots et les outils pour agents. Les développeurs peuvent ainsi tester le modèle sur leurs propres tâches via l’API avant de décider de le déployer.

Au moment de la vérification, la fiche indique un tarif de 0,68 $ par million de tokens d’entrée, de 0,07 $ par million de tokens d’entrée mis en cache et de 2,09 $ par million de tokens de sortie. Les tarifs habituels, deux fois plus élevés, sont indiqués à côté : la réduction est liée au lancement et limitée dans le temps. Avant d’établir un budget, il est préférable de vérifier les tarifs directement dans la documentation de Mistral.

Les spécifications comportent une divergence

Mistral décrit Large 4 comme une architecture multimodale de type Mixture of Experts. La documentation indique 1,05 billion de paramètres au total et 52 milliards de paramètres actifs ; dans son annonce, l’entreprise indique 1 billion et 49 milliards de paramètres actifs. Les sources n’expliquent pas cette différence. Il est donc plus précis de présenter les deux versions en les attribuant à leurs sources que de les ramener à un seul chiffre.

La documentation indique une fenêtre de contexte d’un million de tokens. Pour planifier des requêtes longues, il est utile de confirmer cette spécification avec la version de l’API utilisée : les paramètres de l’aperçu peuvent être précisés au fil des mises à jour de la documentation.

Toute œuvre architecturale qui n’exprime pas la sérénité est une erreur
Ashish Mehta · Licence Unsplash

Les benchmarks évaluent des tâches distinctes

Mistral indique des résultats de 61,7 % sur DeepSWE v1.1, de 28,3 % sur Terminal-Bench 4 et de 59,9 % sur AutomationBench. Il s’agit de résultats publiés par l’entreprise pour des tests spécifiques portant respectivement sur des tâches de développement avec comportement agentique, des flux de travail dans un terminal et l’automatisation de processus métier. Ils constituent des repères utiles pour choisir les évaluations à effectuer, mais pas une mesure globale de la qualité du modèle.

Pour prendre une décision concrète, les développeurs devraient reproduire plusieurs tâches représentatives de leur projet : consigner la version du modèle, les prompts et les paramètres, vérifier les résultats à l’aide de tests et tenir compte du coût des nouvelles tentatives. Ce test montrera dans quelle mesure les résultats publiés s’appliquent à un code, des documents ou un processus agentique spécifiques.

Les poids ouverts restent une prochaine étape

Mistral a déclaré prévoir la publication des poids d’ici la fin octobre, après des tests red team supplémentaires. Il s’agit d’un projet futur de l’entreprise ; à la date de publication, le mode d’utilisation confirmé de Large 4 est l’aperçu public de l’API. Pour les équipes qui ont besoin de leur propre infrastructure et d’une gestion autonome du modèle, l’événement décisif sera la publication effective des poids et des conditions d’utilisation correspondantes.

En attendant, les développeurs peuvent vérifier la disponibilité, les fonctionnalités et la qualité via l’API, puis attendre la publication des poids avant de décider de transférer le modèle dans leur propre environnement. Au lancement, les résultats d’évaluations reproductibles sur des tâches réelles et les conditions tarifaires à jour sont plus utiles que les déclarations comparatives.

Keep readingGitHub lance ReviewBench : les réviseurs IA seront comparés selon les défauts détectés
Read the next article

Articles similaires

Breaking News · Actualités

GitHub lance ReviewBench : les réviseurs IA seront comparés selon les défauts détectés

Le 5 octobre, GitHub a présenté ReviewBench, un aperçu de recherche d’un benchmark pour les agents de revue de code. Ses métriques distinguent les problèmes détectés, les omissions et le bruit superflu ; les résultats du test A/B interne de l’entreprise décrivent une expérience particulière, et non un classement général des modèles.

Transformez vos lectures en intégration fonctionnelle

Explorez les API de données sociales de jsonscraper, testez des requêtes et créez votre prochain workflow.

Explorer les API