6. října Mistral otevřela veřejné preview API Mistral Large 4. Vývojáři už mohou model testovat přes Mistral Studio a společnost naplánovala vydání vah na konec října. K 7. říjnu lze model hodnotit přes API; jeho váhy zatím nelze stáhnout. Tento stav je důležitý při rozhodování mezi rychlým testováním ve službě a vlastním nasazením.
Co je nyní dostupné vývojářům
Záznam v changelogu Mistral potvrzuje veřejné preview a dočasnou 50% slevu na spuštění po dobu dvou týdnů. Karta modelu uvádí podporu multimodálního vstupu, volání funkcí, strukturovaného výstupu, dávkového zpracování a nástrojů pro agenty. Vývojáři tak mohou model vyzkoušet na vlastních úlohách prostřednictvím API ještě před rozhodnutím o nasazení.
Karta v době kontroly uvádí cenu 0,68 USD za milion vstupních tokenů, 0,07 USD za milion vstupních tokenů v mezipaměti a 2,09 USD za milion výstupních tokenů. Vedle toho jsou uvedeny běžné sazby, které jsou dvojnásobné: sleva souvisí se spuštěním a je časově omezená. Před sestavením rozpočtu je vhodné ověřit ceny přímo v dokumentaci Mistral.
Ve specifikacích je rozpor
Mistral popisuje Large 4 jako multimodální architekturu Mixture of Experts. Dokumentace uvádí celkem 1,05 bilionu parametrů, z toho 52 miliard aktivních; v oznámení společnosti je uveden 1 bilion a 49 miliard aktivních parametrů. Zdroje nevysvětlují, proč se hodnoty liší. Přesnější je proto uvést obě verze i s jejich přiřazením zdrojům, než je sjednotit na jednu hodnotu.
Dokumentace uvádí kontextové okno o velikosti jednoho milionu tokenů. Při plánování dlouhých požadavků je dobré tuto specifikaci ověřit u používané verze API: parametry preview se mohou s aktualizacemi dokumentace upřesňovat.
Benchmarky se týkají konkrétních úloh
Mistral uvádí výsledky 61,7 % v testu DeepSWE v1.1, 28,3 % v Terminal-Bench 4 a 59,9 % v AutomationBench. Jde o výsledky zveřejněné samotnou společností pro konkrétní testy: úlohy vývoje softwaru s agentním chováním, terminální pracovní postupy a automatizaci obchodních procesů. Je vhodné chápat je jako vodítko při výběru vlastních testů, nikoli jako jednotné měřítko kvality modelu.
Při praktickém rozhodování by vývojáři měli zopakovat několik reprezentativních úloh svého projektu: zaznamenat verzi modelu, prompty a nastavení, ověřovat výsledky testy a zohlednit cenu opakovaných pokusů. Takový test ukáže, nakolik lze zveřejněné výsledky přenést na konkrétní kód, dokumenty nebo agentní proces.
Otevřené váhy jsou až další krok
Mistral uvedla, že plánuje vydat váhy do konce října, a to po dodatečném red-teamovém testování. Jde o budoucí plán společnosti; k datu zveřejnění je potvrzeným způsobem používání Large 4 veřejné preview API. Pro týmy, které potřebují vlastní infrastrukturu a samostatnou správu modelu, bude klíčovou událostí skutečné zveřejnění vah a souvisejících podmínek používání.
Vývojáři zatím mohou přes API ověřovat dostupnost, funkce a kvalitu a rozhodnutí o přesunu modelu do vlastního prostředí odložit až do vydání vah. Při spuštění jsou užitečnější výsledky reprodukovatelného testu na pracovních úlohách a aktuální podmínky cen než srovnávací tvrzení.