jsonscraper

Mistral Large 4 je už dostupná přes API — otevřené váhy mají přijít později

Veřejné preview začalo 6. října. Podívejme se, co lze ověřit už nyní a které specifikace se zatím rozcházejí.

6. října Mistral otevřela veřejné preview API Mistral Large 4. Vývojáři už mohou model testovat přes Mistral Studio a společnost naplánovala vydání vah na konec října. K 7. říjnu lze model hodnotit přes API; jeho váhy zatím nelze stáhnout. Tento stav je důležitý při rozhodování mezi rychlým testováním ve službě a vlastním nasazením.

Vysoká budova s mnoha okny vedle ulice
Shabeeba Ameen · Licence Unsplash

Co je nyní dostupné vývojářům

Záznam v changelogu Mistral potvrzuje veřejné preview a dočasnou 50% slevu na spuštění po dobu dvou týdnů. Karta modelu uvádí podporu multimodálního vstupu, volání funkcí, strukturovaného výstupu, dávkového zpracování a nástrojů pro agenty. Vývojáři tak mohou model vyzkoušet na vlastních úlohách prostřednictvím API ještě před rozhodnutím o nasazení.

Karta v době kontroly uvádí cenu 0,68 USD za milion vstupních tokenů, 0,07 USD za milion vstupních tokenů v mezipaměti a 2,09 USD za milion výstupních tokenů. Vedle toho jsou uvedeny běžné sazby, které jsou dvojnásobné: sleva souvisí se spuštěním a je časově omezená. Před sestavením rozpočtu je vhodné ověřit ceny přímo v dokumentaci Mistral.

Ve specifikacích je rozpor

Mistral popisuje Large 4 jako multimodální architekturu Mixture of Experts. Dokumentace uvádí celkem 1,05 bilionu parametrů, z toho 52 miliard aktivních; v oznámení společnosti je uveden 1 bilion a 49 miliard aktivních parametrů. Zdroje nevysvětlují, proč se hodnoty liší. Přesnější je proto uvést obě verze i s jejich přiřazením zdrojům, než je sjednotit na jednu hodnotu.

Dokumentace uvádí kontextové okno o velikosti jednoho milionu tokenů. Při plánování dlouhých požadavků je dobré tuto specifikaci ověřit u používané verze API: parametry preview se mohou s aktualizacemi dokumentace upřesňovat.

Každé architektonické dílo, které nevyjadřuje klid, je chybou
Ashish Mehta · Licence Unsplash

Benchmarky se týkají konkrétních úloh

Mistral uvádí výsledky 61,7 % v testu DeepSWE v1.1, 28,3 % v Terminal-Bench 4 a 59,9 % v AutomationBench. Jde o výsledky zveřejněné samotnou společností pro konkrétní testy: úlohy vývoje softwaru s agentním chováním, terminální pracovní postupy a automatizaci obchodních procesů. Je vhodné chápat je jako vodítko při výběru vlastních testů, nikoli jako jednotné měřítko kvality modelu.

Při praktickém rozhodování by vývojáři měli zopakovat několik reprezentativních úloh svého projektu: zaznamenat verzi modelu, prompty a nastavení, ověřovat výsledky testy a zohlednit cenu opakovaných pokusů. Takový test ukáže, nakolik lze zveřejněné výsledky přenést na konkrétní kód, dokumenty nebo agentní proces.

Otevřené váhy jsou až další krok

Mistral uvedla, že plánuje vydat váhy do konce října, a to po dodatečném red-teamovém testování. Jde o budoucí plán společnosti; k datu zveřejnění je potvrzeným způsobem používání Large 4 veřejné preview API. Pro týmy, které potřebují vlastní infrastrukturu a samostatnou správu modelu, bude klíčovou událostí skutečné zveřejnění vah a souvisejících podmínek používání.

Vývojáři zatím mohou přes API ověřovat dostupnost, funkce a kvalitu a rozhodnutí o přesunu modelu do vlastního prostředí odložit až do vydání vah. Při spuštění jsou užitečnější výsledky reprodukovatelného testu na pracovních úlohách a aktuální podmínky cen než srovnávací tvrzení.

Keep readingGitHub představila ReviewBench: AI recenzenty budou porovnávat podle nalezených chyb
Read the next article

Související články

Breaking News · Novinky

GitHub představila ReviewBench: AI recenzenty budou porovnávat podle nalezených chyb

GitHub 5. října představila ReviewBench, výzkumnou předběžnou verzi benchmarku pro agenty kontrolující kód. Jeho metriky rozlišují nalezené problémy, přehlédnuté chyby a zbytečný šum. Výsledky interního A/B testu společnosti popisují jeden konkrétní experiment, nikoli obecný žebříček modelů.

Proměňte přečtené ve funkční integraci

Prozkoumejte API sociálních dat jsonscraper, testujte požadavky a sestavte další workflow.

Prozkoumat API