Dvě služby mohou posílat stejný počet požadavků modelu, ale vytvářet zcela odlišnou zátěž. V průvodci Cohere pro Embed a Rerank, zveřejněném 9. října, společnost doporučuje volit sdílené nebo vyhrazené zpracování podle podoby požadavků, průběhu zátěže a požadavků na latenci. Jde o praktický rozbor infrastruktury, nikoli o oznámení nového tarifu nebo produktu.

Pro týmy, které vytvářejí vyhledávání a RAG, je závěr důležitý při plánování indexování a uživatelských dotazů: samotný počet volání objem výpočtů příliš dobře nevystihuje. Jeden balík dokumentů určený k tvorbě embeddingů může spotřebovat více prostředků než mnoho krátkých vyhledávacích dotazů.
Proč počet požadavků za minutu klame
Embeddingy převádějí texty na číselné reprezentace, které vyhledávací systém používá k sémantickému párování. Při počáteční indexaci katalogu může aplikace posílat velké balíky popisů; při běžném vyhledávání model dostává krátký text dotazu. Tyto úlohy mají odlišné požadavky: dávkové zpracování se obvykle posuzuje podle propustnosti a nákladů, zatímco vyhledávání podle doby odezvy pro uživatele.
U Rerank je důležitý ještě jeden parametr: kolik kandidátů systém předává modelu k přeuspořádání. V příkladu Cohere se krátký dotaz porovnává s 50 dokumenty; společnost odhaduje objem takového zpracování přibližně na 11 tisíc tokenů. Zvýšení počtu kandidátů rozšiřuje objem práce, i když četnost uživatelských vyhledávání zůstává stejná.
Co ukazují výpočty Cohere
Článek uvádí orientační body, při kterých se ekonomicky přechází od platby podle spotřeby k vyhrazené kapacitě: přibližně 20 požadavků za minutu při dávkové indexaci 100 textů o zhruba 200 tokenech, přibližně čtyři u delších dokumentů a asi 29 pro popsaný scénář Rerank. U embeddingů krátkých vyhledávacích dotazů autoři odhadují hranici na desítky tisíc požadavků za minutu.
Tato čísla vycházejí z konkrétních předpokladů: jedné vyhrazené grafické karty NVIDIA A10, nepřetržitého provozu při plném vytížení, uvedených velikostí požadavků a zveřejněných cen. Cohere zvlášť upozorňuje, že grafy a prahové hodnoty se mění podle délky provozu, konfigurace hardwaru, slev a objemu dokumentů. Je užitečné vnímat je jako ukázku metody výpočtu, nikoli jako univerzální normy.
Samotná logika výběru se však uplatní i mimo konkrétní příklady. Předvídatelná a trvalá zátěž může vyhrazenou kapacitu využívat efektivněji; krátké špičky proložené dlouhými obdobími nečinnosti se častěji hodí pro platbu podle skutečné spotřeby. U interaktivního vyhledávání je třeba ověřit také latenci při očekávané zátěži: maximální propustnost hardwaru nezaručuje požadovanou dobu odezvy při běžném provozu.
Jak analýzu využít ve vlastním vyhledávání
Před porovnáním možností změřte na skutečném provozu několik údajů: počet tokenů a dokumentů na požadavek, velikost indexačních dávek, počet kandidátů k přeuspořádání, délku špiček a cílovou latenci. Poté vypočítejte náklady podle skutečného průběhu provozu, nikoli jen podle průměrného počtu požadavků. Úplný přehled získáte porovnáním aktuálních sazeb a podmínek nasazení s ceníkem Cohere: vyhrazený model a zpracování podle spotřeby se účtují odlišně.
U kombinovaného vyhledávání je rozumné hodnotit jednotlivé fáze zvlášť: opětovné indexování katalogu na pozadí, krátké uživatelské dotazy a přeuspořádání kandidátů. Takový výpočet pomáhá ověřit, zda je oprávněné použít jednotnou infrastrukturu, nebo zda se různé části procesu vyplatí provozovat v odlišných modelech nasazení. Praktický závěr článku Cohere je jednoduchý: nejprve změřte práci, kterou každý požadavek představuje, a teprve potom zvolte způsob účtování a přidělování prostředků.