jsonscraper

Cohere förklarar när dedikerad infrastruktur lönar sig för Embed och Rerank

En genomgång publicerad den 9 oktober kopplar valet mellan delad och dedikerad inferens till förfrågningarnas storlek, belastningsmönstret och målet för svarstiden.

Redaktionella riktlinjer Rapportera ett fel

Två tjänster kan skicka lika många förfrågningar till en modell men skapa helt olika belastning. I Cohere-guiden om Embed och Rerank, som publicerades den 9 oktober, föreslår företaget att valet mellan delad och dedikerad inferens görs utifrån förfrågningarnas form, belastningsmönstret och kraven på svarstid. Det är en praktisk genomgång av infrastruktur, inte en lansering av en ny prisplan eller produkt.

Artikel: Cohere förklarar när dedikerad infrastruktur lönar sig för Embed och Rerank
Sammanfattning: Cohere har publicerat en vägledning om hur man väljer delad eller dedikerad infrastruktur för Embed och Rerank. Den viktigaste praktiska slutsatsen är att man inte bara bör räkna förfrågningar per minut, utan även arbetsmängden i varje förfrågan och resursutnyttjandet.
Bildens roll: omslag — huvudidén
Avsnitt: 
Visuellt motiv: En närbild av ett tekniskt stilleben där tryckta produktkort rör sig genom en fysisk sorteringsmekanism int
© jsonscraper · AI-genererad illustration

För team som bygger sök- och RAG-system är slutsatsen viktig när indexering och användarförfrågningar planeras: antalet anrop beskriver i sig inte beräkningsarbetet särskilt väl. Ett dokumentpaket för generering av embeddingar kan kräva mer resurser än många korta sökförfrågningar.

Varför förfrågningar per minut kan vara missvisande

Embeddingar omvandlar texter till numeriska representationer som söksystem använder för semantisk matchning. Vid den första indexeringen av en katalog kan programmet skicka stora paket med beskrivningar; vid vanlig sökning får modellen en kort söktext. Uppgifterna har olika krav: batchbearbetning bedöms vanligtvis utifrån genomströmning och kostnad, medan sökning bedöms utifrån svarstiden för användaren.

För Rerank spelar ytterligare en parameter roll: hur många kandidater systemet skickar till modellen för omrangordning. I Cohere-exemplet matchas en kort förfrågan mot 50 dokument; företaget uppskattar att detta motsvarar omkring 11 000 token. Fler kandidater ökar arbetsmängden, även om frekvensen av användarnas sökningar är oförändrad.

Vad Cohere-beräkningarna visar

Artikeln anger ungefärliga brytpunkter för när det kan bli ekonomiskt fördelaktigt att gå från förbrukningsbaserad prissättning till dedikerad kapacitet: omkring 20 förfrågningar per minut för batchindexering av 100 texter på cirka 200 token vardera, omkring fyra för längre dokument och omkring 29 för det angivna Rerank-scenariot. För embeddingar av korta sökfrågor uppskattar författarna tröskeln till tiotusentals förfrågningar per minut.

ett svartvitt foto av ett kök
Hoseung Han · Unsplash-licensen

Beräkningarna bygger på specifika antaganden: ett dedikerat NVIDIA A10-grafikkort, drift med full belastning dygnet runt, angivna förfrågningsstorlekar och publicerade priser. Cohere förklarar också att diagram och tröskelvärden ändras med drifttid, hårdvarukonfiguration, rabatter och dokumentvolym. De bör ses som en illustration av beräkningsmetoden, inte som universella riktvärden.

Själva urvalslogiken är dock tillämplig även utanför de specifika exemplen. En förutsägbar, kontinuerlig belastning kan utnyttja reserverad kapacitet bättre; korta belastningstoppar med långa perioder av inaktivitet passar ofta bättre för betalning efter faktisk förbrukning. För interaktiv sökning bör man också kontrollera svarstiden vid förväntad belastning: utrustningens maximala genomströmning garanterar inte önskad svarstid i drift.

Så tillämpar du genomgången på din söklösning

Mät några saker med verklig trafik innan du jämför alternativen: token och dokument per förfrågan, storleken på indexeringspaketen, antalet kandidater som ska omrangordnas, topparnas varaktighet och målet för svarstid. Beräkna sedan kostnaden utifrån det faktiska belastningsmönstret, inte bara det genomsnittliga antalet förfrågningar. För en fullständig bild bör du jämföra aktuella priser och villkor för driftsättning med Cohere-prissidan: dedikerade modeller och förbrukningsbaserad bearbetning prissätts på olika sätt.

För blandad sökning är det klokt att bedöma stegen var för sig: bakgrundsindexering av katalogen, korta användarförfrågningar och omrangordning av kandidater. En sådan beräkning hjälper till att avgöra om en gemensam infrastruktur är motiverad eller om olika delar av pipelinen bör använda olika driftsätt. Cohere-publicationens praktiska slutsats är enkel: mät först arbetet som varje förfrågan innebär och välj sedan betalnings- och resursmodell.

Keep readingGoogle öppnar SynthID Detector för kontroll av bilder, video och ljud
Read the next article

Gör det du läser till en fungerande integration

Utforska jsonscrapers API:er för social data, testa anrop och bygg nästa arbetsflöde.

Utforska API:er