Två tjänster kan skicka lika många förfrågningar till en modell men skapa helt olika belastning. I Cohere-guiden om Embed och Rerank, som publicerades den 9 oktober, föreslår företaget att valet mellan delad och dedikerad inferens görs utifrån förfrågningarnas form, belastningsmönstret och kraven på svarstid. Det är en praktisk genomgång av infrastruktur, inte en lansering av en ny prisplan eller produkt.

För team som bygger sök- och RAG-system är slutsatsen viktig när indexering och användarförfrågningar planeras: antalet anrop beskriver i sig inte beräkningsarbetet särskilt väl. Ett dokumentpaket för generering av embeddingar kan kräva mer resurser än många korta sökförfrågningar.
Varför förfrågningar per minut kan vara missvisande
Embeddingar omvandlar texter till numeriska representationer som söksystem använder för semantisk matchning. Vid den första indexeringen av en katalog kan programmet skicka stora paket med beskrivningar; vid vanlig sökning får modellen en kort söktext. Uppgifterna har olika krav: batchbearbetning bedöms vanligtvis utifrån genomströmning och kostnad, medan sökning bedöms utifrån svarstiden för användaren.
För Rerank spelar ytterligare en parameter roll: hur många kandidater systemet skickar till modellen för omrangordning. I Cohere-exemplet matchas en kort förfrågan mot 50 dokument; företaget uppskattar att detta motsvarar omkring 11 000 token. Fler kandidater ökar arbetsmängden, även om frekvensen av användarnas sökningar är oförändrad.
Vad Cohere-beräkningarna visar
Artikeln anger ungefärliga brytpunkter för när det kan bli ekonomiskt fördelaktigt att gå från förbrukningsbaserad prissättning till dedikerad kapacitet: omkring 20 förfrågningar per minut för batchindexering av 100 texter på cirka 200 token vardera, omkring fyra för längre dokument och omkring 29 för det angivna Rerank-scenariot. För embeddingar av korta sökfrågor uppskattar författarna tröskeln till tiotusentals förfrågningar per minut.
Beräkningarna bygger på specifika antaganden: ett dedikerat NVIDIA A10-grafikkort, drift med full belastning dygnet runt, angivna förfrågningsstorlekar och publicerade priser. Cohere förklarar också att diagram och tröskelvärden ändras med drifttid, hårdvarukonfiguration, rabatter och dokumentvolym. De bör ses som en illustration av beräkningsmetoden, inte som universella riktvärden.
Själva urvalslogiken är dock tillämplig även utanför de specifika exemplen. En förutsägbar, kontinuerlig belastning kan utnyttja reserverad kapacitet bättre; korta belastningstoppar med långa perioder av inaktivitet passar ofta bättre för betalning efter faktisk förbrukning. För interaktiv sökning bör man också kontrollera svarstiden vid förväntad belastning: utrustningens maximala genomströmning garanterar inte önskad svarstid i drift.
Så tillämpar du genomgången på din söklösning
Mät några saker med verklig trafik innan du jämför alternativen: token och dokument per förfrågan, storleken på indexeringspaketen, antalet kandidater som ska omrangordnas, topparnas varaktighet och målet för svarstid. Beräkna sedan kostnaden utifrån det faktiska belastningsmönstret, inte bara det genomsnittliga antalet förfrågningar. För en fullständig bild bör du jämföra aktuella priser och villkor för driftsättning med Cohere-prissidan: dedikerade modeller och förbrukningsbaserad bearbetning prissätts på olika sätt.
För blandad sökning är det klokt att bedöma stegen var för sig: bakgrundsindexering av katalogen, korta användarförfrågningar och omrangordning av kandidater. En sådan beräkning hjälper till att avgöra om en gemensam infrastruktur är motiverad eller om olika delar av pipelinen bör använda olika driftsätt. Cohere-publicationens praktiska slutsats är enkel: mät först arbetet som varje förfrågan innebär och välj sedan betalnings- och resursmodell.