Zwei Dienste können gleich viele Anfragen an ein Modell senden und dennoch eine völlig unterschiedliche Last erzeugen. In einem am 9. Oktober veröffentlichten Leitfaden von Cohere zu Embed und Rerank empfiehlt das Unternehmen, die gemeinsame oder dedizierte Verarbeitung anhand der Anfrageprofile, des Lastverlaufs und der Latenzanforderungen auszuwählen. Es handelt sich um eine praktische Infrastrukturbetrachtung, nicht um die Ankündigung eines neuen Tarifs oder Produkts.

Für Teams, die Suche und RAG entwickeln, ist diese Erkenntnis bei der Planung der Indexierung und von Nutzeranfragen relevant: Die Zahl der Aufrufe allein bildet den Rechenaufwand nur unzureichend ab. Ein Dokumentenpaket für Embeddings kann mehr Ressourcen beanspruchen als zahlreiche kurze Suchanfragen.
Warum Anfragen pro Minute irreführend sein können
Embeddings wandeln Texte in numerische Repräsentationen um, die ein Suchsystem für den semantischen Abgleich verwendet. Bei der erstmaligen Indexierung eines Katalogs kann die Anwendung große Pakete mit Beschreibungen senden; bei einer gewöhnlichen Suche erhält das Modell einen kurzen Suchtext. Diese Aufgaben stellen unterschiedliche Anforderungen: Bei der Stapelverarbeitung sind üblicherweise Durchsatz und Kosten ausschlaggebend, bei der Suche die Antwortzeit für Nutzerinnen und Nutzer.
Bei Rerank spielt noch ein weiterer Parameter eine Rolle: Wie viele Kandidaten das System dem Modell zum erneuten Sortieren übergibt. Im Beispiel von Cohere wird eine kurze Anfrage mit 50 Dokumenten abgeglichen; das Unternehmen schätzt den Verarbeitungsaufwand auf rund 11.000 Tokens. Eine höhere Kandidatenzahl vergrößert den Arbeitsaufwand, auch wenn die Häufigkeit der Nutzersuchen gleich bleibt.
Was die Berechnungen von Cohere zeigen
Der Artikel nennt ungefähre Schwellenwerte für den wirtschaftlichen Wechsel von verbrauchsabhängiger Abrechnung zu dedizierter Kapazität: rund 20 Anfragen pro Minute für die Stapelindexierung von 100 Texten mit jeweils etwa 200 Tokens, rund vier für längere Dokumente und rund 29 für das angegebene Rerank-Szenario. Für kurze Such-Embeddings schätzen die Autorinnen und Autoren den Schwellenwert auf Zehntausende Anfragen pro Minute.
Diese Zahlen beruhen auf konkreten Annahmen: einer dedizierten NVIDIA-A10-GPU, einem rund um die Uhr laufenden Betrieb unter Volllast, den angegebenen Anfragegrößen und den veröffentlichten Preisen. Cohere weist außerdem darauf hin, dass sich Diagramme und Schwellenwerte bei einer anderen Betriebsdauer, Hardwarekonfiguration, Rabatten oder einem anderen Dokumentenumfang verändern. Die Zahlen sind als Veranschaulichung der Berechnungsmethode zu verstehen, nicht als allgemeingültige Richtwerte.
Die Entscheidungslogik lässt sich jedoch auch über die konkreten Beispiele hinaus anwenden. Eine vorhersehbare, dauerhafte Last kann reservierte Kapazität besser auslasten; kurze Spitzen mit längeren Leerlaufzeiten eignen sich häufig eher für eine Abrechnung nach tatsächlichem Verbrauch. Bei interaktiver Suche sollte zudem die Latenz unter der erwarteten Last geprüft werden: Der maximale Durchsatz einer Hardware garantiert im Betrieb nicht die gewünschte Antwortzeit.
So wenden Sie die Analyse auf Ihre Suche an
Bevor Sie die Optionen vergleichen, messen Sie anhand des tatsächlichen Datenverkehrs mehrere Größen: Tokens und Dokumente pro Anfrage, Umfang der Indexierungspakete, Kandidaten für die erneute Sortierung, Dauer der Spitzen und angestrebte Latenz. Berechnen Sie anschließend die Kosten anhand des tatsächlichen Lastverlaufs und nicht nur anhand der durchschnittlichen Anfragenzahl. Für ein vollständiges Bild sollten Sie die aktuellen Preise und Bereitstellungsbedingungen auf der Preisseite von Cohere prüfen: Dedizierte Modelle und verbrauchsabhängige Verarbeitung werden unterschiedlich abgerechnet.
Bei einer gemischten Suche ist es sinnvoll, die einzelnen Schritte getrennt zu bewerten: die Hintergrund-Neuindexierung des Katalogs, kurze Nutzeranfragen und das erneute Sortieren von Kandidaten. Eine solche Berechnung hilft zu prüfen, ob eine einheitliche Infrastruktur sinnvoll ist oder ob verschiedene Teile der Verarbeitungskette mit unterschiedlichen Bereitstellungsmodellen günstiger bedient werden. Das praktische Fazit der Veröffentlichung von Cohere ist einfach: Messen Sie zunächst den Arbeitsaufwand je Anfrage und wählen Sie erst danach Abrechnungsmodell und Ressourcenzuteilung.