Deux services peuvent envoyer le même nombre de requêtes à un modèle tout en générant des charges de travail très différentes. Dans son guide sur Embed et Rerank, publié le 9 octobre, Cohere propose de choisir entre traitement partagé et dédié selon la forme des requêtes, le rythme de la charge et les exigences de latence. Il s’agit d’une analyse pratique de l’infrastructure, et non de l’annonce d’un nouveau tarif ou produit.

Pour les équipes qui développent des systèmes de recherche et de RAG, cette conclusion compte dans la planification de l’indexation et des requêtes des utilisateurs : le nombre d’appels ne décrit pas à lui seul le volume de calculs. Un lot de documents destiné à la génération d’embeddings peut consommer davantage de ressources que de nombreuses requêtes de recherche courtes.
Pourquoi le nombre de requêtes par minute peut induire en erreur
Les embeddings convertissent les textes en représentations numériques qu’un moteur de recherche utilise pour effectuer des correspondances sémantiques. Lors de l’indexation initiale d’un catalogue, l’application peut envoyer de grands lots de descriptions ; en recherche courante, le modèle reçoit un texte de requête court. Ces tâches ont des exigences différentes : le traitement par lots s’évalue généralement en fonction du débit et du coût, tandis que la recherche dépend du temps de réponse présenté à l’utilisateur.
Pour Rerank, un autre paramètre est déterminant : le nombre de résultats candidats transmis au modèle pour être reclassés. Dans l’exemple de Cohere, une requête courte est comparée à 50 documents ; l’entreprise estime que ce traitement représente environ 11 000 jetons. Augmenter le nombre de candidats accroît le volume de travail, même si la fréquence des recherches des utilisateurs reste inchangée.
Ce que montrent les calculs de Cohere
L’article présente des seuils indicatifs de rentabilité pour passer de la facturation à l’usage à une capacité dédiée : environ 20 requêtes par minute pour indexer par lots 100 textes d’environ 200 jetons chacun, environ quatre pour des documents plus longs, et environ 29 pour le scénario Rerank indiqué. Pour les embeddings de recherche courts, les auteurs estiment le seuil à plusieurs dizaines de milliers de requêtes par minute.
Ces chiffres reposent sur des hypothèses précises : une carte graphique NVIDIA A10 dédiée, une utilisation à pleine capacité 24 heures sur 24, les tailles de requête indiquées et les tarifs publiés. Cohere précise que les graphiques et les seuils varient selon la durée d’utilisation, la configuration matérielle, les remises et le volume de documents. Il vaut mieux les considérer comme une illustration de la méthode de calcul que comme des références universelles.
La logique de choix s’applique toutefois au-delà de ces exemples précis. Une charge constante et prévisible peut mieux exploiter une capacité réservée ; les pics courts séparés par de longues périodes d’inactivité se prêtent souvent davantage à la facturation à l’usage. Pour la recherche interactive, il faut aussi vérifier la latence sous la charge attendue : le débit maximal du matériel ne garantit pas le temps de réponse requis en conditions réelles.
Comment appliquer cette analyse à votre système de recherche
Avant de comparer les options, mesurez plusieurs paramètres sur le trafic réel : le nombre de jetons et de documents par requête, la taille des lots d’indexation, le nombre de candidats à reclasser, la durée des pics et la latence visée. Calculez ensuite le coût en fonction du calendrier réel, et pas seulement du nombre moyen de requêtes. Pour avoir une vue complète, vérifiez les tarifs et les conditions d’hébergement en vigueur sur la page des tarifs de Cohere : les modèles dédiés et le traitement à l’usage ne sont pas facturés de la même façon.
Pour une recherche mixte, il est judicieux d’évaluer séparément les différentes étapes : la réindexation en arrière-plan du catalogue, les courtes requêtes des utilisateurs et le reclassement des candidats. Ce calcul permet de déterminer si une infrastructure unique est justifiée ou s’il est plus économique de faire fonctionner les différentes parties du pipeline selon des modèles d’hébergement distincts. La conclusion pratique de l’article de Cohere est simple : mesurez d’abord le travail associé à chaque requête, puis choisissez le mode de facturation et d’allocation des ressources.