Dos servicios pueden enviar el mismo número de solicitudes a un modelo y, aun así, generar cargas muy distintas. En una guía de Cohere sobre Embed y Rerank publicada el 9 de octubre, la empresa propone elegir entre procesamiento compartido o dedicado en función del formato de las solicitudes, el calendario de carga y los requisitos de latencia. Es un análisis práctico de infraestructura, no el anuncio de una nueva tarifa o producto.

Para los equipos que desarrollan sistemas de búsqueda y RAG, esta conclusión importa al planificar la indexación y las consultas de los usuarios: el número de llamadas por sí solo describe mal el volumen de cálculo. Un lote de documentos para generar embeddings puede consumir más recursos que muchas consultas de búsqueda breves.
Por qué las solicitudes por minuto pueden inducir a error
Los embeddings convierten textos en representaciones numéricas que el sistema de búsqueda utiliza para establecer coincidencias semánticas. Durante la indexación inicial de un catálogo, una aplicación puede enviar grandes lotes de descripciones; en una búsqueda habitual, el modelo recibe una consulta breve. Estas tareas tienen requisitos distintos: la evaluación del procesamiento por lotes suele centrarse en el rendimiento y el coste, mientras que en la búsqueda importa el tiempo de respuesta para el usuario.
En Rerank también importa otro parámetro: cuántos candidatos envía el sistema al modelo para que los vuelva a ordenar. En el ejemplo de Cohere, una consulta breve se compara con 50 documentos; la empresa calcula que ese procesamiento requiere unos 11.000 tokens. Aumentar el número de candidatos amplía el volumen de trabajo, aunque la frecuencia de las búsquedas de los usuarios no cambie.
Qué muestran los cálculos de Cohere
El artículo ofrece puntos de referencia aproximados para pasar del pago por consumo a la capacidad dedicada: unas 20 solicitudes por minuto para indexar por lotes 100 textos de unos 200 tokens cada uno, alrededor de cuatro para documentos más largos y cerca de 29 para el escenario de Rerank descrito. Para embeddings de consultas de búsqueda breves, los autores estiman que el umbral se sitúa en decenas de miles de solicitudes por minuto.
Estas cifras se basan en supuestos concretos: una GPU NVIDIA A10 dedicada, funcionamiento a plena capacidad las 24 horas, los tamaños de solicitud indicados y las tarifas publicadas. Cohere aclara que los gráficos y los umbrales cambian según las horas de operación, la configuración del equipo, los descuentos y el volumen de documentos. Conviene considerar estos valores una ilustración del método de cálculo, no parámetros universales.
La lógica para elegir una opción es aplicable más allá de los ejemplos concretos. Una carga constante y predecible puede aprovechar mejor la capacidad reservada; los picos breves seguidos de largos periodos de inactividad suelen encajar mejor con el pago por consumo. En la búsqueda interactiva también hay que comprobar la latencia con la carga prevista: el rendimiento máximo del equipo no garantiza el tiempo de respuesta deseado durante el funcionamiento normal.
Cómo aplicar el análisis a tu sistema de búsqueda
Antes de comparar opciones, mide varios aspectos con tráfico real: tokens y documentos por solicitud, tamaño de los lotes de indexación, candidatos que se vuelven a ordenar, duración de los picos y latencia objetivo. Después, calcula el coste según el calendario real, no solo el número medio de solicitudes. Para obtener una visión completa, consulta las tarifas y condiciones de despliegue vigentes en la página de precios de Cohere: los modelos dedicados y el procesamiento por consumo tienen estructuras de precios distintas.
En una búsqueda mixta, resulta razonable evaluar por separado cada etapa: la reindexación en segundo plano del catálogo, las consultas breves de los usuarios y la reordenación de candidatos. Este cálculo permite comprobar si conviene una infraestructura única o si es más rentable atender distintas partes del flujo de trabajo con diferentes modelos de despliegue. La conclusión práctica de la publicación de Cohere es sencilla: primero mide el trabajo que implica cada solicitud y, solo entonces, elige cómo pagar y asignar los recursos.