Два сервиса могут отправлять одинаковое число запросов к модели, но создавать совершенно разную нагрузку. В опубликованном 9 октября руководстве Cohere по Embed и Rerank компания предлагает выбирать общую или выделенную обработку по форме запросов, расписанию нагрузки и требованиям к задержке. Это практический разбор инфраструктуры, а не анонс нового тарифа или продукта.

Для команд, строящих поиск и RAG, вывод важен при планировании индексации и пользовательских запросов: число вызовов само по себе плохо описывает объём вычислений. Один пакет документов для эмбеддингов может занимать больше ресурсов, чем множество коротких поисковых запросов.
Почему запросы в минуту вводят в заблуждение
Эмбеддинги переводят тексты в числовые представления, которые поисковая система использует для семантического сопоставления. При первоначальной индексации каталога приложение может отправлять большие пакеты описаний; при обычном поиске модель получает короткий текст запроса. У этих задач разные требования: пакетную обработку обычно оценивают по пропускной способности и стоимости, а поиск — по времени ответа пользователю.
Для Rerank существенен ещё один параметр: сколько кандидатов система передаёт модели для пересортировки. В примере Cohere короткий запрос сопоставляется с 50 документами; компания оценивает такую обработку примерно в 11 тысяч токенов. Увеличение числа кандидатов расширяет объём работы, даже когда частота пользовательских поисков остаётся прежней.
Что показывают расчёты Cohere
В статье приведены ориентировочные точки экономического перехода от оплаты по потреблению к выделенной мощности: около 20 запросов в минуту для пакетной индексации 100 текстов примерно по 200 токенов, около четырёх — для более длинных документов и около 29 — для указанного сценария Rerank. Для коротких поисковых эмбеддингов авторы оценивают порог как десятки тысяч запросов в минуту.
Эти числа рассчитаны для конкретных предположений: одной выделенной видеокарты NVIDIA A10, работы на полной загрузке круглосуточно, указанных размеров запросов и опубликованных тарифов. Cohere отдельно поясняет, что графики и пороги меняются при другой продолжительности работы, конфигурации оборудования, скидках и объёме документов. Их полезно воспринимать как иллюстрацию метода расчёта, а не как универсальные нормативы.
Логика выбора при этом применима шире конкретных примеров. Предсказуемая постоянная нагрузка может лучше использовать зарезервированную мощность; короткие всплески с длительными простоями чаще подходят для оплаты по фактическому потреблению. Для интерактивного поиска нужно также проверить задержку при ожидаемой нагрузке: максимальная пропускная способность оборудования не гарантирует нужного времени ответа в рабочем режиме.
Как применить разбор к своему поиску
Перед сравнением вариантов измерьте несколько вещей на реальном трафике: токены и документы на запрос, размер пакетов индексации, кандидатов на пересортировку, продолжительность пиков и целевую задержку. Затем посчитайте стоимость при фактическом расписании, а не только при среднем числе запросов. Для полной картины сверьте текущие ставки и условия размещения с страницей тарифов Cohere: выделенная модель и обработка по потреблению тарифицируются по-разному.
Для смешанного поиска разумно оценивать этапы отдельно: фоновую переиндексацию каталога, короткие пользовательские запросы и пересортировку кандидатов. Такой расчёт помогает проверить, оправдана ли единая инфраструктура или разные части конвейера выгоднее обслуживать по разным моделям размещения. Практический итог публикации Cohere прост: сначала измерьте работу, которую несёт каждый запрос, и только затем выбирайте способ оплаты и выделения ресурсов.