שני שירותים עשויים לשלוח מספר זהה של בקשות למודל, אך ליצור עומסי עבודה שונים לחלוטין. במדריך של Cohere על Embed ו-Rerank, שפורסם ב־9 באוקטובר, החברה מציעה לבחור בעיבוד משותף או ייעודי לפי מאפייני הבקשות, דפוסי העומס ודרישות זמן ההשהיה. זהו ניתוח מעשי של תשתיות, ולא הכרזה על תעריף או מוצר חדש.

עבור צוותים הבונים חיפוש ו-RAG, המסקנה חשובה בתכנון אינדוקס ובקשות משתמשים: מספר הקריאות לבדו אינו מתאר היטב את היקף החישוב. אצווה אחת של מסמכים ליצירת embeddings עשויה לצרוך יותר משאבים ממספר רב של בקשות חיפוש קצרות.
למה מספר הבקשות בדקה עלול להטעות
Embeddings ממירים טקסטים לייצוגים מספריים, שבהם מערכת החיפוש משתמשת להתאמה סמנטית. במהלך האינדוקס הראשוני של קטלוג, היישום עשוי לשלוח אצוות גדולות של תיאורים; בחיפוש רגיל, המודל מקבל שאילתת טקסט קצרה. לצרכים האלה דרישות שונות: עיבוד אצוות נמדד בדרך כלל לפי תפוקה ועלות, ואילו חיפוש נמדד לפי זמן התגובה למשתמש.
ב-Rerank חשוב גם פרמטר נוסף: כמה מועמדים המערכת מעבירה למודל למיון מחדש. בדוגמה של Cohere, שאילתה קצרה נבדקת מול 50 מסמכים; החברה מעריכה שעיבוד כזה כרוך בכ־11 אלף טוקנים. הגדלת מספר המועמדים מגדילה את היקף העבודה, גם כשקצב החיפושים מצד המשתמשים נותר ללא שינוי.
מה מראים החישובים של Cohere
המאמר מציג נקודות מעבר כלכליות משוערות מתשלום לפי שימוש להספק ייעודי: כ־20 בקשות בדקה לאינדוקס אצוות של 100 טקסטים בני כ־200 טוקנים כל אחד, כארבע בקשות עבור מסמכים ארוכים יותר, וכ־29 עבור תרחיש ה-Rerank המתואר. עבור embeddings של שאילתות חיפוש קצרות, המחברים מעריכים את הסף בעשרות אלפי בקשות בדקה.
המספרים האלה חושבו על סמך הנחות מסוימות: כרטיס מסך ייעודי אחד מסוג NVIDIA A10, פעילות רציפה בתפוסה מלאה, גדלי הבקשות המצוינים והתעריפים שפורסמו. Cohere מבהירה בנפרד שהגרפים והספים משתנים בהתאם למשך הפעילות, לתצורת החומרה, להנחות ולכמות המסמכים. כדאי לראות בהם המחשה של שיטת חישוב, ולא אמות מידה אוניברסליות.
ההיגיון בבחירה רלוונטי גם מעבר לדוגמאות הספציפיות. עומס קבוע וצפוי עשוי לנצל טוב יותר הספק שמור; קפיצות קצרות המופרדות בתקופות השבתה ממושכות מתאימות לרוב לתשלום לפי צריכה בפועל. בחיפוש אינטראקטיבי צריך לבדוק גם את זמן ההשהיה תחת העומס הצפוי: תפוקת שיא של החומרה אינה מבטיחה את זמן התגובה הנדרש בתנאי עבודה.
איך ליישם את הניתוח בחיפוש שלכם
לפני השוואת האפשרויות, מדדו כמה נתונים בתעבורה אמיתית: טוקנים ומסמכים בכל בקשה, גודל אצוות האינדוקס, מספר המועמדים למיון מחדש, משך שיאי העומס וזמן ההשהיה הרצוי. לאחר מכן חשבו את העלות לפי לוח הזמנים בפועל, ולא רק לפי מספר הבקשות הממוצע. כדי לקבל תמונה מלאה, בדקו את התעריפים ואת תנאי האירוח העדכניים בדף התמחור של Cohere: מודל ייעודי ועיבוד לפי שימוש מתומחרים באופן שונה.
בחיפוש היברידי, הגיוני להעריך כל שלב בנפרד: אינדוקס מחדש ברקע של הקטלוג, בקשות משתמש קצרות ומיון מחדש של מועמדים. חישוב כזה עוזר לבדוק אם תשתית אחידה מוצדקת, או שעדיף להפעיל חלקים שונים בצינור באמצעות מודלים שונים של הקצאת משאבים. המסקנה המעשית של פרסום Cohere פשוטה: תחילה מדדו את העבודה שמייצרת כל בקשה, ורק אחר כך בחרו את שיטת התשלום והקצאת המשאבים.