ב־6 באוקטובר פתחה Mistral תצוגה מקדימה ציבורית של API עבור Mistral Large 4. מפתחים יכולים כבר לבדוק את המודל דרך Mistral Studio, והחברה מתכננת לפרסם את המשקולות בסוף אוקטובר. נכון ל־7 באוקטובר אפשר להעריך את המודל דרך API; עדיין אי אפשר להוריד את המשקולות שלו. הסטטוס הזה חשוב בבחירה בין בדיקה מהירה בשירות לבין פריסה עצמאית.
מה זמין למפתחים כעת
הרשומה ביומן השינויים של Mistral מאשרת את התצוגה המקדימה הציבורית וכן הנחה זמנית של 50% למשך שבועיים עם ההשקה. דף המודל מפרט תמיכה בקלט רב־מודאלי, קריאה לפונקציות, פלט מובנה, עיבוד באצוות וכלים לסוכנים. כך יכולים מפתחים לבדוק את המודל במשימות שלהם באמצעות API, לפני קבלת החלטה על פריסה.
בדף, נכון למועד הבדיקה, מופיעים מחירים של 0.68 דולר למיליון טוקני קלט, 0.07 דולר למיליון טוקני קלט שנשמרו במטמון, ו־2.09 דולר למיליון טוקני פלט. לצדם מצוינים התעריפים הרגילים, הגבוהים פי שניים: ההנחה קשורה להשקה ומוגבלת בזמן. לפני חישוב התקציב כדאי לבדוק את התעריפים ישירות בתיעוד של Mistral.
המפרטים אינם תואמים זה לזה
Mistral מתארת את Large 4 כארכיטקטורת Mixture of Experts רב־מודאלית. בתיעוד מצוינים 1.05 טריליון פרמטרים בסך הכול ו־52 מיליארד פעילים; בהכרזת החברה מצוינים טריליון אחד ו־49 מיליארד פעילים. המקורות אינם מסבירים מדוע הערכים שונים. לכן מדויק יותר להציג את שתי הגרסאות ולציין את מקורן, במקום לאחד אותן למספר אחד.
בתיעוד מצוין חלון הקשר של מיליון טוקנים. כשמתכננים בקשות ארוכות, כדאי לאמת את המפרט הזה בגרסת ה־API שבה משתמשים: ייתכן שמאפייני התצוגה המקדימה יתעדכנו עם עדכון התיעוד.
מדדי הביצועים מתארים משימות נפרדות
Mistral מדווחת על תוצאות של 61.7% ב־DeepSWE v1.1, של 28.3% ב־Terminal-Bench 4 ושל 59.9% ב־AutomationBench. אלה תוצאות שהחברה עצמה פרסמה עבור מבחנים מסוימים: בהתאמה, משימות פיתוח הכוללות התנהגות של סוכן, תהליכי עבודה בטרמינל ואוטומציה של תהליכים עסקיים. כדאי לראות בהן נקודות ייחוס לבחירת בדיקות, ולא מדד יחיד לאיכות המודל.
כדי לקבל החלטה מעשית, כדאי למפתחים לחזור על כמה משימות מייצגות מתוך הפרויקט שלהם: לתעד את גרסת המודל, את ההנחיות ואת ההגדרות, לבדוק את התוצאות באמצעות בדיקות ולהביא בחשבון את עלות הניסיונות החוזרים. בדיקה כזאת תראה עד כמה התוצאות שפורסמו רלוונטיות לקוד, למסמכים או לתהליך העבודה של הסוכן שלהם.
המשקולות הפתוחות הן השלב הבא
Mistral הצהירה שהיא מתכננת לפרסם את המשקולות עד סוף אוקטובר, לאחר בדיקות red-team נוספות. זהו תכנון עתידי של החברה; נכון למועד הפרסום, הדרך המאושרת להשתמש ב־Large 4 היא תצוגה מקדימה ציבורית דרך API. עבור צוותים שזקוקים לתשתית משלהם ולניהול עצמאי של המודל, האירוע המרכזי יהיה הפרסום בפועל של המשקולות ושל תנאי השימוש הנלווים.
בינתיים מפתחים יכולים לבדוק זמינות, תכונות ואיכות דרך API, ולדחות את ההחלטה על העברת המודל לסביבה שלהם עד לפרסום המשקולות. בשלב ההשקה, התוצאות השימושיות ביותר אינן טענות השוואתיות, אלא תוצאות של בדיקה ניתנת לשחזור במשימות העבודה ותנאי התמחור העדכניים.