jsonscraper

Mistral Large 4 זמינה כעת דרך API — משקולות פתוחות צפויות בהמשך

התצוגה המקדימה הציבורית החלה ב־6 באוקטובר. הנה מה שאפשר לבדוק כעת ואילו מפרטים עדיין אינם תואמים.

ב־6 באוקטובר פתחה Mistral תצוגה מקדימה ציבורית של API עבור Mistral Large 4. מפתחים יכולים כבר לבדוק את המודל דרך Mistral Studio, והחברה מתכננת לפרסם את המשקולות בסוף אוקטובר. נכון ל־7 באוקטובר אפשר להעריך את המודל דרך API; עדיין אי אפשר להוריד את המשקולות שלו. הסטטוס הזה חשוב בבחירה בין בדיקה מהירה בשירות לבין פריסה עצמאית.

בניין גבוה עם חלונות רבים לצד רחוב
Shabeeba Ameen · רישיון Unsplash

מה זמין למפתחים כעת

הרשומה ביומן השינויים של Mistral מאשרת את התצוגה המקדימה הציבורית וכן הנחה זמנית של 50% למשך שבועיים עם ההשקה. דף המודל מפרט תמיכה בקלט רב־מודאלי, קריאה לפונקציות, פלט מובנה, עיבוד באצוות וכלים לסוכנים. כך יכולים מפתחים לבדוק את המודל במשימות שלהם באמצעות API, לפני קבלת החלטה על פריסה.

בדף, נכון למועד הבדיקה, מופיעים מחירים של 0.68 דולר למיליון טוקני קלט, 0.07 דולר למיליון טוקני קלט שנשמרו במטמון, ו־2.09 דולר למיליון טוקני פלט. לצדם מצוינים התעריפים הרגילים, הגבוהים פי שניים: ההנחה קשורה להשקה ומוגבלת בזמן. לפני חישוב התקציב כדאי לבדוק את התעריפים ישירות בתיעוד של Mistral.

המפרטים אינם תואמים זה לזה

Mistral מתארת את Large 4 כארכיטקטורת Mixture of Experts רב־מודאלית. בתיעוד מצוינים 1.05 טריליון פרמטרים בסך הכול ו־52 מיליארד פעילים; בהכרזת החברה מצוינים טריליון אחד ו־49 מיליארד פעילים. המקורות אינם מסבירים מדוע הערכים שונים. לכן מדויק יותר להציג את שתי הגרסאות ולציין את מקורן, במקום לאחד אותן למספר אחד.

בתיעוד מצוין חלון הקשר של מיליון טוקנים. כשמתכננים בקשות ארוכות, כדאי לאמת את המפרט הזה בגרסת ה־API שבה משתמשים: ייתכן שמאפייני התצוגה המקדימה יתעדכנו עם עדכון התיעוד.

כל יצירה אדריכלית שאינה מבטאת שלווה היא טעות
Ashish Mehta · רישיון Unsplash

מדדי הביצועים מתארים משימות נפרדות

Mistral מדווחת על תוצאות של 61.7% ב־DeepSWE v1.1, של 28.3% ב־Terminal-Bench 4 ושל 59.9% ב־AutomationBench. אלה תוצאות שהחברה עצמה פרסמה עבור מבחנים מסוימים: בהתאמה, משימות פיתוח הכוללות התנהגות של סוכן, תהליכי עבודה בטרמינל ואוטומציה של תהליכים עסקיים. כדאי לראות בהן נקודות ייחוס לבחירת בדיקות, ולא מדד יחיד לאיכות המודל.

כדי לקבל החלטה מעשית, כדאי למפתחים לחזור על כמה משימות מייצגות מתוך הפרויקט שלהם: לתעד את גרסת המודל, את ההנחיות ואת ההגדרות, לבדוק את התוצאות באמצעות בדיקות ולהביא בחשבון את עלות הניסיונות החוזרים. בדיקה כזאת תראה עד כמה התוצאות שפורסמו רלוונטיות לקוד, למסמכים או לתהליך העבודה של הסוכן שלהם.

המשקולות הפתוחות הן השלב הבא

Mistral הצהירה שהיא מתכננת לפרסם את המשקולות עד סוף אוקטובר, לאחר בדיקות red-team נוספות. זהו תכנון עתידי של החברה; נכון למועד הפרסום, הדרך המאושרת להשתמש ב־Large 4 היא תצוגה מקדימה ציבורית דרך API. עבור צוותים שזקוקים לתשתית משלהם ולניהול עצמאי של המודל, האירוע המרכזי יהיה הפרסום בפועל של המשקולות ושל תנאי השימוש הנלווים.

בינתיים מפתחים יכולים לבדוק זמינות, תכונות ואיכות דרך API, ולדחות את ההחלטה על העברת המודל לסביבה שלהם עד לפרסום המשקולות. בשלב ההשקה, התוצאות השימושיות ביותר אינן טענות השוואתיות, אלא תוצאות של בדיקה ניתנת לשחזור במשימות העבודה ותנאי התמחור העדכניים.

Keep readingGitHub משיקה את ReviewBench: סוקרי קוד מבוססי AI יושוו לפי הבאגים שהם מוצאים
Read the next article

כתבות קשורות

Breaking News · חדשות

GitHub משיקה את ReviewBench: סוקרי קוד מבוססי AI יושוו לפי הבאגים שהם מוצאים

ב־5 באוקטובר הציגה GitHub את ReviewBench — גרסת תצוגה מוקדמת למחקר של מדד לסוכנים שבודקים קוד. המדדים שלו מבחינים בין בעיות שהתגלו, בעיות שלא זוהו והערות מיותרות; תוצאות מבחן ה־A/B הפנימי של החברה מתארות ניסוי מסוים ולא דירוג כללי של מודלים.

הפכו את מה שקראתם לאינטגרציה עובדת

גלו את ממשקי ה-API לנתונים חברתיים של jsonscraper, בדקו בקשות ובנו את תהליך העבודה הבא.

גלה API