jsonscraper

GitHub משיקה את ReviewBench: סוקרי קוד מבוססי AI יושוו לפי הבאגים שהם מוצאים

המדד בוחן את הכיסוי והדיוק של הערות על pull request; מערך הנתונים שלו כולל 219 PR ציבוריים ב־19 שפות.

סוקר קוד מבוסס AI יכול להשאיר עשרות הערות ועדיין לפספס באג חשוב לקראת השקה. ב־5 באוקטובר 2026 הציגה GitHub את ReviewBench — גרסת תצוגה מוקדמת למחקר של מדד המשווה בין סוכנים לפי הבעיות שהם מוצאים, הבעיות שהם מפספסים ודיוק ההערות שלהם.

אדם מתכנת עם MacBook Pro
Danial Igdery · רישיון Unsplash

מבחינת מפתחים, השינוי החשוב כאן הוא מעבר מספירת הערות לבדיקת התוכן שלהן. המדד משווה את הפלט של הסוכן למערך ייחוס של בעיות ב־pull request, ומתחשב בנפרד בחומרת הממצאים ובקטגוריה שלהם.

מה בדיוק ReviewBench מעריך

המערך כולל 219 pull request ציבוריים מ־187 מאגרים בעלי קוד ברישיון פתוח, וב־19 שפות תכנות. GitHub מדווחת כי בעת בניית המאגר ניתחה את ההתפלגות של יותר מ־103.9 מיליון PR. גודלי המאגרים והשפות נבחרו בהתחשב במדגם הכללי של GitHub, ואילו גודל השינויים הוטה במכוון לעבר PR משמעותיים יותר שמתאימים לבדיקה.

לכל PR נשמרות הערות ייחוס המסומנות לפי חומרה וקטגוריה — למשל, נכונות, אבטחה, אמינות, תחזוקתיות ובדיקות. ReviewBench מחשב דיוק: איזה חלק מהערות הסוכן תואם לבעיות אמיתיות; וכיסוי: איזה חלק מהבעיות הידועות הסוכן זיהה. מדד Fβ מאפשר לשנות את המשקל היחסי של שני הקריטריונים: משקל גבוה יותר לכיסוי מתאים לחיפוש אחר מספר רב יותר של בעיות, ואילו משקל גבוה יותר לדיוק מתאים לצמצום הערות הרעש.

איך לקרוא את המספרים של GitHub

בפרסום מצוין שיעור הסכמה של 96.6% בין התיוג ב־ReviewBench לבין בדיקה חוזרת עצמאית של מהנדסים בכירים. זהו מדד להתאמה בין הערכות מומחים של ממצאי הייחוס, ולא מדד לדיוק של סוכן AI כלשהו.

בנפרד, GitHub תיארה מבחן A/B פנימי של אנסמבל מודלים עבור Copilot code review. לפי החברה, בהשוואה לקבוצת הביקורת, שיעור ההערות שבעקבותיהן בוצעו שינויי קוד מתאימים עלה ב־8.0%, הכיסוי עלה ב־13.6%, נפח ההערות עלה ב־61%, ועלות הסקירה ירדה ב־8.0%. אלה תוצאות של ניסוי אחד שערכה GitHub; הן אינן הערכה של כלל הסוכנים או הבטחה להשפעה דומה בצוותים אחרים.

אדם מקליד מול מסך של מחשב נייד
Giorgio Tomassetti · רישיון Unsplash

הפרדת המדדים שימושית במיוחד כשצוות בוחר את הגדרות הסקירה. נפח גדול של הערות עשוי לבוא לצד עלייה במספר הממצאים המועילים, אך כשלעצמו הוא אינו מראה כמה מהן אומתו. ReviewBench מחלק גם את התוצאות לפי חומרה וקטגוריות, כדי שצוות יוכל לבחון בנפרד, למשל, באגים קריטיים או סוגיות אבטחה.

איך לנסות את המדד

לפי התיאור של GitHub, גרסת התצוגה המוקדמת למחקר מאפשרת לעיין במערך הנתונים המלא, להשוות בין תוצאות שפורסמו ולהריץ סוכן משלכם. הרצה ראשונית כוללת 25 PR; הרצה מלאה מקיפה 219 PR בשלושה סבבים. המשתתף מספק תמונת קונטיינר, תצורה ומפתח מודל משלו, וההערכה מתבצעת בעזרת מעריך משותף. התוצאות נשארות פרטיות עד לבדיקת ההגשה ואישורה.

המטרה המעשית של הרצה כזאת היא לקבל נקודת ייחוס שאפשר להשוות אליה, ואז לבדוק את המערכת מול כללי הסקירה של הצוות ושינויים אופייניים למאגר שלו. התנאים בצוות מסוים — שפות, ארכיטקטורה, ספי חומרה ורמת הרעש המותרת — עשויים להיות שונים מהרכב המערך הכללי.

GitHub טוענת כי בניסויים שלה, השינויים בהערכות הלא־מקוונות של ReviewBench תאמו בכיוונם לתוצאות בסביבת הייצור. המדידות שפורסמו מתייחסות למבחנים שערכה החברה עצמה. לכן, השימוש האמין ביותר במדד בשלב זה הוא להשוואת סוכנים על מערך משותף ולאבחון נקודות החוזק שלהם; את ההחלטה על הטמעה כדאי לבסס גם על בדיקה בתהליך העבודה של הצוות המסוים.

Keep readingGPT-Rosalind: התעריף נכנס לתוקף, אך ה-API אינו פתוח לכולם
Read the next article

כתבות קשורות

הפכו את מה שקראתם לאינטגרציה עובדת

גלו את ממשקי ה-API לנתונים חברתיים של jsonscraper, בדקו בקשות ובנו את תהליך העבודה הבא.

גלה API