ארבע התפתחויות מה־17 עד ה־23 בספטמבר 2026 מראות שמערך הסוכנים מתרחב מעבר למודלים: בקרות גישה, בדיקות אבטחה ודרכים למדוד מה הסוכנים עושים בפועל.
התקופה הנסקרת היא מ־17 בספטמבר ועד 23 בספטמבר 2026, כולל. ארבע הכרזות בולטות במיוחד למפתחים ולצוותים שבונים תהליכי עבודה אוטומטיים. המכנה המשותף מעשי: ככל שמערכות AI מקבלות על עצמן משימות ארוכות יותר או בעלות השלכות משמעותיות יותר, התשתיות שסביבן — מי מקבל גישה, איך בודקים פעולות והאם שינוי פוגע בביצועים — חשובות לא פחות מיכולות המודל.
17 בספטמבר: Anthropic פותחת תוכנית אימות לצוותים בתחום מדעי החיים
Anthropic הציגה את תוכנית האימות למדעי החיים, שמעניקה לארגונים מאומתים בתחום מדעי החיים גישה למודלים Mythos, Opus ו־Sonnet, תחת אמצעי הגנה שלדבריה מאפשרים גמישות רבה יותר בעבודה הקשורה לביולוגיה. התוכנית נמצאת בגרסת בטא ומיועדת תחילה לצוותים ולמוסדות. המועמדים נבחנים לפי הכישורים המחקריים שלהם, תקני האבטחה והפיקוח האתי שלהם; צוותים שאושרו יכולים להגיש בקשה לרמות גישה שונות. אפשר להשתמש בתוכנית דרך מוצרי Claude וה־API. (anthropic.com)
למה זה חשוב: זו דוגמה מוחשית לכך שהגישה נקבעת לפי המטרה המוצהרת של הארגון והבקרות שלו, ולא רק לפי בחירת המודל של המשתמש. למפתחים שבונים תהליכי עבודה ייעודיים של AI, השאלה רחבה יותר מ״האם המודל מסוגל לעשות זאת?״. צריך לשאול גם: ״מי מורשה להשתמש בו, תחת איזה פיקוח ובאילו אמצעי בקרה?״
Anthropic מציינת גם סיכונים כגון גישה שנפרצה ופעולות לא מכוונות של סוכנים הפועלים בנחילים או לאורך משימות ממושכות. לכן התוכנית רלוונטית גם מעבר לתחום מדעי החיים: היא ממחישה את אתגר הממשל שמופיע כשקריאת API הופכת לחלק ממערכת המסוגלת לבצע כמה צעדים. ההכרזה מתארת את גישת התוכנית, אך אינה מוכיחה עד כמה אמצעי ההגנה שלה יעבדו בקנה מידה גדול. (anthropic.com)
18 בספטמבר: Google מתארת סריקות אבטחה רציפות בסיוע סוכנים
צוות התשתיות של Google הציג גישה לבדיקת שינויי קוד באמצעות סוכני AI לפני הגשתם, במקום להסתמך רק על סריקות אבטחה גדולות המתבצעות מדי פעם. לפי תיאור המערכת, הסורקים משתמשים במטא־נתונים חיים של בסיס הקוד ובגרפי קריאות של תלויות כדי ליצור הקשר ממוקד יותר לאיומים. Google מדווחת שהמערכת מונעת מדי חודש ממאות פגיעויות להגיע לבסיס הקוד או לסביבת הייצור שלה, ומציינת שבמקרים מסוימים שיעור חיובי־השווא ירד ל־3%. אלה תוצאות שדווחו בידי החברה, ולא ביקורת עצמאית. (cloud.google.com)
הלקח המעשי אינו בהכרח לאמץ את היקף הפעילות של Google, אלא לחשוב מתי ואיפה להריץ בדיקות. בחינת כל שינוי קוד יכולה לספק לכלי אבטחה הקשר מצומצם יותר מסריקה של מערכת ענקית בבת אחת. Google אומרת שפיתחה לצורך העבודה את סביבת הבדיקה בקוד פתוח Mantis, ומדגישה מודלי איומים וסביבת בדיקה מרובת סוכנים כחלק מגישתה. צוותים ששוקלים תהליכי עבודה דומים צריכים להתייחס לתוצאות המדווחות כמחקר מקרה, ולא כהבטחה לביצועים: המאגרים, מודלי האיומים ותהליכי הבדיקה שלהם הם שיקבעו אם סריקה בסיוע סוכנים תזהה בעיות מועילות בלי להאט את הפיתוח. (cloud.google.com)
22 בספטמבר: AWS משיקה תהליך עבודה לניטור סוכני AI
AWS הכריזה על CloudWatch Omni, כלי לניטור, להערכה ולניסויים בעומסי עבודה של סוכנים. לפי AWS, צוותים יכולים לבדוק עקבות ביצוע, להשוות גרסאות של הנחיות, לבנות מערכי בדיקה מנתוני תעבורה בסביבת ייצור ולערוך ניסויים בין תצורות שונות. החברה מציינת תוספים ל־VS Code ול־Kiro עבור מפתחים, לצד ממשק אינטרנט נפרד למפעילים. (aws.amazon.com)
הכלי נועד להתמודד עם בעיה שמרכזי בקרה רגילים לזמינות עשויים להחמיץ: תהליך עבודה יכול להחזיר תשובות מוצלחות ובכל זאת להפוך לפחות שימושי לאחר שינוי בהנחיה, במודל או בכלי. AWS מציינת מעריכי ביצועים מובנים בתחומים כגון נכונות, קוהרנטיות, איכות אחזור ובחירת כלים. עבור צוותי הנדסה, השינוי החשוב הוא להתייחס לשינויים בסוכן כמו לשינויים בתוכנה: לתעד הרצות, להגדיר בדיקות ייעודיות למשימה ולחפש נסיגה בביצועים לפני הרחבת הפריסה.
תיאור ההשקה אינו מוכיח עד כמה המעריכים האלה יתאימו לצרכים של כל צוות. ציון נכונות כללי אינו תחליף לבדיקות ייעודיות לתחום, וניטור עקבות כשלעצמו אינו מראה שהפעולות של הסוכן היו מתאימות. הצוותים עדיין יצטרכו להחליט מה נחשב הצלחה בתהליך העבודה המסוים שלהם. (aws.amazon.com)
22 בספטמבר: Anthropic מציגה את Opus 5.5 גם דרך העלות, ולא רק היכולת
Anthropic הכריזה על Claude Opus 5.5, וטוענת שהוא מציג ביצועים ברמה של Claude Fable 5.1 ברוב המשימות, בעלות הפעלה נמוכה ב־40% מזו של Opus 5. החברה מציינת שהמודל זמין דרך הפלטפורמה שלה ומספר ספקי ענן, ומוסיפה שמפתחים יכולים לגשת אליו באמצעות Claude API. ההשוואות וטענות העלות האלה הן של Anthropic עצמה; יש לבחון אותן מול עומסי העבודה בפועל של כל צוות ולא לראות בהן חיסכון מובטח. (anthropic.com)
עבור מפתחי סוכנים, העלות לכל הרצה היא רק חלק אחד מהחישוב. השוואה מועילה צריכה לכלול הצלחה במשימה, זמן השהיה, ניסיונות חוזרים, קריאות לכלים וכמות התיקון האנושי הנדרשת. מודל שעולה פחות לכל טוקן לא בהכרח יפחית את העלות הכוללת של תהליך העבודה, אם הוא דורש יותר צעדים או עושה יותר טעויות שאפשר לתקן. ההכרזה היא סיבה להשוות בין חלופות, לא להעביר תעבורת ייצור בלי הערכה.
המסקנה: מערך הסוכנים הופך לאתגר תפעולי
ההכרזות האלה נוגעות בשכבות שונות: גישה מבוקרת לעבודה ייעודית, אבטחה בבדיקת קוד, ניטור סוכנים וכלכלת מודלים. יחד הן מצביעות על סדר עדיפויות מעשי למפתחים: להפוך את התנהגות הסוכנים לניתנת לבדיקה ולמדידה לפני שמגדילים את מידת העצמאות שלהם. הגדירו הרשאות מצומצמות, תעדו שימוש בכלים, העריכו משימות מייצגות והשוו שינויים במודלים לנקודת ייחוס.
עדיין לא ברור כיצד ההצעות האלה יפעלו בעומסי עבודה עצמאיים שונים. הכרזות השקה ותוצאות שמדווחות בידי ספקים הן סימנים מועילים, אך הן אינן תחליף לבדיקות של הצוות עצמו. עבור מפתחים, הצעד הבא פשוט: להתייחס לכל תהליך עבודה של סוכן כאל מערכת עם תוצאות מדידות — ולא כאל הנחיה שאפשר לסמוך עליה רק משום שהפיקה תשובה שנשמעת סבירה.