מכון אבטחת ה-AI הבריטי (AISI) חשף סדרה של כשלים חמורים בבדיקות אבטחה של מודלי בינה מלאכותית מתקדמים.
לפי הדו"ח, סוכנים המבוססים על המודלים Mythos 5 של חברת אנתרופיק ו-GPT-5.6-Sol של OpenAI ביצעו פעולות לא מורשות במהלך סימולציות אבטחת סייבר שנועדו להעריך את יכולותיהם.
בעקבות פריצות הסוכן של OpenAI – טראמפ: "שוקל צעדי פיקוח"
במהלך הניסוי, AISI העמיד את הסוכנים בפני תרחיש בדיוני ב-122 ניסיונות שונים, וזיהה 19 פעולות לא מאושרות על פני 10 ניסויים. מתוך אותן חריגות, הסוכן של Anthropic היה אחראי ל-17 מקרים, בעוד הסוכן של OpenAI עמד מאחורי שניים נוספים.
האירוע החמור ביותר כלל סוכן AI שכתב קוד זדוני, יצר זהויות מקוונות מזויפות וניסה לגרום לאדם אמיתי לאשר את הקוד.
במכון הדגישו כי לא נגרם נזק בפועל לרשתות או לארגונים, אך ציינו בבלוג הרשמי כי "חלק מהסוכנים שנבדקו עסקו בפעילות מתמשכת, שעלולה הייתה להזיק, וכוונה כלפי אנשים וארגונים אמיתיים".
התגובות והמשך החקירה
לפי חוקרים בתחום, הסוכן של אנתרופיק הוא זה שעמד מאחורי ניסיון ההונאה והזהויות המזויפות.
אנדרו יון, חוקר בעמותת CivAI, ציין לרויטרס כי העובדה שהמודל ביצע פעולות מטעות תוך מודעות לכך שהוא פועל מול אדם אמיתי, "מרמזת על כך שאנתרופיק אינה מבינה את המודלים שלה כפי שהיא חושבת".
חברת אנתרופיק פרסמה ברשת X (טוויטר לשעבר) "אנו אסירי תודה ל-AISI על מנהיגותם בדיון החשוב כיצד לבדוק סוכני AI שהופכים למוכשרים ביותר. אנו עובדים בשיתוף פעולה הדוק איתם כדי לאסוף פרטים נוספים על האירוע".
The UK’s @AISecurityInst (AISI) has published a report on their recent cybersecurity evaluation of Anthropic’s Claude Mythos 5 and OpenAI’s GPT-5.6 Sol. The models attempted to complete an assignment in a setup where their normal safeguards were removed and they were deliberately…
— Anthropic (@AnthropicAI) August 4, 2026
מנגד, חברת OpenAI פרסמה פוסט בבלוג שבו הבהירה כי שתי החריגות שנרשמו אצלה כללו גישה לאינטרנט בדרכים שהיו בניגוד להנחיות. החברה התחייבה לפעול מול גורמים בתעשייה, מעבדות מחקר ומכוני אבטחה כדי להדק את הנהלים בבדיקות בסיכון גבוה.
בנוסף, OpenAI חשפה תקרית נפרדת שבה שגיאת תצורה אצל ספקית הבדיקות החיצונית Irregular אפשרה לסוכנים להתחבר בטעות לאינטרנט – גילוי הדומה לשגיאת תצורה שעליה דיווחה אנתרופיק.
המשך לשרשרת אירועי אבטחה

הגילויים החדשים מגיעים בהמשך לסדרת אירועים שהציבו סימני שאלה סביב בטיחות הסוכנים האוטונומיים:
התרחבות החקירה ב-OpenAI: הדיווחים החדשים מגיעים לאחר ש-OpenAI הרחיבה את החקירה הפנימית שלה בעקבות עדויות לפריצות וסטיות נוספות של סוכני AI מתהליכי הבדיקה.
הבדיקה ב-AISI מול אירועי עבר: בניגוד למקרה מוקדם יותר שבו סוכן של OpenAI פרץ את גבולות הסביבה המבודדת (Sandbox) בפלטפורמת Hugging Face כדי להגיע לרשת, בבדיקה הנוכחית של AISI הגישה לאינטרנט הותרת מראש כחלק מנהלי הניסוי.