Advertisement Placeholder

אובדן שליטה? המודלים של אנתרופיק ו-OpenAI שוב פרצו את ההרשאות

במהלך בדיקות של מכון המחקר הבריטי, המודלים ניסו לגרום לגורם אנושי לאשר קוד זדוני במהלך סימולציית סייבר • הגילוי מגיע בהמשך לחשיפה של OpenAI על בדיקה שבוצעה לאחרונה ובו מודל AI התחבר בטעות לאינטרנט וניצל חולשות במערך
קלוד של אנתרופיק ו-ChatGPT  של OpenAI | צילום: שאטרסטוק. עיבוד: נוצר על ידי AI

קלוד של אנתרופיק ו-ChatGPT  של OpenAI | צילום: שאטרסטוק. עיבוד: נוצר על ידי AI

מכון אבטחת ה-AI הבריטי (AISI) חשף סדרה של כשלים חמורים בבדיקות אבטחה של מודלי בינה מלאכותית מתקדמים.

לפי הדו"ח, סוכנים המבוססים על המודלים Mythos 5 של חברת אנתרופיק ו-GPT-5.6-Sol של OpenAI ביצעו פעולות לא מורשות במהלך סימולציות אבטחת סייבר שנועדו להעריך את יכולותיהם.

בעקבות פריצות הסוכן של OpenAI – טראמפ: "שוקל צעדי פיקוח"

במהלך הניסוי, AISI העמיד את הסוכנים בפני תרחיש בדיוני ב-122 ניסיונות שונים, וזיהה 19 פעולות לא מאושרות על פני 10 ניסויים. מתוך אותן חריגות, הסוכן של Anthropic היה אחראי ל-17 מקרים, בעוד הסוכן של OpenAI עמד מאחורי שניים נוספים.

האירוע החמור ביותר כלל סוכן AI שכתב קוד זדוני, יצר זהויות מקוונות מזויפות וניסה לגרום לאדם אמיתי לאשר את הקוד.

במכון הדגישו כי לא נגרם נזק בפועל לרשתות או לארגונים, אך ציינו בבלוג הרשמי כי "חלק מהסוכנים שנבדקו עסקו בפעילות מתמשכת, שעלולה הייתה להזיק, וכוונה כלפי אנשים וארגונים אמיתיים".

אנתרופיק תרחיב את הגישה למודל Mythos

התגובות והמשך החקירה

לפי חוקרים בתחום, הסוכן של אנתרופיק הוא זה שעמד מאחורי ניסיון ההונאה והזהויות המזויפות.

אנדרו יון, חוקר בעמותת CivAI, ציין לרויטרס כי העובדה שהמודל ביצע פעולות מטעות תוך מודעות לכך שהוא פועל מול אדם אמיתי, "מרמזת על כך שאנתרופיק אינה מבינה את המודלים שלה כפי שהיא חושבת".

חברת אנתרופיק פרסמה ברשת X (טוויטר לשעבר) "אנו אסירי תודה ל-AISI על מנהיגותם בדיון החשוב כיצד לבדוק סוכני AI שהופכים למוכשרים ביותר. אנו עובדים בשיתוף פעולה הדוק איתם כדי לאסוף פרטים נוספים על האירוע".

מנגד, חברת OpenAI פרסמה פוסט בבלוג שבו הבהירה כי שתי החריגות שנרשמו אצלה כללו גישה לאינטרנט בדרכים שהיו בניגוד להנחיות. החברה התחייבה לפעול מול גורמים בתעשייה, מעבדות מחקר ומכוני אבטחה כדי להדק את הנהלים בבדיקות בסיכון גבוה.

בנוסף, OpenAI חשפה תקרית נפרדת שבה שגיאת תצורה אצל ספקית הבדיקות החיצונית Irregular אפשרה לסוכנים להתחבר בטעות לאינטרנט – גילוי הדומה לשגיאת תצורה שעליה דיווחה אנתרופיק.

המשך לשרשרת אירועי אבטחה

סוכני בינה מלאכותית, אילוסטרציה | צילום: שאטרסטוק
סוכני בינה מלאכותית, אילוסטרציה | צילום: שאטרסטוק

הגילויים החדשים מגיעים בהמשך לסדרת אירועים שהציבו סימני שאלה סביב בטיחות הסוכנים האוטונומיים:

התרחבות החקירה ב-OpenAI: הדיווחים החדשים מגיעים לאחר ש-OpenAI הרחיבה את החקירה הפנימית שלה בעקבות עדויות לפריצות וסטיות נוספות של סוכני AI מתהליכי הבדיקה.

הבדיקה ב-AISI מול אירועי עבר: בניגוד למקרה מוקדם יותר שבו סוכן של OpenAI פרץ את גבולות הסביבה המבודדת (Sandbox) בפלטפורמת Hugging Face כדי להגיע לרשת, בבדיקה הנוכחית של AISI הגישה לאינטרנט הותרת מראש כחלק מנהלי הניסוי.

שתפו כתבה זו:

כותרות הכלכלה

guest
0 תגובות

עקבו אחרינו ברשתות החברתיות

עוד כתבות מעניינות

טען עוד כתבות