Advertisement Placeholder

אנתרופיק מודה: מודלי ה-AI השיגו גישה לא מורשית למערכות של ארגונים

אנתרופיק גילתה 3 מקרים שבהם במהלך ניסוי פנימי, חלק ממודלי ה-AI השיגו גישה לא מורשית למערכות האמיתיות של ארגונים שונים • הבדיקה הגיעה בעקבות אירועים דומים שנחשפו בחברת OpenAI
קלוד של אנתרופיק | צילום: שאטרסטוק

קלוד של אנתרופיק | צילום: שאטרסטוק

אתמול (חמישי) ענקית ה-AI האמריקאית אנתרופיק פרסמה בהודעה רשמית של החברה כי במהלך ניסוי פנימי, חלק ממודלי ה-AI שלה השיגו גישה לא מורשית למערכות אמיתיות של ארגונים אחרים.

אנתרופיק גילתה 3 מקרים שבהם מודלי קלוד התחברו לאינטרנט במהלך ניסוי והשיגו גישה לא מורשית למערכות של 3 ארגונים שונים. כלומר, המודלים לא רק פעלו בתוך סביבת ניסוי, אלא הגיעו בטעות למחשבים אמיתיים והצליחו להיכנס אליהם.

החברה פרסמה כי היא "מעודדת גם מעבדות וחברות אחרות לבצע בדיקות דומות".

קלוד של אנתרופיק | צילום: רויטרס
קלוד של אנתרופיק | צילום: רויטרס

החברה אמרה כי היא חזרה לבדוק ניסויים שנעשו בעבר וגילתה את האירועים החריגים הללו לאחר בדיקה מקיפה שביצעה של כל מבחני אבטחת הסייבר שלה.

ההודעה מגיעה לאחר שבשבוע שעבר OpenAI חשפה תקלה דומה, ואנתרופיק החליטה לבדוק אם גם אצלה קרו מקרים כאלה. אצל OpenAI המודלים הצליחו לעקוף את מגבלות סביבת הבדיקה באמצעות פרצות אבטחה והצליחו לגשת ל-Hugging Face, שמפעילה פלטפורמת קוד פתוח למפתחים.

בשלושת המקרים שהתגלו, המודל "חשב" שאין לו אינטרנט, אך בעקבות אי-הבנה בינה לבין שותפת הבדיקות, Irregular, למעשה הייתה למודל גישה לאינטרנט. כלומר, בפועל כן היה חיבור, ולכן הצליח להגיע לאתרים ולמערכות אמיתיות.

OpenAI | צילום: שאטרסטוק
OpenAI | צילום: שאטרסטוק

אנתרופיק לא חשפה את השמות של שלושת הארגונים.

מסתמן כי לא היה צורך בפריצות מורכבות מדי, מכיוון שהיו מערכות שמוגנות בצורה חלשה בגלל נקודות קצה שלא דורשות הזדהות וסיסמאות חלשות.

בהודעה שפרסמה החברה, היא לא האשימה את שותפת הבדיקות אלא לקחה אחריות מיידית תוך הבטחה ללמוד מהאירועים. לדבריה: "בסופו של דבר היו גורמים רבים שתרמו לאירועים האלה, אבל בהתאם לתרבות שלנו של למידה ללא האשמה, אנחנו מתייחסים לתיקון הבעיות כאילו האחריות היא שלנו בלבד".

החשש כעת הוא שככל שמודלי ה-AI נעשים חכמים יותר, הם עלולים להיות מסוגלים לבצע מתקפות סייבר מורכבות יותר. שתי הענקיות האמריקאיות, אנתרופיק ו-OpenAI, הזהירו בחודשים האחרונים שהמודלים שלהן משתפרים במהירות בתחום הסייבר.

במקביל, לאחר אירוע האבטחה שנחשף ב-OpenAI, שני חברי קונגרס בארצות הברית הציעו חוק בשם AI Kill Switch Act. החוק יחייב חברות להחזיק ביכולת לכבות את המודל, להאט אותו ולהשעות אותו. מדובר ברעיון שדומה ל"כפתור חירום" שמאפשר לעצור מערכת AI אם היא יוצאת משליטה.

בינה מלאכותית, אילוסטרציה | קרדיט: Treecha, שאטרסטוק
בינה מלאכותית, אילוסטרציה | קרדיט: Treecha, שאטרסטוק

באירוע האבטחה של אנתרופיק, שלושת המודלים Opus 4.7, Mythos 5 ומודל מחקר פנימי היו מעורבים. Mythos 5, שהושק בחודש יוני, נחשב כאמור לאחד ממודלי ה-AI החזקים ביותר של החברה בתחום אבטחת הסייבר.

מעניין שהמודלים הבינו בשלב מסוים שהם הגיעו למערכות אמיתיות וקיבלו החלטות שונות לחלוטין. Opus 4.7 המשיך בניסיון החדירה, Mythos 5 שכנע את עצמו שהוא עדיין נמצא בסימולציה, ומודל המחקר הפסיק מיד את הפעילות.

כרגע אין מספיק נתונים כדי לקבוע שמודל חזק יותר הוא בהכרח בטוח יותר. החברה אמרה כי "הדפוס מצביע על כך שמודלים מתקדמים יותר מגיבים בצורה נכונה יותר, אך נדרש עוד מחקר כדי להיות בטוחים בכך".

קלוד של אנתרופיק ו-ChatGPT  של OpenAI | צילום: שאטרסטוק. עיבוד: נוצר על ידי AI
קלוד של אנתרופיק ו-ChatGPT  של OpenAI | צילום: שאטרסטוק. עיבוד: נוצר על ידי AI

במקרה הזה מדובר בסביבת ניסוי מיוחדת שנועדה לבדוק את היכולות האמיתיות של המודל, ולכן חלק ממנגנוני ההגנה הושבתו. כעת, אנתרופיק עצרה את כל הניסויים עד שתבין בדיוק מה קרה וכיצד למנוע הישנות של מקרים דומים.

על מנת לחקור את האירועים, אנתרופיק עובדת עם METR, גוף שמבצע הערכות עצמאיות של מערכות AI.

שתפו כתבה זו:

כותרות הכלכלה

guest
0 תגובות

עקבו אחרינו ברשתות החברתיות

עוד כתבות מעניינות

טען עוד כתבות