אתמול (חמישי) ענקית ה-AI האמריקאית אנתרופיק פרסמה בהודעה רשמית של החברה כי במהלך ניסוי פנימי, חלק ממודלי ה-AI שלה השיגו גישה לא מורשית למערכות אמיתיות של ארגונים אחרים.
אנתרופיק גילתה 3 מקרים שבהם מודלי קלוד התחברו לאינטרנט במהלך ניסוי והשיגו גישה לא מורשית למערכות של 3 ארגונים שונים. כלומר, המודלים לא רק פעלו בתוך סביבת ניסוי, אלא הגיעו בטעות למחשבים אמיתיים והצליחו להיכנס אליהם.
החברה פרסמה כי היא "מעודדת גם מעבדות וחברות אחרות לבצע בדיקות דומות".
עוד באותו הנושא

החברה אמרה כי היא חזרה לבדוק ניסויים שנעשו בעבר וגילתה את האירועים החריגים הללו לאחר בדיקה מקיפה שביצעה של כל מבחני אבטחת הסייבר שלה.
ההודעה מגיעה לאחר שבשבוע שעבר OpenAI חשפה תקלה דומה, ואנתרופיק החליטה לבדוק אם גם אצלה קרו מקרים כאלה. אצל OpenAI המודלים הצליחו לעקוף את מגבלות סביבת הבדיקה באמצעות פרצות אבטחה והצליחו לגשת ל-Hugging Face, שמפעילה פלטפורמת קוד פתוח למפתחים.
בשלושת המקרים שהתגלו, המודל "חשב" שאין לו אינטרנט, אך בעקבות אי-הבנה בינה לבין שותפת הבדיקות, Irregular, למעשה הייתה למודל גישה לאינטרנט. כלומר, בפועל כן היה חיבור, ולכן הצליח להגיע לאתרים ולמערכות אמיתיות.

אנתרופיק לא חשפה את השמות של שלושת הארגונים.
מסתמן כי לא היה צורך בפריצות מורכבות מדי, מכיוון שהיו מערכות שמוגנות בצורה חלשה בגלל נקודות קצה שלא דורשות הזדהות וסיסמאות חלשות.
בהודעה שפרסמה החברה, היא לא האשימה את שותפת הבדיקות אלא לקחה אחריות מיידית תוך הבטחה ללמוד מהאירועים. לדבריה: "בסופו של דבר היו גורמים רבים שתרמו לאירועים האלה, אבל בהתאם לתרבות שלנו של למידה ללא האשמה, אנחנו מתייחסים לתיקון הבעיות כאילו האחריות היא שלנו בלבד".
החשש כעת הוא שככל שמודלי ה-AI נעשים חכמים יותר, הם עלולים להיות מסוגלים לבצע מתקפות סייבר מורכבות יותר. שתי הענקיות האמריקאיות, אנתרופיק ו-OpenAI, הזהירו בחודשים האחרונים שהמודלים שלהן משתפרים במהירות בתחום הסייבר.
במקביל, לאחר אירוע האבטחה שנחשף ב-OpenAI, שני חברי קונגרס בארצות הברית הציעו חוק בשם AI Kill Switch Act. החוק יחייב חברות להחזיק ביכולת לכבות את המודל, להאט אותו ולהשעות אותו. מדובר ברעיון שדומה ל"כפתור חירום" שמאפשר לעצור מערכת AI אם היא יוצאת משליטה.

באירוע האבטחה של אנתרופיק, שלושת המודלים Opus 4.7, Mythos 5 ומודל מחקר פנימי היו מעורבים. Mythos 5, שהושק בחודש יוני, נחשב כאמור לאחד ממודלי ה-AI החזקים ביותר של החברה בתחום אבטחת הסייבר.
מעניין שהמודלים הבינו בשלב מסוים שהם הגיעו למערכות אמיתיות וקיבלו החלטות שונות לחלוטין. Opus 4.7 המשיך בניסיון החדירה, Mythos 5 שכנע את עצמו שהוא עדיין נמצא בסימולציה, ומודל המחקר הפסיק מיד את הפעילות.
כרגע אין מספיק נתונים כדי לקבוע שמודל חזק יותר הוא בהכרח בטוח יותר. החברה אמרה כי "הדפוס מצביע על כך שמודלים מתקדמים יותר מגיבים בצורה נכונה יותר, אך נדרש עוד מחקר כדי להיות בטוחים בכך".

במקרה הזה מדובר בסביבת ניסוי מיוחדת שנועדה לבדוק את היכולות האמיתיות של המודל, ולכן חלק ממנגנוני ההגנה הושבתו. כעת, אנתרופיק עצרה את כל הניסויים עד שתבין בדיוק מה קרה וכיצד למנוע הישנות של מקרים דומים.
על מנת לחקור את האירועים, אנתרופיק עובדת עם METR, גוף שמבצע הערכות עצמאיות של מערכות AI.