חברת OpenAI הודיעה כי היא מתכננת להשיק בקרוב את מודל הבינה המלאכותית החדש שלה, Astra, אך תגביל את הגישה ליכולות הסייבר המתקדמות ביותר שלו. בשלב הראשון, יכולות אלו יהיו זמינות רק לקבוצה מצומצמת של בודקים, בשל רמת היכולות החריגה של המודל בתחום הסייבר.
החברה הגדירה את Astra כמודל הראשון שלה שהגיע לרמת "סיכון סייבר קריטי" במסגרת מסגרת ההיערכות והבטיחות שלה. המודל מסוגל לאתר חולשות אבטחה שלא היו מוכרות קודם לכן, המכונות Zero-Day, ולפתח דרכים לנצל אותן גם במערכות שמוגנות ברמה גבוהה, ללא צורך בהנחיה אנושית בכל שלב.

מדוע הוחלט להגביל את המודל?
במהלך הבדיקות, Astra הצליח לזהות ולשרשר שתי חולשות Zero-Day, ו-OpenAI מסרה כי היא נמצאת בתהליך דיווח עליהן למפתחים ולגורמים האחראים. עבודת הבטיחות הנוספת שנעשתה לקראת ההשקה נועדה להתמודד עם החשש שמשתמשים ינצלו את המודל לפעילות זדונית, או שהמודל עצמו יבצע פעולות לא מורשות באופן עצמאי.
עוד באותו הנושא
במסגרת ההגנות החדשות, החברה אימנה את המודל לסרב באופן אמין יותר לבקשות סייבר מזיקות, להקפיד על מגבלות בטיחות ולזהות פעילות שעלולה להיות בלתי מורשית. עם זאת, בחברה מזהירים כי מנגנוני ההגנה עלולים לעיתים לזהות בטעות פעילות לגיטימית כפעילות הקשורה לשימוש לרעה בסייבר, דבר שיוביל לעיכוב או עצירת משימות.

כיצד יושפעו המשתמשים הלגיטימיים?
בשימוש ב-ChatGPT וב-Codex המשתמשים עשויים להתבקש לבחון פעולה שסומנה כחשודה, בעוד שבשימוש דרך ה-API המשימה עשויה להיעצר באופן אוטומטי. ההחלטה להגביל את יכולות הסייבר של Astra צפויה להשפיע גם על חברות, ארגונים ורשויות שמעוניינים להשתמש ביכולות אלו כדי לאתר ולתקן חולשות במערכות שלהם.
ב-OpenAI מודים כי קיימת דילמה, שכן אותן יכולות שיכולות לסייע למגינים לאתר ולסגור פרצות אבטחה משמעותיות עלולות להפוך גם את התוקפים ליעילים יותר. מטרת החברה היא למנוע מצב שבו השיפור ביכולות הסייבר של מערכות AI יאפשר לתוקפים לבצע מתקפות מורכבות יותר, במיוחד כשהמודלים מסוגלים לפעול בעצמאות גוברת.

הגרסה של Astra שתהיה זמינה לציבור הרחב צפויה לצאת בקרוב, אך לא נמסר מועד מדויק להשקה. בעקבות אירוע קודם שבו נחשפו חולשות בתהליך הבדיקה, עצרה OpenAI חלק מאימוני הדור הבא של המודלים, כולל אלו של Astra, כדי לחזק את מנגנוני הבידוד, הניטור והבקרה שלה.