חברת OpenAI הודיעה כי אינה יכולה לשלול את האפשרות שלמודל ה-AI העתידי שלה, Astra, יש יכולות סייבר "קריטיות", מה שגרם לחברת הסטארט-אפ להשהות חלק מהפיתוח הפנימי ולהפעיל פרוטוקולי אבטחה.
תחת הנחיות הבטיחות של OpenAI, מודל מגיע לסף "קריטי" אם הוא מסוגל לזהות ולנצל באופן עצמאי חולשות תוכנה חמורות בעולם האמיתי, המכונות כ"פריצות יום אפס", או לבצע מתקפות סייבר מורכבות נגד יעדים מאובטחים ברמה גבוהה ללא התערבות אנושית.
אובדן שליטה? המודלים של אנתרופיק ו-OpenAI שוב פרצו את ההרשאות
רקע
הצעד מגיע בהמשך לדיווח רויטרס, לפיו OpenAI חשפה מקרים בהם סוכנים אוטונומיים "ברחו" מסביבת הבדיקה שלהם, בזמן שהחברה הרחיבה את החקירה בנוגע לאירוע הפריצה בפלטפורמת ה-AI העולמית Hugging Face, שמשך תשומת לב בחודש שעבר.
בשבועות האחרונים, אנתרופיק, מטא ו-OpenAI כי מודלי ה-AI שלהן פרצו למערכות של חברות אחרות במהלך בדיקות סייבר, נתון המדגיש כיצד היכולות המתקדמות של ה-AI מקשות על המפתחים לשמור על בקרת המערכות.
הערכות ראשוניות שבוצעו בימים האחרונים, הצביעו על כך ש-Astra עשויה לבצע משימות סייבר מתוחכמות יותר ויותר, באופן עצמאי. כך מסרה OpenAI.
OpenAI כתבה בבלוג שלה כי "ההערכות הראשוניות שלנו מצביעות על ביצועים חזקים מספיק כך שאיננו יכולים לשלול ברמה זו כרגע רמת יכולת 'קריטית'". בתגובה לממצאים הראשוניים, החברה הגבירה את בקרות האבטחה והשהתה פיתוחים פנימיים ב-Astra שלא עמדו בדרישות החדשות.
הצעדים הבאים
המשך הפיתוח של Astra יועבר לסביבות בדיקה מבודדות עם גישת רשת מוגבלת והרצה בסביבת "ארגז חול".
מנכ"ל החברה, סם אלטמן, כתב ברשת X כי OpenAI עובדת על מנת להפוך את Astra לזמין לציבור הרחב, מכיוון שהחברה "אינה מאמינה שאסטרטגיה נכונה היא להותיר מודלים עוצמתיים בידיהם של מעטים בלבד".
astra is a powerful model and we are working to make it generally available.
we do not think it is a good strategy to keep powerful models to a chosen few.
given its cyber capabilities, we need a little big longer to do do this safely. but hopefully not too long!
— Sam Altman (@sama) August 7, 2026
כמו כן, ב-OpenAI הבהירו כי Astra לא היה מעורב במתקפת הסייבר שכוונתה נגד Hugging Face. לבסוף, החברה ציינה כי היא תשתף פעולה עם סוכנויות ממשלתיות וארגוני בטיחות של בינה מלאכותית נבחרים כדי לבחון את יכולות המודל.