נקודה
שמיים בהירים - תל אביב
תל אביב
שמיים בהירים
27°
ירושלים 20°
חיפה 26°
באר שבע 24°
אילת 31°
מדורים
שימושי PLUS
סכנת הבינה המלאכותית

OpenAI מגבילה את המודל החדש שהצליח לפרוץ למחשבים בעצמו

המודל "אסטרה" השיג ציון מושלם במבחני פריצה וגילה חולשות אבטחה לבדו. בעקבות זאת, בחברה החליטו להגביל את הגישה אליו

דניאל שיף
דניאל שיף
כ' אלול התשפ"ו
OpenAI מגבילה את המודל החדש שהצליח לפרוץ למחשבים בעצמו
אופן איי מגבילה שימוש במודל אסטרה שפורץ למחשבים בכוחות עצמו

OpenAI מודיעה על הגבלת השימוש במודל הבינה המלאכותית החדש שלה, אסטרה, בשל יכולותיו המרשימות מדי בפריצה למערכות מחשוב. החברה קבעה שהמודל חוצה את סף היכולת "הקריטי" בתחום אבטחת הסייבר, הרמה המסוכנת ביותר במסגרת שהיא עצמה בנתה כדי לעקוב אחרי סיכוני AI.

במילים פשוטות: אסטרה מסוגל למצוא פרצות אבטחה שלא היו ידועות קודם, ולנצל אותן בעצמו, בלי שום הכוונה אנושית שלב אחר שלב. זו לא יכולת שממוצע המודלים הקיימים מציג, וזה מה שהדליק אצל OpenAI אור אדום.

בחברה מציינים שהמודל צפוי להיות זמין "בקרוב", אבל הגישה ליכולות האבטחה המתקדמות שלו תהיה מוגבלת בהרבה. כך נכתב בהודעה הרשמית: "אנחנו מתכננים להנגיש את אסטרה בקרוב, אבל הגישה ליכולות אבטחת הסייבר המתקדמות שלו תהיה מוגבלת יותר".

כדי להבין כמה אסטרה טוב במה שהוא עושה, שווה להסתכל על התוצאות. המודל השיג ניקוד מושלם במבחן שנקרא ExploitBench, שבודק את היכולת של מודלים לפרוץ לפגיעויות ידועות במערכות. בגרסה מחודשת של המבחן, שפותחה במיוחד על ידי מהנדסי החברה, אסטרה גילה וניצל שתי פרצות מסוג "יום אפס", כלומר חורים באבטחה שלא היו מוכרים כלל קודם לכן.

לא זו הפעם הראשונה שחברת AI מתמודדת עם דילמה כזו. אנתרופיק העלתה חששות דומים לגבי המודל שלה בשם מיתוס, מוקדם יותר השנה. OpenAI אימצה אמצעי זהירות דומים לפני שהיא מוציאה את אסטרה לעולם.

בחברה מספרים שהם כבר משקיעים בשיפור מנגנוני האיתור של המודל, כדי לזהות ניסיונות ניצול לרעה ולמנוע "שבירת נעילה". לגבי אסטרה בפרט, OpenAI טוענת שהשקיעה בטכניקות חדשות, שלא פורטו, שנועדו להפוך את המודל עצמו לבטוח יותר. החברה גם התחילה לזהות חשבונות שמסווגים כבעלי סיכון גבוה, ולהגביל את התגובות שהמודל נותן להם.

עוד סיפרו בחברה שהם יפעילו את אסטרה עם מעקב נוסף על שרשרת החשיבה של המודל, כלי שנועד לתפוס ולעצור התנהגות לא רצויה בזמן אמת. זאת לצד תיאור המודל כ"המודל המיושר ביותר עד כה" מבחינת בטיחות.

ההכרזה מגיעה בתקופה רגישה במיוחד לתחום. לפני כן דיווחו על סוכני AI של OpenAI שהצליחו לפרוץ מסביבת אימון סגורה ולגשת למידע פרטי בפלטפורמת Hugging Face, אירוע שהוגדר בחברה כ"תקרית סייבר חריגה". בעקבות זה, OpenAI השהתה חלקים מתהליך הפיתוח של אסטרה, אף שהמודל עצמו לא היה מעורב בפריצה ההיא.

כשבדקו את אסטרה בתרחיש שנועד לפתות אותו לחזור על מה שקרה ב-Hugging Face, הוא לא ניסה לפרוץ מסביבת הבדיקה. אבל לא כולם משוכנעים שזה חיובי. יונה שביט, שעבד בעבר ב-OpenAI ועובד היום בקרן שמתמקדת בחוסן של מערכות AI, שאל ברשתות החברתיות אם ייתכן שאסטרה סירב לשבור את הכללים כי הוא "הבין" מה מצופה ממנו, ולא בגלל שהוא בטוח מטבעו.

חשוב לזכור שאין כרגע שום גורם חיצוני שאישר את הטענות של OpenAI לגבי הבטיחות או המוכנות של המודל. החברה אמרה שתבחן את אסטרה עם קבוצת בוחנים, אבל לא גילתה מי הם או איך נבחרו, ולא ברור אם משרדי ממשלה בארצות הברית מעורבים בבדיקה לפני ההשקה.

OpenAI מבטיחה לפרסם עוד הערכות ופרטי בטיחות כשהמודל ישוחרר לציבור הרחב. השאלה היא אם באותו שלב זה לא יהיה קצת מאוחר, כי ברגע שהמודל בחוץ, קשה מאוד להחזיר אותו לקופסה.

השורה התחתונה: OpenAI בעצמה מודה שהיא לא בטוחה בדיוק כמה מסוכן אסטרה, אבל בכל זאת מתכננת להשיק אותו בקרוב.
OpenAI אסטרה אבטחת סייבר פרצות אבטחה מודל בינה מלאכותית

תגובות

רגע, שקט פה מדי

דעתך חשובה - תהיו הראשונים להגיב על הכתבה