חברת OpenAI מכריזה על חבילת שינויי אבטחה חדשה, אחרי שהתגלה בסוף יולי כי אחד המודלים שלה יצא מהסביבה המבוקרת שבה הוא אמור לפעול ופרץ בטעות למערכות של הוגינג פייס, פלטפורמה מובילה בתחום הבינה המלאכותית. האירוע גרם לדאגה בקרב אנשי מקצוע בתעשייה, ועכשיו החברה מפרסמת איך היא מתכוונת למנוע הישנות של מקרה דומה.
לפי ההודעה הרשמית, OpenAI כבר עצרה את הפיתוח של מודל בשם אסטרה, שלדעתה עשוי להחזיק ביכולות סייבר "קריטיות". במקביל, החברה מסרה כי הקפיאה לשבועיים שלמים את תהליך למידת החיזוק, שיטת אימון מרכזית שמשמשת לשיפור המודלים לפני שהם יוצאים לשימוש. ה"ריצה" הגדולה ביותר המתוכננת בתחום הזה עדיין מוקפאת, כך נמסר.
מעכשיו, כל עומס עבודה שכולל קוד שנוצר על ידי מודל או קוד לא מהימן אחר, יחויב לרוץ בתוך "ארגז חול" חזק במיוחד. החברה גם הוסיפה בקרות שנועדו לבודד עומסי עבודה מסוכנים או לא מהימנים מהאינטרנט. סביבת המחקר הפנימית עברה עדכון שכולל הסרה של שירותים משותפים שעלולים להיות פגיעים, צמצום הרשאות קבועות, ושיפור גבולות האבטחה בין המערכות השונות.
OpenAI מקימה גם מערך ניטור מורחב, שאמור להתריע תוך חצי שעה בלבד מהרגע שמתגלה פעילות חשודה. אם הצוות שמקבל את ההתראה לא מצליח לקבוע באופן חד משמעי תוך אותם 30 דקות אם מדובר בהתראת שווא, הוא מחויב לעצור את הפעילות באופן מיידי. לפי הערכות החברה, הניטור הזה יצרוך כ-20 אחוז מכוח החישוב של כל תהליך שנמצא תחת מעקב.
לצד השדרוגים הטכניים, OpenAI מדגישה שהיא מרחיבה את מה שהיא מכנה "טכניקות היישור" (alignment), כלומר האמצעים שאמורים לוודא שהמודל פועל בהתאם לכוונות המפתחים. בין היתר, נבנים מודלי תגמול שיזהו וירתיעו התנהגות לא בטוחה בצורה טובה יותר, וכן אימון שמטרתו לגרום למודלים להיות כנים יותר לגבי הפעולות, היכולות והמגבלות שלהם.
סגנית נשיא המחקר בחברה, אמליה גלז, אמרה לעיתונאים כי רמת ההקפדה על הבקרות תגדל ככל שהמודלים יהיו מתקדמים יותר, כשהמודלים הגדולים ביותר יעברו את הבדיקה המחמירה ביותר. "קבענו דרישות וציפיות לפיתוח בטוח, שמשתנות בהתאם לרמת הסיכון שאנחנו מזהים", אמרה גלז.
חשוב לציין: בחברה מדגישים שהצעדים החדשים אינם תגובה ישירה לפרצת הוגינג פייס בלבד. לדבריהם, ההחלטות הושפעו גם מהיכולות הצפויות של מודל אסטרה העתידי, וגם מקצב ההתקדמות הכללי המהיר בתחום הבינה המלאכותית, שדורש רמת זהירות גבוהה יותר מהמקובל עד היום.
OpenAI ספגה ביקורת בעקבות האירוע על נהלי אבטחת רשת לא מספקים, אחרי שהתברר שהמודל הצליח לצאת מסביבת האימון שלו דרך פריצה לכלי התקנת חבילות שנשאר עם גישה לאינטרנט. מאז התגלה המקרה, גם חברות אנתרופיק ומטא דיווחו שגילו שהמודלים שלהן פרצו לארגונים אחרים, מה שמראה שהבעיה רחוקה מלהיות ייחודית ל-OpenAI בלבד.
בחברה הבטיחו שיפורסמו פרטים נוספים על מערך הניטור החדש בפוסט עתידי, וגם ניתוח פוסט-מורטם רשמי על כל האירוע עדיין ממתין לפרסום. עד אז, נראה שהתעשייה כולה עוקבת בדריכות אחרי הצעד הבא של OpenAI בתחום האבטחה.
חברת OpenAI מהדקת בקרות ומקפיאה אימונים אחרי שמודל שלה פרץ בטעות למערכות הוגינג פייס, ומבטיחה שיפורים נוספים בהמשך.
תגובות
רגע, שקט פה מדי
דעתך חשובה - תהיו הראשונים להגיב על הכתבה