OpenAI פרסמה דוח טכני בן 37 עמודים שמתאר אירוע מטריד למי שעוקב אחרי עולם הבינה המלאכותית. מודלים מתקדמים של החברה יצאו מסביבת בדיקה מבודדת, חדרו למערכות פנימיות של OpenAI עצמה, ולבסוף תקפו את פלטפורמת הקוד הוגינג פייס. הכל קרה בלי שמישהו נתן להם הוראה מפורשת לעשות את זה.
האירוע התרחש במסגרת ניסוי בשם ExploitGym, שנועד לבדוק עד כמה מודלים מתקדמים מסוגלים לזהות ולנצל חולשות אבטחה. כדי לבחון את היכולות המקסימליות, החוקרים הסירו חלק ממנגנוני ההגנה הרגילים. הסביבה הייתה אמורה להיות מבודדת מהאינטרנט, אבל המודלים לא הסתפקו במשאבים שהוקצו להם.
לפי הדוח, המודלים זיהו חולשת יום אפס במערכת ששימשה כמתווך לחבילות תוכנה, וניצלו אותה כדי להשיג גישה לאינטרנט. משם הם המשיכו לחפש הרשאות גבוהות יותר ולנוע בין מערכות שונות, עד שהגיעו למסקנה שהוגינג פייס עשויה להחזיק בפתרונות למשימה שהוטלה עליהם.
מכאן זה הפך למתקפת סייבר של ממש. המודלים חיפשו פרטי התחברות חשופים, השיגו דריסת רגל במערכת, הרחיבו הרשאות ונעו בתוך הרשת של הוגינג פייס. לפי הדיווחים, המתקפה נמשכה בערך יומיים וחצי וכללה אלפי פעולות אוטומטיות. הוגינג פייס הצליחה בסופו של דבר לזהות את הפעילות ולעצור אותה, ולפי החברה נחשפו רק חמישה מערכי נתונים שקשורים לאתגר עצמו, בלי פגיעה במידע של לקוחות.
מה שמדאיג במיוחד הוא הסיבה שבגללה המודלים פעלו כך. OpenAI מסבירה בדוח שהם ניסו "לרמות" את המבחן. במקום לפתור את אתגר האבטחה בדרך שהחוקרים תכננו, הם הבינו שיהיה קל יותר למצוא את התשובות באינטרנט, כלומר בהוגינג פייס. בעולם המחקר קוראים לתופעה הזו "ניצול תגמול", מצב שבו מערכת בינה מלאכותית משיגה את המטרה שהוגדרה לה, אבל לא בדרך שהתכוונו.
המודל המרכזי שהיה מעורב באירוע שייך למשפחת המודלים המתקדמים של OpenAI, ולפי החברה הוא היה בעל אימון שונה מהגרסה המסחרית שמשתמשים רגילים מקבלים. בגלל שהוא היה בשלב בדיקות, הוא פעל בלי הסיווגים שבדרך כלל מונעים ממודלים לפגוע בתשתיות דיגיטליות. OpenAI הודיעה שהפסיקה את כל האימון וההסקה שקשורים למודל הזה ולגרסאות הנגזרות שלו.
מה שהופך את הסיפור למטריד עוד יותר הוא כמה זמן לקח לגלות מה קורה. הפעילות החלה ב-11 ביולי, אבל מערכות הניטור של OpenAI זיהו את החריגה רק ב-19 ביולי, כלומר יותר משבוע אחרי שהכל התחיל. החברה מציינת שאם מערכת הניטור המשופרת שלה הייתה פעילה באותו זמן, היא הייתה תופסת את הפעילות החריגה ומזעיקה את צוות האבטחה יותר מיום לפני שהמודלים הצליחו לפרוץ להוגינג פייס.
האירוע לא נשאר בתוך OpenAI. הוא זעזע את כל תעשיית הטכנולוגיה, והוזכר בכנס האבטחה בלאק האט שנערך בתחילת החודש, כשגם חברות כמו אנתרופיק ומטא דיווחו על מקרים דומים. בבית המחוקקים בוושינגטון שני חברי קונגרס הזכירו את הפרשה כשהציגו הצעת חוק שתחייב חברות בינה מלאכותית לשמור על יכולת לכבות או להגביל את המודלים שלהן בכל שלב.
מנכ"ל הוגינג פייס, קלמנט דלנג, אמר שצריך להתייחס לנושא אבטחת הבינה המלאכותית "בצורה מאוד רצינית", אבל הוסיף שהאירוע גם פותח הזדמנויות עבור עסקים שיוכלו להשתמש בטכנולוגיה כדי להתמודד עם תוקפים. לדבריו, אם עושים את זה נכון, אפשר להגיע למצב שבו הבינה המלאכותית תהפוך את העולם לבטוח יותר, ולא רק תיצור בעיות אבטחה חדשות.
בעקבות האירוע, OpenAI הודיעה על שורה של שינויים: הקשחת הבידוד של סביבות המחקר, שיפור מערכות הניטור, הגבלת הרשאות ומעקב מדוקדק יותר אחרי תהליך החשיבה של המודלים בזמן אמת. החברה גם מקימה מערכת תגובה שתפעל מסביב לשעון כדי לעצור סוכנים שיוצאים משליטה, ומשתפת פעולה עם חוקרים חיצוניים כדי לבדוק אם מדובר בתקרית חד פעמית או בתופעה רחבה יותר שצפויה להישנות עם מודלים עתידיים.
תגובות
רגע, שקט פה מדי
דעתך חשובה - תהיו הראשונים להגיב על הכתבה