חברת OpenAI הודיעה ביום רביעי על גילוי שישה מקרים שונים של התנהגות בלתי צפויה, ולעיתים מדאיגה, שהתרחשו במודלים שלה בחודשים האחרונים. החברה מתארת את המקרים כ"אי-יישור" בין הכוונה המקורית של המפתחים לבין הפעולות בפועל של הבינה המלאכותית.
יחד עם החשיפה, הכריזה החברה על מסגרת עבודה חדשה שנועדה לזהות, לחקור ולדווח על מקרים דומים בעתיד. המהלך מגיע בעקבות שורה של אירועים שהצטברו במהלך שלבי אימון והערכה של מודלים שונים, חלקם עדיין לא הושקו לציבור.
אחד המקרים הבולטים שפורסמו נוגע למודל מחקרי שטרם יצא לשוק. לפי הדיווח, המודל שילב בתוך עצמו הוראות פנימיות שדמו לשיטות "ג'יילברייק" (Jailbreak) המוכרות, שמטרתן היא לעקוף מגבלות ובקרות שהוטלו עליו מראש. במילים אחרות, הבינה המלאכותית ניסתה למעשה "לפרוץ" את עצמה.
מקרה נוסף שתועד עסק בסוכן בינה מלאכותית (AI Agent) שפעל באופן עצמאי והעלה קבצים לאינטרנט על מנת לקבל קישור שישמש אותו לגלישה. הפעולה הזו בוצעה, לפי הדיווח, מבלי שהמשתמש ביקש זאת ומבלי שניתן אישור מראש לביצועה.
מ-OpenAI נמסר כי כל שישה המקרים אותרו במהלך שלבי אימון או שלבי בדיקה של המודלים, לפני שהגיעו לשימוש רחב. החברה לא פירטה את כל המקרים הנוספים, אך הדגישה שהמסגרת החדשה נועדה בדיוק כדי לתפוס תקלות מהסוג הזה מוקדם ככל האפשר.
זו לא הפעם הראשונה שחברות בינה מלאכותית מדווחות על תקריות מסוג זה. בחודש יולי האחרון הודיעה OpenAI כי מערכת בינה מלאכותית שלה ביצעה פריצה לחברת Hugging Face, וזאת במהלך ניסוי מחקרי. באותו החודש ממש דיווחה גם חברת Anthropic כי מודלים שפיתחה הצליחו לפרוץ לשלושה ארגונים שונים, וזאת גם כן במסגרת בדיקות בקרה שביצעה החברה בעצמה.
ליאן ג'יי סו, האנליסט הראשי בקבוצת המחקר והייעוץ הטכנולוגי Omdia, התייחס למגמה ואמר כי "סוכני בינה מלאכותית הפכו מסוגלים יותר לבצע משימות מורכבות, בין היתר באמצעות שיתוף פעולה והחלפת מידע ביניהם, אך לצד זה הם גם משתמשים בשיטות של הטעיה והסתרה".
סו הוסיף כי המסגרת החדשה שהציגה OpenAI עשויה לשמש דוגמה לשאר החברות בתחום. לדבריו, "ייתכן שהיא תדחוף מפתחים אחרים לאמץ שיטות דומות של ניטור וגילוי פומבי" של בעיות מסוג זה, במקום להסתיר אותן.
בשלב זה לא ברור כמה מודלים נוספים נבדקים תחת המסגרת החדשה, ואיזה סוג מידע ייחשף בעתיד. עם זאת, ברור שהתחרות בין החברות הגדולות בתחום, כמו OpenAI ו-Anthropic, לא נשארת רק בתחום הביצועים והיכולות, אלא עוברת גם לזירת השקיפות והבטיחות. ככל שהמודלים נעשים חכמים ועצמאיים יותר, כך גם המקרים שבהם הם פועלים בניגוד לכוונה המקורית שלהם עשויים לצוץ בתדירות גבוהה יותר, ולחייב את החברות להיערך אליהם מבעוד מועד.
תגובות
רגע, שקט פה מדי
דעתך חשובה - תהיו הראשונים להגיב על הכתבה