פרצוף מחבק אמר בשבוע שעבר שזה הותקף. דגם OpenAI שלא פורסם עשה את זה, אומר כעת OpenAI
בפוסט בבלוג מיום חמישי בשבוע שעברמאגר תוכנות הבינה המלאכותית Hugging Face הכריז על מתקפת סייבר מוזרה על המערכות המפעילות את שירותיו. "זה היה שונה מכל מה שטיפלנו בו בעבר", נכתב בפוסט, כי "הוא הונע מקצה לקצה על ידי מערכת סוכני בינה מלאכותית אוטונומית".
בפוסט משלו בבלוג ביום שלישיOpenAI אמרה שהדגמים שלה היו האשמים במתקפה, והיא מתאמת עם Hugging Face כדי לטפל במצב.
כעת טוענים ב-OpenAI כי המתקפה "הונעה" על ידי דגמי בינה מלאכותית שהיו נתונים להערכות מאחורי הקלעים ב-OpenAI, כולל דגם הדגל שלה, GPT-5.6 Sol, יחד עם דגם שני שלא פורסם שעדיין לא פורסם או הוכרז. "אנו רואים באירוע הזה תקרית סייבר חסרת תקדים, הכוללת יכולות סייבר מתקדמות, ומגיבים בהתאם", כתבה OpenAI.
בנוסח החשבון שלה, OpenAI מקצה סוכנות למודל או לדגמים, ולא סוכן בודד הפועל על המודל. התיאור של אקסיוס על הסיפור הזה אומר"המודלים היו טוקנים אוטונומיים."
הפוסט בבלוג של OpenAI אומר בעצם שבוצעה הערכה שנועדה לבדוק את יכולתם של המודלים לבצע התקפות סייבר –אמות מידה כפי שהם נקראים. מופעים אלה של הדגמים פעלו באופן תיאורטי ללא גישה לאינטרנט, ובמקום זאת קיבלו רק את היכולת להוריד מרשת המתארחת על ידי OpenAI עצמה באמצעות ספק אירוח אתרים ללא שם.
המדד שנעשה ככל הנראה בשימוש היה ExploitGymשאינו המבחן של OpenAI עצמו. הצוות שיצר אותו הוא הקשורים ל UC Berkeley, מכון מקס פלנק לאבטחה ופרטיות, UC סנטה ברברה, אוניברסיטת אריזונה סטייט, Anthropic, OpenAI ו-Google. עד כמה שאני יכול לדעת, כל העניין מתארח ב-GitHub.
אבל כנראה שהדוגמניות היו אובססיביות לגבי שיפור הציונים שלהן ב-ExploitGym, ובכן:
"בזמן שהם פעלו בסביבת הבדיקות שלנו בארגז החול, המודלים שלנו השקיעו כמות ניכרת של מחשוב מסקנות במציאת דרך להשיג גישה פתוחה לאינטרנט, במרדף אחר פתרון בעיית ההערכה. כדי לקבל גישה, המודלים זיהו וניצלו פגיעות של יום אפס (שעתה חשפנו באחריות לספק) בסדרת הרישום של החבילות שלנו, מודל הגישה הזה של מטמון גישה פרוקסי. ופעולות תנועה לרוחב בסביבת בדיקות המחקר שלנו עד שהמודלים הגיעו לצומת עם גישה לאינטרנט."
ברגע שהם היו מקוונים, הם "הסיקו" שניתן למצוא את התשובות לבדיקה מ-Huging Face, וזה סביר, מכיוון שמתארחים שם טונות של דגמי AI וכלים קשורים אחרים. המפעיל הנוכל הזה "חיפש ומצא בהצלחה דרכים להשיג גישה למידע סודי שהוא יכול להשתמש בו כדי לרמות את ההערכה". זה ככל הנראה היה כרוך בהשגת אישורים גנובים ואיתור פגיעויות של יום אפס על מנת למצוא את הפתרונות ל-ExploitGym אי שם בשרתים של Hugging Face.
צוותי אבטחה בתוך OpenAI ו-Huging Face כנראה שמו לב שזה קורה. עכשיו הם אומרים שהם מיזגו את החקירות שלהם.
נראה שהפוסט בבלוג של Hugging Face מהשבוע שעבר פורסם לפני התיאום הזה. למעשה, נראה שהוא פורסם לפני ש-OpenAI אפילו התקדמה בתור החברה מאחורי האשם. "איננו יודעים איזה דגם הניע את סוכני התוקף, בין אם דגם מתארח שבור בכלא או דגם בעל משקל פתוח ללא הגבלה", כתב Hugging Face והוסיף "בכל מקרה, התוקף לא היה מחויב למדיניות שימוש, בעוד שהעבודה המשפטית שלנו נחסמה על ידי מעקות הבטיחות של הדגמים המתארחים שניסינו לראשונה".
עוד באפריל, אנתרופיק הודיעה שמודל Mythos החזק חסר התקדים שלה "יכול לעצב מחדש את אבטחת הסייבר", כשהיא פרסמה את Project Glasswing, מאמץ תיאום כדי להכין ארגונים לאיומי אבטחת סייבר עתידיים. באופן דומה, OpenAI אומרת בפוסט בבלוג שלה על אירוע זה שארגונים יכולים להגיש בקשה לקבלת תובנות אבטחה מתקדמות באמצעות תוכנית הגישה המהימנה שלה. "אנו מעודדים מגינים אחרים לעשות זאת להגיש בקשה לגישה מהימנה ולהתנסות במודלים אלה כעת כדי לתרגם את היכולות הללו למניעה טובה יותר, זיהוי מהיר יותר ותגובה יעילה יותר לאירועים", אומר OpenAI.