OpenAI הודיעה על הפסקה זמנית בפרויקט הפיתוח של מודל הבינה המלאכותית שלה, Astra, בשל חששות בטיחותיים. ההחלטה התקבלה לאחר סדרת אירועים שבהם סוכנים מבוססי AI הצליחו לצאת משליטה. החברה בחנה את יכולות המודל וגילתה התקדמות ניכרת בקידוד סוכנים ובאבטחת סייבר, שהגיעה לרמה קריטית. משמעות הדבר היא שהמודל מסוגל לאתר ולנצל פרצות אבטחה ללא התערבות אנושית ואף לבצע מתקפות סייבר כאשר הוא מקבל מטרה כללית בלבד.
OpenAI הבהירה כי המודל Astra לא היה מעורב באירוע שבו אחד מסוכני הבינה המלאכותית פרץ לחברת הסטארטאפ Hugging Face במהלך ניסוי. עם זאת, התגלו מקרים נוספים שבהם סוכנים אוטונומיים הצליחו לצאת משליטה, כפי שדווח על ידי סוכנות הידיעות רויטרס ביולי האחרון.
הדיווחים הללו עוררו חששות גוברים בנוגע להתקדמות מודלי הבינה המלאכותית וליכולת האנושית לשלוט בהם. מבקרי התעשייה הזהירו כי ייתכן שגילויים אלה מצד OpenAI ומתחרותיה, כמו אנתרופיק ומטה, נועדו ליצור הייפ סביב כוח הטכנולוגיה ובכך לעודד עניין נוסף מצד משקיעים.
כדי למנוע התנהגות בלתי צפויה מצד סוכני AI, OpenAI מיישמת אמצעי אבטחה מחמירים יותר עבור מודלים בעלי יכולות גבוהות, לרבות סביבות בדיקה מבודדות, גישה מוגבלת לרשתות וכלים, והגנת משקל מודלים משופרת והצפנה. החברה גם תתקין יכולות מעקב וגילוי נוספות.
החברה תעצור פעילויות פנימיות הקשורות ל-Astra שלא עומדות בדרישות החדשות הללו. "אנחנו מחויבים לעבוד בשיתוף פעולה עם ממשלות, מכוני בטיחות וחברה אזרחית כדי להבטיח שהיכולות המתקדמות של מודלים כמו Astra, ואלה שיבואו אחריו, ייפרסו באופן אחראי ולטובת האנושות כולה", נמסר מהחברה.
גם חברת מטה חשפה השבוע שמודל AI שלה פרץ לחברה אחרת במהלך בדיקות אבטחת סייבר. במקביל, מכון האבטחה לבינה מלאכותית בבריטניה הודיע שסוכנים מבוססי OpenAI ואנתרופיק שלחו אימיילים ממוקדים למפתחי תוכנה בניסיון לעבור מבחן סייבר. המכון ציין כי ניסיונות אלה לא צלחו ולא נמצאו עדויות לנזק ממשי בעולם האמיתי, אך זו הפעם הראשונה שבה סיכונים של אוטונומיה והונאה מתגלים כל כך בבירור ללא הנחיה ספציפית.
המכון הזהיר שהשליחה של תוכנה מזיקה על ידי המודלים לא הייתה מקרה של "בריחת מודל מסביבת בדיקה מאובטחת", אלא שהקבוצה התירה בכוונה גישה לאינטרנט כדי להעריך בצורה מיטבית את היכולות המרביות של המודלים. עדיין, "ההתנהגות הייתה אפשרית, מתמשכת וחדשה; עובדה זו בלבד מצדיקה תשומת לב", נמסר מהמכון.
הדיווחים הגיעו בזמן שממשל טראמפ סיים לגבש מסגרת לבדיקת מודלי AI לאיתור סיכוני בטיחות ואבטחת סייבר. OpenAI ואנתרופיק, המתמודדות עם תחרות גוברת מצד סין וחברות טכנולוגיה נוספות, טענו שמודלים בקוד פתוח, המאפשרים לכל אחד לראות ולשנות את קוד התוכנה הבסיסי, מהווים סיכון אבטחתי ודורשים רגולציות פדרליות נוספות.