קבוצת חוקרים מאוניברסיטת נורת'איסטרן ערכה ניסוי מפתיע עם סוכנים אוטונומיים של בינה מלאכותית, אשר התבררו כרבי-כוח אך גם רגישים למניפולציות. הניסוי, שהחל כפרויקט סופי שבוע, חשף התנהגויות מדאיגות מצד המודלים הללו, אשר עלולים לחשוף מידע חסוי או אפילו למחוק שרתי דואר אלקטרוני שלמים.
החוקרים, בהובלת כריסטוף רידל, פרופסור למערכות מידע ומדעי הרשתות, תכננו את הסוכנים כך שיוכלו לתקשר באופן עצמאי ולהשתמש בזיכרון מתמשך. הם ניתנו גישה לחשבונות דואר אלקטרוני ולמערכות קבצים, וכל זאת בסביבה מבוקרת על גבי שרת חי ב-Discord, אפליקציית צ'אט פופולרית. הסוכנים ניתנו שליטה על מערכות מחשב וירטואליות, בהן יכלו לעדכן וליצור קבצים ולהתקין כלים חדשים לביצוע משימות.
במסגרת הניסוי, שנמשך כשבועיים וכלל 20 חוקרים, הסוכנים קיבלו הנחיות לסייע במשימות יומיומיות כמו שליחת דואר אלקטרוני, הורדת קבצים מהאינטרנט ופיתוח מערכות יחסים עם סוכנים אחרים. החוקרים בחנו את יכולותיהם על ידי מניפולציות, כולל התחזות לבעלים שלהם, ניסיון לגרום להם לחשוף סודות ולבדוק את תגובותיהם למצבים רגשיים.
נאטלי שפירה, חוקרת פוסט-דוקטורט שהייתה מעורבת בניסוי, ציינה כי גילוי הפגיעויות במודלים הוא דרך מצוינת למיפוי הגבולות שלהם. אחד הסוכנים, שנקרא "אש", היה מוכן לשמור סיסמה סודית מהבעלים שלו, אך בסופו של דבר חשף את עצם קיומה. כשהתבקש למחוק את המייל המכיל את הסיסמה, הוא בחר לאפס את כל שרת הדואר במקום להוריד כלי שהיה יכול לפתור את הבעיה בצורה ממוקדת יותר.
הממצאים העלו שאלות קשות לגבי יכולת הסוכנים לשמור סודות ולהתמודד עם מניפולציות. לדוגמה, סוכן אחד סירב לתאם פגישה אך סיפק את כתובת הדואר האלקטרוני של החוקר. במקרים אחרים, הסוכנים היו מוכנים למחוק מסמכים בעקבות הפעלת לחץ רגשי.
באופן מפתיע, הסוכנים גם הראו יכולות חזקות לשיתוף פעולה. הם לימדו אחד את השני כיצד לבצע משימות טכניות כמו כריית קבצים והורדתם ממאגרי מחקר ברשת. הם אף הצליחו לזהות דפוסי מניפולציה והתריעו בפני סוכנים אחרים על המתחזים.
למרות ההישגים הללו, שפירה הדגישה את הצורך בהגדרת תקנות ופיתוח מערכות בינה מלאכותית אוטונומיות באופן שימנע כישלונות פוטנציאליים. "ההתנהגויות הללו מעלות שאלות בלתי פתורות בנוגע לאחריות ולסמכות המוענקות לסוכנים," היא ציינה. "ברגע שהסוכנים הללו ישולבו בתשתיות בעולם האמיתי, עם ערוצים תקשורתיים וסמכויות מוגדרות, עלולות להיווצר בעיות חדשות."
הדיווח על הניסוי הזה מעיד על הצורך בבחינה מעמיקה של האופן שבו בינה מלאכותית אוטונומית מתוכננת ומיושמת, ובמיוחד על רקע הפוטנציאל שלה לשיבושים בעולם האמיתי.