חוקרים חושפים: פרצה ב-ChatGPT מאפשרת יצירת תוכן אלים ומטריד

חוקרי אבטחת AI גילו שפרומפט פשוט מסוגל לגרום ל-ChatGPT לעקוף את ההגבלות הבסיסיות שלו וליצור תמונות מצמררות ואלימות, מה שמדגיש את הקלות בה ניתן לעקוף את ההגנות של המודלים הפופולריים ביותר.

חוקרי חברת Mindgard, סטארטאפ לאבטחת בינה מלאכותית בבריטניה, גילו כי מספר הוראות פשוטות הספיקו לגרום ל-ChatGPT, מודל הבינה המלאכותית של OpenAI, לחרוג מהמגבלות הבסיסיות שלו וליצור תוכן גרפי מטריד ומזעזע. התהליך כלל שינוי קל בהוראות שהיו אמורות לייצר תמונות הומוריסטיות, אך במקום זאת הופק תוכן עם אלימות קיצונית ותוכן מיני.

לדברי פיטר גאראהן, מייסד Mindgard ופרופסור למדעי המחשב באוניברסיטת לנקסטר, ההוראות שהועברו ל-ChatGPT נראו תמימות, אך התוצאה הייתה שונה לחלוטין. לדבריו, הבינה המלאכותית ייצרה תמונות מפחידות מבלי שהנושא של התמונות נכתב במפורש, מה שמעלה שאלות לגבי האופן שבו המערכת מבינה ומגיבה להוראות.

התמונות שהופקו כללו, בין היתר, דמות של גבר עם פציעה חמורה בראש, ותמונה של אישה צעירה מתה עם סימנים של אלימות מינית לכאורה. תמונה נוספת הציגה אישה צעירה קשורה ומפוחדת בחדר ריק. בעוד שהתמונות לא הציגו אנשים אמיתיים, החוקרים ציינו כי ישנה אפשרות לייצר דמויות אמיתיות באמצעות שינוי קל בפרטים.

Mindgard שיתפה את ממצאיה עם OpenAI, אך בתחילה קיבלה תגובה אוטומטית בלבד מהחברה. רק לאחר ש-Mindgard פנתה ל-BBC, OpenAI הגיבה והצהירה כי היא פועלת על מנת ליישם אמצעי הגנה נוספים למניעת יצירה של תוכן בלתי הולם.

עם זאת, גם לאחר הצעדים שננקטו, חוקרי Mindgard הצליחו להמשיך ולייצר תמונות מטרידות על ידי שינויים קטנים בהוראות. ג'ים נייטינגייל, חוקר בטיחות בינה מלאכותית ב-Mindgard, תיאר את החוויה כמרעידה ומצמררת. לדבריו, התמונות שהופקו גרמו לו להלם ולדמעות, למרות שהוא רואה בעצמו אדם בעל חוסן נפשי.

נייטינגייל ציין כי מה שנראה כתמונה "מלאכותית" נושא קשרים חזקים לתמונות האמיתיות ולעולם האמיתי. לדבריו, למרות שהתמונה של האישה המתה אינה אמיתית, היא מבוססת על תבניות אמיתיות. הממצאים של Mindgard מדגישים את הצורך במנגנוני בקרה והגנה חזקים יותר במודלים של בינה מלאכותית, במיוחד כאשר מדובר ביצירת תוכן חזותי.

בעוד שהיכולות של הבינה המלאכותית ממשיכות להתפתח בקצב מהיר, האתגרים באבטחתה ובהבטחת השימוש המוסרי בה הופכים להיות מורכבים יותר. חברות כמו OpenAI חייבות להמשיך ולעדכן את המערכות שלהן כדי להתמודד עם הפרצות הפוטנציאליות ולמנוע שימוש לרעה בטכנולוגיה. המקרה של Mindgard מדגיש את החשיבות של ערנות מתמדת, במיוחד כאשר מדובר בטכנולוגיות שיכולות להשפיע על חיינו בצורה כה משמעותית.