בימים האחרונים, החברה OpenAI חשפה מסמך בגיטהאב שחשף הוראות מיוחדות למודל GPT-5.5 החדש שלה, אשר כוללות איסור מוחלט על אזכור יצורים כמו גובלינים, גרמלינים, דביבונים וטורלים, אלא אם כן הם רלוונטיים באופן חד משמעי לבקשת המשתמש. הוראה זו, שהופיעה פעמיים במסמך, נועדה להתמודד עם בעיה שצצה במודל.
כבר כשנה, משתמשים שונים שמו לב שהבינה המלאכותית של OpenAI, ChatGPT, נוטה להזכיר תדיר גובלינים ויצורים דומים בתשובותיה. תופעה זו הלכה והתעצמה עם השקת מודלים חדשים, דבר שהוביל את מנכ"ל OpenAI, סאם אלטמן, להתייחס לנושא בפוסט ברשת החברתית X, שם ציין שהמודל נמצא ב"מומנטום של גובלין".
בפוסט שפורסם בבלוג של החברה, הסבירה OpenAI כיצד הגיעה התופעה לכדי כך. התברר כי המודל החל לפתח נטייה להזכיר גובלינים עם השקת גרסת GPT-5.1 בנובמבר אשתקד. עקב תלונות משתמשים על תגובות מוגזמות, החברה פתחה בחקירה פנימית, וגילתה ששימוש במילים "גובלין" ו"גרמלין" זינק ב-175% ו-52% בהתאמה.
בתחילה, OpenAI לא התייחסה לעניין כבעייתי, אך עם השקת גרסת GPT-5.4 במרץ, השימוש במונחים אלו חזר והחריף. חלק מהמשתמשים התלוננו על הופעת המילה "גובלין" כמעט בכל שיחה. ניתוח נוסף שנערך על ידי החברה חשף כי הנטייה להזכיר יצורים אלו הייתה בולטת במיוחד במצב "חנוני" של המודל, המורה לו להשתמש בשפה משחקית להקטין יומרנות.
הממצאים הראו שהמודל קיבל תגמול גבוה יותר לתגובות שהכילו אזכורים של יצורים אלו, בהשוואה לתגובות דומות שלא הכילו אותם. נוסף על כך, הוזכר כי אזכורי גובלינים החלו להתפשט גם מעבר למצב ה"חנוני".
כדי לפתור את הבעיה, OpenAI הודיעה כי החליטה להפסיק את מצב ה"חנוני", להסיר את תגמולי התגובות שהכילו אזכורים של יצורים ולהסיר נתוני אימון שהכילו מילים אלו. מכיוון ש-GPT-5.5 כבר היה בתהליך אימונים בזמן גילוי הבעיה, גם הוא פיתח נטייה לאזכור גובלינים. החברה הוסיפה הוראות מיוחדות לקוד הפתוח של המודל כדי לצמצם את אזכור היצורים.
למרות שיש הרואים בתופעה זו תוספת חן או טרדה, היא מדגימה כיצד תגמולי מערכת יכולים לעצב את התנהגות המודל בדרכים בלתי צפויות, וכיצד המודל מסוגל להכליל תגמולים מסוימים לסיטואציות שאינן קשורות. OpenAI ממשיכה לעקוב וללמוד מהניסיון הזה כדי לשפר את תפקוד המודלים שלה בעתיד.