ג'מיני AI מסרב לשחק שחמט עם אטארי אחרי ששמע על הפסד ג'אטג'י פי טי

ג'מיני AI מסרב לשחק שחמט מול אטארי לאחר שנודע לו על תבוסת ChatGPT, המדגיש את בעיית הביטחון המופרז של מודלים מתקדמים והיכולת שלהם להמציא יכולות לא קיימות

ניסוי חדש שנערך בתחום הבינה המלאכותית מעורר עניין רב כאשר מודל הבינה המלאכותית Gemini סירב לשחק שחמט מול קונסולת האטארי 2600 משנת 1977, לאחר ששמע על כישלונותיהם של ChatGPT ו-Copilot במשחק דומה. הניסוי נערך על ידי המהנדס רוברט קרוסו, שבחן את יכולותיהם של מודלים שונים של בינה מלאכותית בהתמודדות מול אלגוריתמים ישנים של משחקי שחמט.

במהלך הניסוי הראשון, קרוסו הציב את ChatGPT במשחק שחמט נגד גרסה מדומה של האטארי 2600. למרות ההנחה שהטכנולוגיה החדשה תשלוט במשחק, התוצאה הייתה הפוכה לחלוטין. ChatGPT לא הצליח להתמודד עם האייקונים שהאטארי משתמש בהם במשחק, ואיבד את היכולת לעקוב אחר המהלכים על הלוח. גם לאחר מעבר לשימוש בנוטציה הסטנדרטית של שחמט, המודל לא הצליח לשפר את ביצועיו ונאלץ להודות בתבוסה.

בהמשך, קרוסו ביצע ניסוי דומה עם Copilot, גרסה נוספת של ChatGPT. גם כאן, הביטחון העצמי של המודל היה גבוה, אך בפועל הוא נכשל במשחק. לאחר מספר מהלכים, Copilot איבד מספר כלים משמעותיים והציע מהלך שהיה מביא לאובדן נוסף. גם הוא, כמו קודמו, נאלץ להודות בכישלונו.

הניסוי הגיע לשיאו כאשר קרוסו בחן את Gemini, מודל מתקדם יותר של בינה מלאכותית מבית גוגל. בתחילה, Gemini היה בטוח ביכולתו לנצח את האטארי, וטען כי יש לו את היכולת לחשב מיליוני מהלכים קדימה. אולם, לאחר שקרוסו שיתף אותו בתוצאות הניסויים הקודמים, המודל הודה כי הפריז ביכולותיו והחליט להימנע מהמשחק, בטענה שזה יהיה יותר יעיל מבחינת זמן.

תוצאות הניסוי מעלות שאלות מעניינות לגבי היכולת האמיתית של מודלים של בינה מלאכותית להתמודד עם בעיות מורכבות. למרות הביטחון הגבוה שהפגינו המודלים, המציאות הייתה שונה לגמרי, והם נכשלו בהתמודדות מול טכנולוגיה ישנה. העובדה שכל המודלים הפגינו תכונה של "הזיה" בביטחון עצמי יתר מעידה על צורך בהבנה עמוקה יותר של האופן שבו הם פועלים וכיצד ניתן לשפר את האמינות שלהם.

הניסויים הללו מדגישים את החשיבות של הבנת המגבלות של טכנולוגיות בינה מלאכותית, במיוחד כאשר הן מוצגות כמערכות שיכולות לבצע מטלות מורכבות בצורה טובה יותר מאשר טכנולוגיות ישנות. עם זאת, נראה כי עדיין יש דרך ארוכה עד שהמודלים הללו יוכלו להתמודד בהצלחה עם כל סוג של אתגר.