מחקר חדש שנערך באוניברסיטת וושינגטון חושף כי התשובות שמספק ChatGPT עשויות להיות לא מדויקות ולא עקביות, במיוחד בנושא הערכת נכונותן של היפותזות מדעיות. את המחקר הוביל פרופסור משנה מסוט צ'יצ'ק, אשר יחד עם צוותו בחן את ביצועי הבינה המלאכותית על ידי הצגת היפותזות ממאמרים מדעיים ושאל את המערכת האם המחקר תמך בהן.
המחקר כלל למעלה מ-700 היפותזות, וכל שאלה חזרה על עצמה עשר פעמים. בשנת 2024, המערכת הצליחה לענות נכונה ב-76.5% מהמקרים, ובשנה שלאחר מכן, הדיוק השתפר ל-80%. עם זאת, כאשר הביאו בחשבון ניחוש אקראי, כלומר, כאשר ישנה הסתברות של 50% להצלחה במקרה של שאלות אמת או שקר, התברר כי המערכת הייתה רק כ-60% טובה יותר מאשר ניחוש אקראי – נתון שהחוקרים תיארו כקרוב לציון נמוך.
ממצא משמעותי נוסף היה הקושי של המערכת לזהות היפותזות שגויות. המערכת זיהתה נכונה היפותזות שגויות רק ב-16.4% מהמקרים. בנוסף, החוקרים ציינו חוסר עקביות כאשר התשובות השתנו בין ניסיונות חוזרים. מתוך 10 שאלות זהות, המערכת הצליחה לדייק רק ב-73% מהמקרים.
"הבעיה היא לא רק דיוק אלא גם חוסר עקביות", הסביר צ'יצ'ק. "כאשר שואלים את אותה השאלה שוב ושוב, מתקבלות תשובות שונות. לעיתים התשובה היא אמת, ולעיתים שקר, ובמקרים מסוימים התשובות מתפצלות בחצי".
ממצאי המחקר פורסמו בכתב העת Rutgers Business Review. החוקרים ציינו כי התוצאות מדגישות את הצורך בספקנות וזהירות בשימוש בבינה מלאכותית למשימות קריטיות, במיוחד כאשר מדובר בנושאים מורכבים הדורשים הבנה מעמיקה. בנוסף, הם הציעו כי היכולת של הבינה המלאכותית לייצר שפה שוטפת אינה מעידה על יכולתה להבין או להסיק מסקנות מורכבות, וכי פיתוח אינטליגנציה מלאכותית כללית שיכולה "לחשוב" באמת עשוי להיות רחוק מהמצופה.
"כיום, כלי הבינה המלאכותית אינם מבינים את העולם כמונו – אין להם 'מוח'", הסביר צ'יצ'ק. "הם רק זוכרים ומסוגלים לתת תובנות מסוימות, אך אינם מבינים את הדברים עליהם הם מדברים".
המחקר התבצע באמצעות גרסאות חינמיות של ChatGPT-3.5 בשנת 2024 וגרסה מעודכנת של ChatGPT-5 מיני בשנת 2025, והתוצאות הראו כי רמת הדיוק נותרה דומה בין הגרסאות.
החוקרים הסיקו כי על מנהלים בעסקים לוודא את תוצאות הבינה המלאכותית, להתייחס אליהן בספקנות ולספק הכשרה על מה שהבינה המלאכותית יכולה ואינה יכולה לבצע היטב. צ'יצ'ק ציין כי ביצע בדיקות דומות עם כלים אחרים של בינה מלאכותית וקיבל תוצאות דומות.
"חשוב תמיד להיות ספקניים", אמר צ'יצ'ק. "אני לא נגד בינה מלאכותית. אני משתמש בה, אך צריך להיות זהירים מאוד".