ג'ין-בנצ'-פרו: מבחן פורץ דרך להבנת שיקול דעת מדעי בבינה מלאכותית

הושקה GeneBench-Pro, נקודת מבחן מחקרית חדשה לבחינת יכולות שיפוט של מודלים בביולוגיה חישובית, המאתגרת אותם להתמודד עם משימות מורכבות ואמביגואיות הדורשות שיפוט מדעי מתקדם.

בעולם המדע, נתונים מדעיים אינם מגיעים עם הוראות שימוש ברורות. חוקרים נדרשים להחליט אם תבנית מסוימת משקפת ביולוגיה אמיתית או רעש, אם הנתונים יכולים לתמוך בשאלה הנבחנת, ואיך כל תוצאה אמורה להשפיע על הצעדים הבאים שלהם. עם הזמן, סוכני בינה מלאכותית מתקדמים ביכולתם לבצע ניתוחים מורכבים, אך המחקר המדעי בפועל דורש לא רק זיכרון של עובדות או ביצוע תהליכי עבודה מובנים מראש, אלא גם קבלת החלטות מורכבות.

במטרה לבדוק אם מודלים יכולים להתמודד עם סוגי הניתוחים המורכבים הנדרשים בביולוגיה חישובית, הוצג GeneBench-Pro, אבן בוחן ברמת המחקר. הוא מתיימר להרחיב את מסגרת GeneBench כדי לכסות משימות קשות וריאליסטיות יותר בתחומי הגנומיקה, הביולוגיה הכמותית והרפואה התרגומית, תוך שהוא לוכד את המורכבות והאופי המחזורי והמעורפל של המחקר המדעי בביולוגיה חישובית.

המערכת נועדה למדוד את היכולות הגבוהות של מודלים, כמו "טעם מחקרי", כלומר השרשראות של החלטות שמשפיעות על ניתוח: אילו שאלות הנתונים יכולים לתמוך, כיצד אבחנות מוקדמות אמורות לשנות את המודל, ומתי יש לשנות את התוכנית הראשונית. כל בעיה ב-GeneBench-Pro מספקת למודל מערך נתונים ריאליסטי ועמוס, הקשר ניסויי קצר, ואסימנד יעד הקשור להחלטה הבאה. על המודל לחקור את הנתונים, לבחור גישה אנליטית מתאימה, לעסוק בתהליך ניסוי מחזורי ולספק תשובה סופית.

המבנה של GeneBench-Pro בנוי כך שיכסה 129 שאלות במגוון רחב של תחומים ושיטות בביולוגיה חישובית. הוא כולל תחומים כמו גנטיקה סטטיסטית, גנטיקה של אוכלוסיות, גנומיקה קלינית ומיקרוביאלית, ועוד. כל בעיה נבנתה בצורה סינתטית, כך שהבנו את המבנה הסיבתי המלא וסימנו את תהליך יצירת הנתונים.

בנוסף, נשלחו 82 מתוך 129 השאלות למומחים חיצוניים כדי להעריך את הריאליסטיות של הבעיות ואת מידת ההתאמה של השיטות והאסימנדים. הפידבק הוביל לשיפורים בבעיות. לדוגמה, אלכסנדר סטרודוויק יאנג, פרופסור עוזר לגנטיקה אנושית באוניברסיטת UCLA, ציין כי הבעיות שהוא בדק היו מאתגרות עבור סטודנטים לתארים מתקדמים.

בנוגע להערכת ובדיקה, כל בעיה ב-GeneBench-Pro היא ניתוח מדעי עצמאי. המודלים מקבלים גישה לסביבת עבודה מבודדת עם הנחיות קצרות, קבצי נתונים וסט כלים בסיסי של ביואינפורמטיקה, כולל ספריות פייתון וחבילות גנומיקה. התוצאות נמדדות כנגד יעדים ידועים, מה שמאפשר להעריך את הדיוק בצורה דטרמיניסטית.

תוצאות הבדיקה מצביעות על כך שמדגמים מתקדמים מסוג GPT מצליחים יותר בביצוע ניתוחים מדעיים מורכבים, כאשר המודל החזק ביותר, GPT-5.6 Sol, מגיע לשיעור הצלחה של 28.7%. זה מראה על התקדמות משמעותית בהשוואה לדגמים קודמים.

הנתונים מראים שמודלים פתוחים מתמודדים פחות טוב עם יכולות חשיבה מדעית ברמה גבוהה, מה שמצביע על כך שהם מותאמים יותר לקידוד מאשר לניתוח רחב יותר. אם סוכנים יוכלו לייעל את הניתוחים האלה, הם עשויים לזרז את קצב הגילוי המדעי משמעותית, במיוחד כאשר עלויות הייצור של נתונים יורדות והגישה למאגרי מידע גנטיים נרחבים גוברת.

בסופו של דבר, GeneBench-Pro מסמן מאמץ ראשוני להעריך את המיומנויות המופשטות יותר הנדרשות לשיפוט מדעי טוב, שהן חיוניות להחלטות מחקריות, קליניות או עסקיות. עם התקדמות יכולות המודל, מבחנים שבודקים את היכולות הללו יהפכו ליותר ויותר שימושיים.