11.10.2026 |
ד"ר רועי נוי
גידולי בלוטות רוק כוללים מגוון רחב של נגעים וממאירים. סיווג מדויק של גידולי בלוטות רוק הוא הכרחי לקביעת הטיפול המתאים. מחקרים קודמים הראו ביצועים גבוהים של AI ב-CT ו-MRI (רגישות וסגוליות מעל 0.80 ו-AUC הקרוב ל-0.90). עבודה שפורסמה לאחרונה ב- Otolaryngology–Head and Neck Surgery ניסתה לספק מטה-אנליזה ומדד מעודכן לגבי הביצועים האבחנתיים של מודלי AI בסיווג גידולי בלוטות רוק על בסיס בדיקות אולטרסאונד בלבד, ולהציע סקירה מקיפה על פוטנציאל הטמעתם בקליניקה.
נערך חיפוש מקיף במאגרי המידע CINAHL, PubMed ו-Scopus עד ל-28 בינואר 2025. שני סוקרים בלתי תלויים סיננו את המאמרים וחלצו נתונים בהתאם להנחיות PRISMA (Preferred Reporting Items for Systematic Reviews and Meta-Analyses). מחקרים שהעריכו את הביצועים האבחנתיים של בינה מלאכותית בסיווג גידולי בלוטות רוק נכללו.
מתוך 741 מאמרים שזוהו, 12 מחקרים (4721 מטופלים) עמדו בקריטריוני ההכללה. תשעה מחקרים העריכו דגמי בינה מלאכותית המבדילים בין גידולים שפירים לממאירים, ושלושה מחקרים העריכו סיווג של אדנומה פלאומורפית (Pleomorphic adenoma) מול גידול ע"ש וורטין (Warthin tumor). עבור גידולים שפירים מול ממאירים: הרגישות הייתה 0.91 (רווח בר-סמך 95%: 0.86, 0.95), הסגוליות הייתה 0.86 (רווח בר-סמך 95%: 0.80, 0.92), והדיוק היה 0.85 (רווח בר-סמך 95%: 0.81, 0.90). עבור אדנומה פלאומורפית מול גידול ע"ש וורטין: הרגישות הייתה 0.81 (רווח בר-סמך 95%: 0.74, 0.89), הסגוליות הייתה 0.88 (רווח בר-סמך 95%: 0.81, 0.95), והדיוק היה 0.84 (רווח בר-סמך 95%: 0.79, 0.90).
בעוד שאולטרסאונד רגיל מציג סגוליות גבוהה (92%) אך רגישות בינונית בלבד (66%), שילוב AI העלה את הרגישות ל-91% בהבחנה בין שפיר לממאיר. רגישות גבוהה זו קריטית למניעת פספוס של גידולים ממאירים. המחקר מראה כי AI משפר את ביצועי הרופאים ככלי תומך החלטה, מסייע בסיווג הנגעים, ועשוי לצמצם ביופסיות מיותרות – בפרט באזורים דלי משאבים עם נגישות מוגבלת לרדיולוגים מומחים.
המודלים הציגו רגישות גבוהה יותר בהבחנה בין שפיר לממאיר (91%) לעומת ההבחנה בין אדנומה פלאומורפית לגידול ע"ש וורטין (81%). הסיבה ככל הנראה כי שניהם גידולים שפירים בעלי מאפיינים קליניים ודימותיים חופפים (גושים לא כואבים, בעלי מראה לובולרי ורכיבים ציסטיים), דבר המקשה על ההפרדה ביניהם גם עבור מודלי למידה עמוקה.
המגבלות כללו הטרוגניות במחקרים, שונות בסוגי מודלי ה-AI, בשיטות האימון, בציוד האולטרסאונד ובסוגי הגידולים. יכולת הכללה מוגבלת (Generalizability): מרבית המחקרים התבססו על קוהורט של נתונים תוך-מחלקתיים ורובם נעשו בסין וטייוואן. כמו כן קיים סיכון להטיה בשל איסוף נתונים רטרוספקטיבי המכניס הטיית בחירה ושונות בטכניקת הבדיקה.
מסקנת החוקרים היתה כי דגמי בינה מלאכותית מציגים דיוק אבחנתי גבוה בסיווג אולטרסאונד של גידולי בלוטות רוק. תוצאות אלו מדגישות את הפוטנציאל של בינה מלאכותית ככלי אבחנתי, אך נדרש תיקוף רחב יותר טרם יישום קליני שגרתי.