پروژه غربالگری تیروئید بر پایه ۷,۲۰۰ داده واقعی بیماران، نشان میدهد که چطور مدلهای یادگیری عمیق با بالاترین نرخ دقت (Accuracy)، ممکن است بیشترین تعداد بیماران واقعی را نادیده بگیرند. این مطالعه کاربردی اثبات میکند که در محیطهای عملیاتی و حساس مانند پزشکی، اتکا به معیارهای ارزیابی عمومی میتواند به تصمیمگیریهای نادرست و خطرناک منجر شود.
در این پروژه، چهار الگوی آموزش مختلف روی دادههای غربالگری تیروئید مقایسه شدهاند تا نقش توابع زیان پیشرفته و تحلیل آستانه تصمیمگیری در کاهش خطای بالینی تبیین شود.
مسئله دادههای نامتوازن و تله Accuracy
در مجموعه داده مورد بررسی، حدود ۹۲.۶ درصد از افراد سالم هستند. این بدان معناست که یک مدل ساده که تمام افراد را سالم تشخیص دهد، بدون انجام هیچ پردازشی به دقت ۹۲.۶ درصد دست مییابد. مدل پرسپترون چندلایه (MLP) با تابع زیان استاندارد Cross-Entropy به دقت ۹۸.۳۹ درصد میرسد، اما در ردیابی بیماران دچار خطای فاحش میشود.
نتایج آزمایشها نشان میدهد که این مدل استاندارد به طور میانگین ۱۲.۶ بیمار را در دادههای ارزیابی نادیده میگیرد. در مقابل، مدل آموزشدیده با تابع زیان Focal Loss با وجود دقت کل کمتر (۹۶.۹۰ درصد)، تنها ۳.۸ بیمار را از دست میدهد. این تفاوت اثبات میکند که بالاترین دقت، الزماً بهترین عملکرد بالینی نیست.
راهکارهای فنی برای ارزیابی واقعی مدل
برای حل چالش عدم توازن کلاسها و ارزیابی درست سیستمهای تشخیص هوشمند، تکنیکهای زیر در پروژه پیادهسازی شدهاند:
- بهرهگیری از توابع زیان Focal Loss و Weighted Loss جهت جریمه بیشتر مدل در صورت اشتباه در کلاس نادر
- ارزیابی مدل با منحنی Precision-Recall (AUPRC) به جای ROC-AUC برای جلوگیری از خوشبینی کاذب ناشی از تعداد زیاد نمونههای منفی
- تنظیم فرایند Early Stopping بر پایه معیار Macro-F1 به جای Accuracy برای جلوگیری از توقف آموزش در حالت عدم تشخیص
تنظیم آستانه تصمیمگیری و کالیبراسیون احتمالات
در محیطهای بیمارستانی، هزینه یک تشخیص اشتباه با هزینه یک آزمایش مجدد (هشدار کاذب) یکسان نیست. تابع زیان به تنهایی از ارزش مالی و بالینی این خطاها آگاه نیست، بنابراین آستانه تصمیمگیری (Decision Threshold) باید متناسب با نسبت هزینه تعیین شود.
در این پروژه نشان داده شده است که اگر هزینه عدم تشخیص ۵۰ برابر هشدار کاذب باشد، آستانه بهینهی تصمیمگیری فاصلهی زیادی با مقدار پیشفرض ۰.۵ خواهد داشت. همچنین کالیبراسیون خروجی مدل باعث میشود خروجی شبکه عصبی، منعکسکننده احتمال واقعی بیماری در دنیای واقعی باشد.