پروژه غربالگری تیروئید بر پایه ۷,۲۰۰ داده واقعی بیماران، نشان می‌دهد که چطور مدل‌های یادگیری عمیق با بالاترین نرخ دقت (Accuracy)، ممکن است بیشترین تعداد بیماران واقعی را نادیده بگیرند. این مطالعه کاربردی اثبات می‌کند که در محیط‌های عملیاتی و حساس مانند پزشکی، اتکا به معیارهای ارزیابی عمومی می‌تواند به تصمیم‌گیری‌های نادرست و خطرناک منجر شود.

در این پروژه، چهار الگوی آموزش مختلف روی داده‌های غربالگری تیروئید مقایسه شده‌اند تا نقش توابع زیان پیشرفته و تحلیل آستانه تصمیم‌گیری در کاهش خطای بالینی تبیین شود.

مسئله داده‌های نامتوازن و تله Accuracy

در مجموعه داده مورد بررسی، حدود ۹۲.۶ درصد از افراد سالم هستند. این بدان معناست که یک مدل ساده که تمام افراد را سالم تشخیص دهد، بدون انجام هیچ پردازشی به دقت ۹۲.۶ درصد دست می‌یابد. مدل پرسپترون چندلایه (MLP) با تابع زیان استاندارد Cross-Entropy به دقت ۹۸.۳۹ درصد می‌رسد، اما در ردیابی بیماران دچار خطای فاحش می‌شود.

نتایج آزمایش‌ها نشان می‌دهد که این مدل استاندارد به طور میانگین ۱۲.۶ بیمار را در داده‌های ارزیابی نادیده می‌گیرد. در مقابل، مدل آموزش‌دیده با تابع زیان Focal Loss با وجود دقت کل کمتر (۹۶.۹۰ درصد)، تنها ۳.۸ بیمار را از دست می‌دهد. این تفاوت اثبات می‌کند که بالاترین دقت، الزماً بهترین عملکرد بالینی نیست.

راهکارهای فنی برای ارزیابی واقعی مدل

برای حل چالش عدم توازن کلاس‌ها و ارزیابی درست سیستم‌های تشخیص هوشمند، تکنیک‌های زیر در پروژه پیاده‌سازی شده‌اند:

  • بهره‌گیری از توابع زیان Focal Loss و Weighted Loss جهت جریمه بیشتر مدل در صورت اشتباه در کلاس نادر
  • ارزیابی مدل با منحنی Precision-Recall (AUPRC) به جای ROC-AUC برای جلوگیری از خوش‌بینی کاذب ناشی از تعداد زیاد نمونه‌های منفی
  • تنظیم فرایند Early Stopping بر پایه معیار Macro-F1 به جای Accuracy برای جلوگیری از توقف آموزش در حالت عدم تشخیص

تنظیم آستانه تصمیم‌گیری و کالیبراسیون احتمالات

در محیط‌های بیمارستانی، هزینه یک تشخیص اشتباه با هزینه یک آزمایش مجدد (هشدار کاذب) یکسان نیست. تابع زیان به تنهایی از ارزش مالی و بالینی این خطاها آگاه نیست، بنابراین آستانه تصمیم‌گیری (Decision Threshold) باید متناسب با نسبت هزینه تعیین شود.

در این پروژه نشان داده شده است که اگر هزینه عدم تشخیص ۵۰ برابر هشدار کاذب باشد، آستانه بهینه‌ی تصمیم‌گیری فاصله‌ی زیادی با مقدار پیش‌فرض ۰.۵ خواهد داشت. همچنین کالیبراسیون خروجی مدل باعث می‌شود خروجی شبکه عصبی، منعکس‌کننده احتمال واقعی بیماری در دنیای واقعی باشد.