بسیاری از مدیران ایرانی پیاده‌سازی پروژه‌های تحلیل داده و هوش مصنوعی را به این دلیل متوقف می‌کنند که تصور می‌کنند دیتاست چندصد هزارتایی ندارند. در واقعیتِ کسب‌وکارهای ایران، از تخمین ریزش مشتریان B2B گرفته تا پیش‌بینی خرابی تجهیزات صنعتی، مجموع داده‌های موجود غالباً از چندصد تا چند هزار ردیف فراتر نمی‌رود. انتظار برای جمع‌آوری داده‌های بزرگ معمولاً به معنای از دست دادن زمان و سرمایه است.

پاسخ کوتاه و عملی این است که با ۲۰۰ تا ۵۰۰ نمونه داده ساختاریافته و تمیز، می‌توان مدل‌های پیش‌بینی کاربردی و سودآوری ساخت. کلید موفقیت در این شرایط، استفاده از مدل‌های آماری ساده‌تر، مهندسی ویژگی بر اساس دانش دامنه کسب‌وکار، به‌کارگیری روش‌های بیزی و پرهیز جدی از شبکه‌های عمیق پیچیده است.

بازتعریف مسئله و کاهش پیچیدگی هدف

نخستین قدم در مواجهه با داده‌های محدود، ساده‌سازی هدف مسئله است. اگر داده‌های شما کم است، نباید از مدل بخواهید متغیری پیوسته را با دقت بالا پیش‌بینی کند یا ۱۰۰ کلاس مختلف را تشخیص دهد. به‌جای پیش‌بینی دقیق مبلغ خرید بعدی مشتری، مسئله را به تشخیص سه رده خرید کم، متوسط و بالا تبدیل کنید.

کاهش ابعاد مسئله به مدل اجازه می‌دهد با تعداد داده کمتر، الگوی اصلی را پیدا کند. در یک پروژه تحلیلی که برای یک شرکت تامین مالی خرد انجام دادیم، تغییر مسئله از پیش‌بینی دقیق روزهای تاخیر در پرداخت به یک مسئله طبقه‌بندی سه حالته، دقت پیش‌بینی مدل را روی ۲۵۰ داده موجود از ۵۱ درصد به ۸۳ درصد رساند.

  • تبدیل مسائل رگرسیون پیچیده به طبقه‌بندی‌های چند رده‌ای محدود
  • ادغام کلاس‌های کم‌تکرار در یک رده عمومی‌تر برای کاهش ناهموازنی داده
  • محدود کردن افق پیش‌بینی به بازه‌های زمانی کوتاه‌تر که نویز کمتری دارند

الگوریتم‌ها و روش‌های فنی مناسب برای دیتاست کوچک

بزرگ‌ترین اشتباه فنی در پروژه‌های با داده کم، استفاده از الگوریتم‌های پرپارامتر مثل شبکه‌های عصبی عمیق است. این مدل‌ها به دلیل داشتن میلیون‌ها پارامتر، روی داده‌های کوچک به سرعت دچار بیش‌برازش می‌شوند و در محیط واقعی شکست می‌خورند. در این شرایط، الگوریتم‌های کلاسیک آماری و درخت‌های تصمیم‌گیری عملکرد به مراتب بهتری دارند.

مدل‌های رگرسیون خطی و لجستیک با جریمه‌سازی مانند رگرسیون ریج و لاسو، به همراه الگوریتم رندوم فارست با محدود کردن عمق درخت‌ها، بهترین گزینه برای شروع هستند. این الگوریتم‌ها نیازی به حجم عظیم داده ندارند و رفتارهای غیرعادی در داده را بهتر مدیریت می‌کنند.

  • الگوریتم‌های درخت پایه مانند XGBoost و Random Forest با تنظیم سخت‌گیرانه عمق درخت
  • روش‌های بیزی که امکان وارد کردن دانش قبلی متخصصان به فرمول‌بندی مدل را می‌دهند
  • استفاده از یادگیری انتقال در داده‌های متنی یا تصویری، که از مدل‌های پیش‌آموزش‌دیده روی داده‌های مشابه استفاده می‌کند

روش‌های تولید و تقویت داده: فرصت‌ها و خطرات

تکنیک‌های ساخت داده مصنوعی مانند الگوریتم SMOTE برای مسئله‌های غیرهموزن یا CTGAN برای داده‌های جدول‌بندی شده، ابزارهای مفیدی هستند اما ندانسته استفاده کردن از آن‌ها خطرناک است. داده مصنوعی معلوم جدیدی به مدل اضافه نمی‌کند، بلکه فقط ساختار موجود را پررنگ‌تر می‌سازد.

اگر داده اولیه شما دارای تورش یا خطا باشد، تولید داده مصنوعی فقط آن خطاها را بزرگ‌نمایی می‌کند. تجربه ما نشان داده است که مهندسی ویژگی دست‌ساز توسط متخصص دامنه، همیشه نتایج بهتری نسبت به تولید انبوه داده مصنوعی ایجاد می‌کند.

  • استفاده از الگوریتم SMOTE فقط پس از جداسازی کامل داده‌های تست برای جلوگیری از نشت داده
  • ترکیب داده‌های متنی غیرساختاریافته مثل یادداشت‌های پشتیبانی یا پیام‌های واتس‌اپ با داده‌های عددی CRM
  • بهره‌گیری از یادگیری فعال برای نشانه‌گذاری دستی فقط ۵۰ تا ۱۰۰ نمونه‌ای که بیشترین ابهام را برای مدل دارند

چه زمانی نباید با داده کم مدل‌سازی را شروع کرد؟

شفافیت در مشاوره ایجاب می‌کند بگوییم که داده کم در برخی سناریوها مطلقاً جوابگو نیست. اگر میزان نویز در داده‌های شما بالا باشد یا محیط تصمیم‌گیری دچار تغییرات ساختاری شدید شده باشد، مدل ساخته شده بر اساس داده محدود ناپایدار خواهد بود.

همچنین در تصمیم‌گیری‌های پرریسک مانند تایید یا رد خودکار تسهیلات مالی بدون دخالت انسان، اتکا به مدلی که روی چندصد داده آموزش دیده، از نظر پروسه‌های ریسک سازمانی پذیرفته نیست و می‌تواند خسارات سنگینی به بار آورد.

  • وقتی نرخ خطا در ثبت اولیه داده‌ها بالا است و امکان پالایش آن‌ها وجود ندارد
  • زمانی که رفتارهای جدیدی در بازار رخ داده که هیچ سابقه‌ای از آن‌ها در داده‌های گذشته ثبت نشده است
  • در سیستم‌های تصمیم‌گیری تمام‌خودکار با ریسک مالی یا حقوقی بالا

مسیر عملی برای شروع کار در کسب‌وکار شما

برای شروع نیازی به خرید زیرساخت‌های گران‌قیمت یا انتظار چندساله برای جمع‌آوری داده ندارید. با صورت‌بندی درست، می‌توانید ظرف دو تا چهار هفته یک نمونه اولیه کاربردی پیاده‌سازی کنید.

فایل‌های داده موجود خود را حتماً بررسی کنید، حتی اگر در قالب چند فایل اکسل پراکنده باشند. مسئله اصلی کسب‌وکار را به یک هدف محدود و شفاف تبدیل کنید و در گام اول با الگوریتم‌های ساده آماری یک خط پایه برای ارزیابی عملکرد ایجاد نمایید. در تیم هومات، ما معمولاً پروژه‌های داده‌های محدود را با یک فاز ارزیابی امکان‌سنجی دو هفته‌ای شروع می‌کنیم تا مشخص شود آیا ارزش افزوده اقتصادی مد نظر حاصل می‌شود یا خیر.