مدل‌سازی ساده و خروجی نهایی

ارزیابی مدل با Scorer

آیا مدل واقعاً خوب است؟

ساختن یک مدل کافی نیست؛ باید بدانیم چقدر قابل‌اعتماد است. node Scorer پیش‌بینی مدل روی داده آزمون را با مقدار واقعی مقایسه می‌کند و چند معیار کلیدی تولید می‌کند، مهم‌ترین آن‌ها Confusion Matrix (ماتریس درهم‌ریختگی) و Accuracy (دقت کلی) است.

نمونه خروجی Confusion Matrix برای پیش‌بینی ریزش مشتری:

                  پیش‌بینی: فعال   پیش‌بینی: ریزش‌کرده
واقعی: فعال            180                 20
واقعی: ریزش‌کرده         15                 85

Accuracy = (180 + 85) / (180 + 20 + 15 + 85) = 88.3٪

عدد Accuracy به‌تنهایی همیشه کافی نیست، به‌خصوص وقتی داده نامتوازن است؛ مثلاً اگر فقط ۵٪ مشتریان واقعاً ریزش می‌کنند، مدلی که همیشه «فعال» پیش‌بینی می‌کند هم Accuracy بالای ۹۵٪ خواهد داشت، اما عملاً بی‌فایده است. در این موقعیت‌ها باید به معیارهای دیگر مثل Precision (از میان مواردی که مدل «ریزش‌کرده» پیش‌بینی کرد، چند درصد واقعاً درست بودند) و Recall (از میان تمام موارد واقعی ریزش، چند درصد را مدل توانست پیدا کند) توجه کرد. Scorer این معیارها را هم به‌طور خودکار محاسبه و در جدول خروجی نمایش می‌دهد.

یک عادت خوب این است که همیشه پیش از اعتماد به یک مدل، نتیجه Scorer را با یک مدل ساده مرجع (baseline) مثل «همیشه پرتکرارترین کلاس را پیش‌بینی کن» مقایسه کنید؛ اگر مدل شما بهبود محسوسی نسبت به این مرجع ساده نداشته باشد، احتمالاً نیاز به بازبینی ویژگی‌های ورودی یا داده بیشتر دارد.

برای ذخیره‌ی پیشرفت و شرکت در آزمون، وارد شوید — رایگان است.