Skip to main content
Ramin Khavarzadeh DATA · ANALYSIS · PERSPECTIVE
TOOL · مدل یا پیش‌بینی دارم

انتخاب آستانه بر اساس هزینهٔ خطا

مدل احتمال می‌دهد؛ از چه احتمالی به بعد اقدام کنم که هزینهٔ خطاها کمترین باشد؟

احتمال مدل و نتیجهٔ واقعی را بدهید، هزینهٔ اقدام بی‌جا و ازدست‌دادن مورد واقعی و سقف ظرفیت را بنویسید تا آستانه روی یک بخش داده انتخاب و روی بخش دیگر گزارش شود — با ماتریس درهم‌ریختگی، precision، recall و مقایسه با سیاست‌های ساده.

  • فایل CSV یا جدول
  • فقط در مرورگر شما
  • بدون هوش مصنوعی

به چه کاری می‌آید

مدل‌های پیش‌بینی (ریزش مشتری، تقلب، احتمال خرید) احتمال می‌دهند، ولی تصمیم «اقدام بکنم یا نه» یک آستانه می‌خواهد. آستانهٔ پیش‌فرض ۰٫۵ تقریباً هیچ‌وقت درست نیست، چون هزینهٔ دو خطا برابر نیست: تماس بی‌جا با مشتری‌ای که نمی‌رفت ارزان است، ازدست‌دادن مشتری‌ای که می‌رفت گران.

فایل احتمال و نتیجهٔ واقعی را بدهید، هزینهٔ هر خطا و سقف ظرفیت تیم را بنویسید؛ ابزار آستانه را روی یک بخش داده انتخاب و روی بخش دیگر گزارش می‌کند، تا عدد گزارش‌شده با خود انتخاب تقلب نکرده باشد.

LOCAL همهٔ محاسبه در همین مرورگر انجام می‌شود؛ داده‌ای که وارد می‌کنید به سرور سایت یا هیچ سرویس دیگری فرستاده نمی‌شود. با بستن یا تازه‌کردن صفحه چیزی از داده‌ها باقی نمی‌ماند؛ دکمهٔ «پاک‌کردن» هم همین حالا همه را از صفحه برمی‌دارد.

امتیاز مدل و نتیجهٔ واقعی

سطر اول عنوان ستون‌ها؛ جداکنندهٔ کاما، نقطه‌ویرگول یا تب خودکار شناخته می‌شود؛ حداکثر ۲۵ مگابایت. از اکسل «Save As → CSV UTF-8» بگیرید؛ فایل اکسل مستقیم باز نمی‌شود و هیچ فرمول یا ماکرویی اجرا نمی‌شود.

یا داده را از اکسل یا گوگل‌شیت بچسبانید

دانلود فایل نمونه (فرضی) ·

نمونه امتیاز یک مدل ساختگی ریزش برای ۲٬۴۰۰ مشتری ساختگی است (ستون‌های probability و actual). مدل عمداً کمی بیش‌اطمینان ساخته شده.

هزینه‌ها (به ازای هر مورد، هر واحدی که می‌خواهید)

مثلاً هزینهٔ تماس و تخفیف برای مشتری‌ای که نمی‌رفت.

مثلاً سود ازدست‌رفتهٔ مشتری‌ای که رفت و با او تماس نگرفتید.

اگر اقدام روی مورد واقعی سودی جدا از جلوگیری از زیان دارد.

مثلاً ۳۰ اگر تیم فقط به ۳۰٪ مشتری‌ها می‌رسد.

تفکیک داده برای انتخاب و آزمون

با همین عدد، همان تقسیم دوباره ساخته می‌شود.

روش محاسبه و فرض‌ها

  • برای هر آستانهٔ t، روی مواردی با احتمال ≥ t اقدام می‌شود. هزینه برای هر مورد = [مثبت کاذب × هزینهٔ اقدام بی‌جا + منفی کاذب × هزینهٔ ازدست‌دادن − مثبت واقعی × سود + تعداد اقدام × هزینهٔ هر اقدام] ÷ تعداد موارد.
  • آستانه‌های نامزد، مقدارهای مشاهده‌شدهٔ احتمال‌اند (حداکثر ۲۰۱ نقطه از چندک‌ها) به‌علاوهٔ «اقدام روی هیچ‌کس». ارزان‌ترین آستانه در بخش انتخاب، با رعایت سقف ظرفیت، انتخاب می‌شود.
  • precision = مثبت واقعی ÷ همهٔ اقدام‌ها؛ recall = مثبت واقعی ÷ همهٔ موارد واقعاً مثبت؛ بازه‌ها ویلسون ۹۵٪ روی بخش آزمون.
  • آستانهٔ نظری = (هزینهٔ اقدام بی‌جا + هزینهٔ هر اقدام) ÷ (هزینهٔ اقدام بی‌جا + هزینهٔ ازدست‌دادن + سود)؛ فقط برای مدل کالیبره.

محدودیت‌ها و استفادهٔ نادرست

  • هزینه‌ها فرض شما هستند و نتیجه به آن‌ها حساس است؛ با چند مقدار امتحان کنید.
  • این ابزار فرض می‌کند اقدام، زیان مورد مثبت را کاملاً جلوگیری می‌کند. در واقع تماس با مشتری در حال رفتن فقط بخشی از آن‌ها را نگه می‌دارد؛ اثر علّی اقدام را فقط آزمایش با گروه کنترل نشان می‌دهد.
  • اگر دادهٔ آزمون از دورهٔ دیگری است یا توزیع عوض شده، آستانه ممکن است دیگر بهینه نباشد؛ از «تغییر توزیع» استفاده کنید.
  • احتمال بیرون از ۰ تا ۱ رد می‌شود؛ احتمال درصدی (۰ تا ۱۰۰) هم برای جلوگیری از ابهام پذیرفته نمی‌شود.

منابع روش

  • Elkan, C. (2001). The foundations of cost-sensitive learning. IJCAI.
  • Provost, F. & Fawcett, T. (2013). Data Science for Business, ch. 7–8. O'Reilly.

قدم بعدی

همهٔ ابزارها بر اساس مسئله

نسخهٔ روش و تاریخ

VERSION نسخهٔ روش 1.0 · آخرین تغییر: 5 مهر 1405