پرش به محتوای اصلی
رامین خاورزاده DATA · ANALYSIS · PERSPECTIVE
TOOL · مدل یا پیش‌بینی دارم

بررسی کالیبراسیون مدل

وقتی مدل می‌گوید ۳۰٪، واقعاً حدود ۳۰٪ اتفاق می‌افتد؟

احتمال مدل و نتیجهٔ واقعی را بدهید تا نمودار قابلیت اعتماد با تعداد نمونهٔ هر بازه، امتیاز بریر، ECE و قدرت تفکیک (AUC) را جدا از هم ببینید — و اثر یک اصلاح ساده که روی دادهٔ جدا سنجیده شده.

  • فایل CSV یا جدول
  • فقط در مرورگر شما
  • بدون هوش مصنوعی

به چه کاری می‌آید

وقتی مدل می‌گوید «۳۰٪ احتمال ریزش»، آیا از چنین مشتری‌هایی واقعاً حدود ۳۰٪ می‌روند؟ اگر نه، احتمال‌ها را نمی‌شود مستقیم در حساب هزینه و سود یا تصمیم آستانه به کار برد. این «کالیبراسیون» است و با «قدرت تفکیک» (اینکه مدل موارد مثبت را بالاتر از منفی‌ها رتبه می‌دهد) فرق دارد: مدلی می‌تواند خوب رتبه بدهد ولی احتمال‌هایش همه دو برابر واقع باشند.

فایل احتمال و نتیجهٔ واقعی را از دادهٔ ارزیابی (نه دادهٔ آموزش مدل) بدهید تا نمودار قابلیت اعتماد، تعداد نمونهٔ هر بازه، امتیاز بریر، ECE و AUC را جدا از هم ببینید؛ و اینکه یک اصلاح ساده، روی دادهٔ جدا سنجیده، چقدر کمک می‌کند.

LOCAL همهٔ محاسبه در همین مرورگر انجام می‌شود؛ داده‌ای که وارد می‌کنید به سرور سایت یا هیچ سرویس دیگری فرستاده نمی‌شود. با بستن یا تازه‌کردن صفحه چیزی از داده‌ها باقی نمی‌ماند؛ دکمهٔ «پاک‌کردن» هم همین حالا همه را از صفحه برمی‌دارد.

احتمال مدل و نتیجهٔ واقعی

سطر اول عنوان ستون‌ها؛ جداکنندهٔ کاما، نقطه‌ویرگول یا تب خودکار شناخته می‌شود؛ حداکثر ۲۵ مگابایت. از اکسل «Save As → CSV UTF-8» بگیرید؛ فایل اکسل مستقیم باز نمی‌شود و هیچ فرمول یا ماکرویی اجرا نمی‌شود.

یا داده را از اکسل یا گوگل‌شیت بچسبانید

دانلود فایل نمونه (فرضی) ·

همان نمونهٔ ابزار آستانه: امتیاز مدل ساختگی ریزش برای ۲٬۴۰۰ مشتری ساختگی که عمداً کمی بیش‌اطمینان است.

بازه‌بندی
نوع بازه

بین ۵ و ۲۰؛ ECE به این انتخاب حساس است.

روش محاسبه و فرض‌ها

  • موارد بر اساس احتمال در بازه‌ها گروه می‌شوند. برای هر بازه: تعداد، میانگین احتمال، نرخ واقعی و بازهٔ ۹۵٪ ویلسون. بازه با کمتر از ۲۰ مورد «کم‌نمونه» است.
  • امتیاز بریر = میانگین (احتمال − نتیجه)². برای مقایسه، بریر مدلی که به همه نرخ پایه را بدهد p̄(1 − p̄) است. تجزیهٔ مورفی (قابلیت اعتماد − تفکیک + عدم‌قطعیت) بر پایهٔ همان بازه‌ها و تقریبی است.
  • ECE = مجموع (سهم موارد بازه × |نرخ واقعی − میانگین پیش‌بینی|). عددش به نوع و تعداد بازه بستگی دارد و همیشه کنار آن گفته می‌شود.
  • AUC با آمارهٔ من‌ویتنی: احتمال اینکه یک مورد مثبت تصادفی احتمال بالاتری از یک منفی تصادفی بگیرد (تساوی نیم). این قدرت تفکیک است، نه کالیبراسیون.
  • اصلاح پلات: رگرسیون لجستیک نتیجه روی لوجیت احتمال (نیوتن‌رافسون)، برازش روی یک نیمهٔ تصادفی و سنجش روی نیمهٔ دیگر.

محدودیت‌ها و استفادهٔ نادرست

  • کالیبراسیون را روی دادهٔ ارزیابی بسنجید؛ روی دادهٔ آموزش مدل، همیشه بهتر از واقع دیده می‌شود.
  • کالیبراسیون خوب امروز تضمین فردا نیست: اگر نرخ پایه یا مشتری‌ها عوض شوند، احتمال‌ها هم از کالیبراسیون می‌افتند.
  • کالیبره‌بودن کل داده به معنی کالیبره‌بودن هر گروه (شهر، کانال) نیست؛ برای گروه‌های مهم جدا بسنجید.
  • اصلاح پلات ساده است و برای انحراف‌های پیچیده کافی نیست؛ و اگر روی داده‌ای که گزارش می‌کنید برازش شود، بهبودش خوش‌بینانه است — برای همین اینجا جدا سنجیده می‌شود.

منابع روش

  • Brier, G. W. (1950). Verification of forecasts expressed in terms of probability. Monthly Weather Review, 78(1).
  • Murphy, A. H. (1973). A new vector partition of the probability score. Journal of Applied Meteorology, 12(4).
  • Platt, J. (1999). Probabilistic outputs for support vector machines. Advances in Large Margin Classifiers.
  • Niculescu-Mizil, A. & Caruana, R. (2005). Predicting good probabilities with supervised learning. ICML.

قدم بعدی

همهٔ ابزارها بر اساس مسئله

نسخهٔ روش و تاریخ

VERSION نسخهٔ روش 1.0 · آخرین تغییر: ۵ مهر ۱۴۰۵