Skip to main content
Ramin Khavarzadeh DATA · ANALYSIS · PERSPECTIVE
TOOL · می‌خواهم کمپین اجرا کنم

آزمایشگاه A/B

این آزمایش چند نفر و چند روز لازم دارد، و بعد از اجرا، نسخهٔ جدید واقعاً بهتر بود؟

پیش از اجرا حجم نمونه، توان و مدت آزمایش را برای نرخ تبدیل حساب کنید؛ بعد از اجرا تفاوت و بازهٔ عدم‌قطعیت، سلامت تخصیص (SRM)، اثر چند نسخه و فرق «معنادار آماری» با «مهم برای کسب‌وکار» را ببینید.

  • چند عدد در فرم
  • فقط در مرورگر شما
  • بدون هوش مصنوعی

به چه کاری می‌آید

آزمایش A/B دو بخش دارد و هر دو اینجا هستند. پیش از شروع: با نرخ تبدیل فعلی و کوچک‌ترین بهبودی که برایتان ارزش دارد، چند نفر و چند روز لازم است. بعد از پایان: نسخهٔ جدید واقعاً بهتر بود، چقدر، و آیا خود آزمایش سالم اجرا شد.

این نسخه فقط معیار «تبدیل دودویی» را پشتیبانی می‌کند: هر نفر یا تبدیل شده یا نه (خرید، ثبت‌نام، کلیک). برای درآمد، تعداد سفارش یا زمان تحویل آزمون دیگری لازم است و این ابزار آن را تقریب نمی‌زند.

LOCAL همهٔ محاسبه در همین مرورگر انجام می‌شود؛ داده‌ای که وارد می‌کنید به سرور سایت یا هیچ سرویس دیگری فرستاده نمی‌شود. با بستن یا تازه‌کردن صفحه چیزی از داده‌ها باقی نمی‌ماند؛ دکمهٔ «پاک‌کردن» هم همین حالا همه را از صفحه برمی‌دارد.

الف) طراحی آزمایش

از داده‌های چند هفتهٔ اخیر همان صفحه و همان تعریف تبدیل.

احتمال «برندهٔ» کاذب؛ رایج ۵.

احتمال دیدن اثر اگر واقعاً وجود داشته باشد؛ رایج ۸۰.

۵۰ برای تقسیم مساوی دو گروه.

بدون کنترل؛ ترافیک بقیه بین آن‌ها مساوی تقسیم می‌شود.

کسانی که واقعاً به صفحهٔ آزمایش می‌رسند؛ اختیاری، برای مدت آزمایش.

ب) تحلیل نتیجه

ردیف اول کنترل است. «تعداد افراد» یعنی کسانی که به آن گروه تخصیص یافتند (نه بازدیدها)، و «تبدیل» تعداد افرادی که دست‌کم یک بار تبدیل شدند.

مثلاً ۰٫۲: کمتر از این، ارزش پیاده‌سازی ندارد. اختیاری، برای خوانش «اهمیت عملی».

اگر هنوز به آن نرسیده‌اید، ابزار دربارهٔ توقف زودهنگام هشدار می‌دهد.

روش محاسبه و فرض‌ها

  • حجم نمونه برای آزمون دوطرفهٔ دو نسبت (فلیس، بدون تصحیح پیوستگی): n₁ = [z(1−α/2)·√(p̄(1−p̄)(1+1/k)) + z(1−β)·√(p₁(1−p₁) + p₂(1−p₂)/k)]² ÷ (p₂ − p₁)²، که k نسبت اندازهٔ گروه آزمایشی به کنترل و p̄ میانگین وزنی دو نرخ است.
  • با چند نسخهٔ آزمایشی، α بین مقایسه‌ها تقسیم می‌شود (بونفرونی). مدت = کل نمونه ÷ ترافیک روزانه؛ به هفتهٔ کامل گرد کنید تا اثر روزهای هفته متوازن شود.
  • تحلیل: تفاوت نرخ‌ها با بازهٔ ۹۵٪ هیبرید نیوکامب، تغییر نسبی با بازهٔ لگاریتمی نسبت، p از آزمون z دو نسبت با واریانس ادغام‌شده، و تعدیل هولم وقتی چند نسخه هست.
  • عدم‌تطابق نسبت تخصیص (SRM): آزمون χ² نیکویی برازش بین تعداد افراد هر گروه و نسبت برنامه‌ریزی‌شده؛ p کمتر از ۰٫۰۰۱ هشدار جدی است.
  • اهمیت عملی: اگر «کوچک‌ترین تفاوت مهم» را بدهید، خوانش بر اساس جای بازه نسبت به آن آستانه است، نه فقط p.

محدودیت‌ها و استفادهٔ نادرست

  • فقط معیار دودویی. میانگین درآمد هر بازدیدکننده، تعداد سفارش یا زمان تحویل توزیع دیگری دارند و با این آزمون سنجیده نمی‌شوند.
  • اگر نتیجه را هر روز نگاه کنید و هر وقت «معنادار» شد متوقف کنید، احتمال خطا خیلی بیشتر از α می‌شود. حجم را از قبل ثبت کنید.
  • آزمایشی که واحد تخصیصش «جلسه» یا «بازدید» است ولی تبدیل را «نفر» می‌شمارد، مشاهده‌های مستقل ندارد و بازه‌ها را زیادی باریک نشان می‌دهد.
  • نتیجهٔ دو هفته ممکن است اثر تازگی باشد و در بلندمدت نماند.
  • معنادار آماری به معنی مهم یا سودآور نیست؛ و «معنادار نبود» به معنی «بی‌اثر است» نیست.

منابع روش

  • Fleiss, J. L., Levin, B. & Paik, M. C. (2003). Statistical Methods for Rates and Proportions (3rd ed.). Wiley — حجم نمونهٔ دو نسبت.
  • Kohavi, R., Tang, D. & Xu, Y. (2020). Trustworthy Online Controlled Experiments. Cambridge University Press — SRM، نگاه‌های مکرر، اهمیت عملی.
  • Newcombe, R. G. (1998). Statistics in Medicine, 17(8); Katz, D. et al. (1978). Biometrics, 34(3) — بازهٔ تفاوت و نسبت.

قدم بعدی

RESOURCES برنامه‌ریزی آزمایش اثربخشی تبلیغات

همهٔ ابزارها بر اساس مسئله

نسخهٔ روش و تاریخ

VERSION نسخهٔ روش 1.0 · آخرین تغییر: 5 مهر 1405