Skip to main content
Ramin Khavarzadeh DATA · ANALYSIS · PERSPECTIVE
TOOL · فایل سفارش دارم

بررسی شناسه‌های تکراری

کدام رکوردها احتمالاً یک مشتری‌اند — و چرا؟

فایل مشتری‌ها یا رکوردها را (حتی مستعارسازی‌شده) بدهید تا تطبیق‌های قطعی از روی شناسهٔ یکسان، تطبیق‌های احتمالی از روی نام و ویژگی‌ها، شناسه‌های مشترک یا پیش‌فرض و دلیل هر تطبیق را ببینید — بدون هیچ ادغام خودکاری.

  • فایل CSV یا جدول
  • فقط در مرورگر شما
  • بدون هوش مصنوعی

به چه کاری می‌آید

یک مشتری با دو شمارهٔ نوشتاری متفاوت، یک ایمیل با حروف بزرگ و کوچک، یا یک نام با «ي» عربی می‌تواند دو یا سه رکورد جدا بسازد و شمارش مشتری، ارزش مشتری و کوهورت را خراب کند. این ابزار رکوردهای شبیه را پیدا می‌کند و برای هر تطبیق دلیلش را می‌گوید؛ هیچ رکوردی را ادغام نمی‌کند.

برای این کار نام و شمارهٔ واقعی لازم نیست: فایل مستعارسازی‌شده (مثلاً شماره یا ایمیل هش‌شده) هم کار می‌کند؛ فقط تطبیق احتمالی به ستونی مثل نام یا شهر نیاز دارد.

LOCAL همهٔ محاسبه در همین مرورگر انجام می‌شود؛ داده‌ای که وارد می‌کنید به سرور سایت یا هیچ سرویس دیگری فرستاده نمی‌شود. با بستن یا تازه‌کردن صفحه چیزی از داده‌ها باقی نمی‌ماند؛ دکمهٔ «پاک‌کردن» هم همین حالا همه را از صفحه برمی‌دارد.

فهرست مشتری‌ها یا رکوردها

سطر اول عنوان ستون‌ها؛ جداکنندهٔ کاما، نقطه‌ویرگول یا تب خودکار شناخته می‌شود؛ حداکثر ۲۵ مگابایت. از اکسل «Save As → CSV UTF-8» بگیرید؛ فایل اکسل مستقیم باز نمی‌شود و هیچ فرمول یا ماکرویی اجرا نمی‌شود.

یا داده را از اکسل یا گوگل‌شیت بچسبانید

دانلود فایل نمونه (فرضی) ·

ستون‌ها از روی عنوان شناخته می‌شوند: phone یا «موبایل»، email یا «ایمیل»، customer_id یا «کد مشتری» به‌عنوان شناسه؛ name، city، birth_year و postal به‌عنوان ستون کمکی؛ record_id برای ارجاع.

تنظیم

اگر خالی بماند از روی عنوان پیدا می‌شوند. چند ستون را با کاما جدا کنید.

مقداری که در ردیف‌های بیشتری تکرار شده، به‌جای گروه‌شدن «شناسهٔ مشترک» گزارش می‌شود.

روش محاسبه و فرض‌ها

  • یکدست‌سازی: موبایل فقط رقم، با تبدیل ۰۰۹۸، +۹۸ و ۹۸ به صفر ابتدایی؛ ایمیل کوچک‌حرف و بدون فاصله؛ متن با «ی» و «ک» فارسی، نیم‌فاصله و نشانه‌ها به فاصله.
  • تطبیق قطعی: شناسهٔ یکسان پس از یکدست‌سازی، با پیوستن زنجیره‌ای (اگر الف و ب یک موبایل دارند و ب و ج یک ایمیل، هر سه یک گروه‌اند). مقداری که در بیش از حد تعیین‌شده تکرار شده یا شکل پیش‌فرض دارد (یک رقم تکراری، test@، ۰۹۱۲۰۰۰۰۰…) گروه نمی‌شود.
  • تناقض: اگر در یک گروه سال تولد یا کد پستی فرق کند، یا نام‌ها شباهت کمتر از ۰٫۸ داشته باشند، گروه با هشدار «متناقض» می‌آید.
  • تطبیق احتمالی: رکوردهایی که دو حرف اول یکی از واژه‌های نامشان یکی است با هم مقایسه می‌شوند؛ شباهت نام با جارو-وینکلر (روی واژه‌های مرتب‌شده و روی نام بی‌فاصله، هر کدام بیشتر)، به‌علاوهٔ ۰٫۰۵ برای هر ستون کمکی یکسان و منهای ۰٫۱۵ برای هر ستون متفاوت، و منهای ۰٫۱ اگر هر دو شناسهٔ متفاوت دارند.

محدودیت‌ها و استفادهٔ نادرست

  • تطبیق دقیق هم اثبات هویت نیست: شمارهٔ مشترک خانواده، شمارهٔ شرکت یا شماره‌ای که به فرد دیگری واگذار شده، رکوردهای دو نفر را یکی نشان می‌دهد.
  • دو نفر با نام رایج در یک شهر شبیه هم دیده می‌شوند؛ برای همین جفت‌های بدون شناسهٔ مشترک هرگز «قطعی» نیستند.
  • هش‌کردن فقط تطبیق دقیق را حفظ می‌کند: دو شماره که قبل از هش کمی فرق داشتند، بعد از هش کاملاً متفاوت‌اند. پیش از هش، یکدست کنید.
  • برای فایل‌های خیلی بزرگ با نام‌های تکراری، تعداد مقایسه‌ها به ۳ میلیون محدود است.

منابع روش

  • Christen, P. (2012). Data Matching. Springer — یکدست‌سازی، بلوک‌بندی و تطبیق احتمالی.
  • Winkler, W. E. (1990). String comparator metrics and enhanced decision rules in the Fellegi–Sunter model of record linkage — شباهت جارو-وینکلر.

قدم بعدی

پس از تصمیم دربارهٔ تکرارها، کیفیت کل فایل را بسنجید و بعد کوهورت و ارزش مشتری را روی رکوردهای یکتا بسازید.

همهٔ ابزارها بر اساس مسئله

نسخهٔ روش و تاریخ

VERSION نسخهٔ روش 1.0 · آخرین تغییر: 4 مهر 1405