پرش به محتوای اصلی
رامین خاورزاده DATA · ANALYSIS · PERSPECTIVE
TOOL · می‌خواهم از AI استفاده کنم

ارزیابی مقایسه‌ای مدل‌ها

کدام مدل برای کار ما بهتر جواب می‌دهد — روی سؤال‌های خودمان، نه در تبلیغ؟

پاسخ چند مدل به یک مجموعه سؤال ثابت را وارد کنید، بدون نام مدل امتیاز دهید و درستی، استناد، کیفیت فارسی، رعایت محدودیت، امتناع درست، زمان و هزینه را با بازهٔ عدم‌قطعیت و شناسنامهٔ هر اجرا ببینید — بدون رتبه‌بندی کلی از چند مثال.

  • فایل CSV یا جدول
  • فقط در مرورگر شما
  • دربارهٔ AI، بدون ارسال داده به AI

به چه کاری می‌آید

«کدام مدل بهتر است؟» فقط روی کار خودتان جواب دارد. چند سؤال واقعی از کارتان (با پاسخ مرجع اگر دارید) را به چند مدل بدهید، پاسخ‌ها را در یک فایل جمع کنید و اینجا بیاورید. پاسخ‌ها را کنار هم — اگر بخواهید بدون نام مدل — امتیاز می‌دهید و نتیجه را با بازهٔ عدم‌قطعیت می‌بینید.

برای هر پاسخ نام مدل، نسخه، تنظیمات و تاریخ نگه داشته می‌شود تا نتیجه قابل تکرار باشد. این نسخه به هیچ API وصل نیست و پاسخی از مدلی نمی‌گیرد.

LOCAL همهٔ محاسبه در همین مرورگر انجام می‌شود؛ داده‌ای که وارد می‌کنید به سرور سایت یا هیچ سرویس دیگری فرستاده نمی‌شود. با بستن یا تازه‌کردن صفحه چیزی از داده‌ها باقی نمی‌ماند؛ دکمهٔ «پاک‌کردن» هم همین حالا همه را از صفحه برمی‌دارد.

پاسخ‌های مدل‌ها

سطر اول عنوان ستون‌ها؛ جداکنندهٔ کاما، نقطه‌ویرگول یا تب خودکار شناخته می‌شود؛ حداکثر ۲۵ مگابایت. از اکسل «Save As → CSV UTF-8» بگیرید؛ فایل اکسل مستقیم باز نمی‌شود و هیچ فرمول یا ماکرویی اجرا نمی‌شود.

یا داده را از اکسل یا گوگل‌شیت بچسبانید

دانلود فایل نمونه (فرضی) ·

هر ردیف یک پاسخ: question_id، question، reference (اختیاری)، should_refuse (yes/no)، model، model_version، settings، date، answer، latency_s و cost (اختیاری)، و اگر قبلاً امتیاز داده‌اید score_correct، score_citation، score_persian، score_constraints و score_refused.

روش محاسبه و فرض‌ها

  • هر پاسخ پنج امتیاز انسانی می‌گیرد: درستی (درست ۱، تا حدی ۰٫۵، نادرست ۰)، استناد، کیفیت فارسی (۱ تا ۵)، رعایت محدودیت‌های دستور، و امتناع.
  • دقت: سهم پاسخ‌های کاملاً درست با بازهٔ ۹۵٪ ویلسون. امتناع درست و امتناع بی‌جا جدا حساب می‌شوند، چون مدلی که به همه چیز «نه» بگوید امن به نظر می‌رسد ولی بی‌فایده است.
  • مقایسهٔ دو مدل فقط روی سؤال‌هایی که هر دو پاسخ داده‌اند: شمارش سؤال‌هایی که فقط یکی درست جواب داده و آزمون علامت دقیق دوطرفه.
  • جدول نتیجه به ترتیب نام مرتب می‌شود و هیچ «رتبهٔ کلی» ساخته نمی‌شود.

محدودیت‌ها و استفادهٔ نادرست

  • نتیجه فقط دربارهٔ همین سؤال‌ها، همین نسخه‌ها و همین تنظیمات است. با کمتر از ۳۰ سؤال، حتی تفاوت‌های بزرگ هم ممکن است تصادفی باشند.
  • مدل‌ها با تغییر نسخه، تنظیمات یا حتی در دو اجرای پشت‌سرهم پاسخ متفاوت می‌دهند؛ برای تصمیم مهم، هر سؤال را چند بار اجرا کنید.
  • داور هوش مصنوعی خودش خطا و سوگیری دارد؛ اگر از آن استفاده می‌کنید، مرجع نهایی نیست.
  • هزینه و زمان را همان‌طور که در فایل آمده گزارش می‌کنیم؛ مقایسهٔ آن‌ها فقط وقتی معنی دارد که شرایط اجرا یکسان بوده باشد.

منابع روش

  • Liang, P. et al. (2023). Holistic evaluation of language models. Transactions on Machine Learning Research — ارزیابی چندمعیاره و گزارش شرایط اجرا.
  • Zheng, L. et al. (2023). Judging LLM-as-a-judge with MT-Bench and Chatbot Arena. NeurIPS — سوگیری‌های داور هوش مصنوعی.

قدم بعدی

برای سنجش اینکه دستیار فقط از اسناد مجاز جواب می‌دهد، محیط آزمایش پاسخ مستند را ببینید؛ و پیش از اتصال به سامانه‌ها، مجوزهایش را طراحی کنید.

همهٔ ابزارها بر اساس مسئله

نسخهٔ روش و تاریخ

VERSION نسخهٔ روش 1.0 · آخرین تغییر: ۵ مهر ۱۴۰۵