فاینتیونینگ دانش اضافه نمیکند؛ رفتار را شکل میدهد و هزینهٔ واقعیاش نگهداری است
فاینتیونینگ بر پایهٔ مستندات OpenAI، Microsoft Foundry و Anthropic: رفتار مدل را شکل میدهد، دانش متغیر را نه؛ هزینهٔ اصلی ارزیابی و بازآموزی است.
فهرست مطالب
مستندات Anthropic فاینتیونینگ را ادامهٔ آموزش یک مدل از پیش آموزشدیده با دادهٔ اضافی تعریف میکند؛ فرایندی که باعث میشود مدل الگوها و ویژگیهای مجموعهدادهٔ فاینتیون را بازنمایی و تقلید کند[۴]. مستندات فاینتیون نظارتشدهٔ OpenAI هم نتیجه را مدلی سفارشی میداند که سبک و محتوای مورد نظر شما را قابلاتکاتر تولید میکند[۲]. در هیچکدام سخنی از افزودن دانش تازه و قابل استناد نیست. برداشت ما این است که فاصلهٔ میان همین تعریفها و انتظار رایج سازمانی، یعنی تزریق دانش داخلی به وزنهای مدل، منشأ بیشتر شکستهای بودجهای در این پروژههاست. پیامد عملی این تفکیک ساده است: واحد هزینهٔ فاینتیونینگ اجرای آموزش نیست، ساخت مجموعهٔ ارزیابی و بازآموزی در هر تغییر نسخهٔ مدل پایه است.
واقعیتهای کلیدی
- مستندات Microsoft Foundry فایدههای فاینتیونینگ را کیفیت بالاتر از مهندسی پرامپت، آموزش روی نمونههایی بیش از ظرفیت زمینه، صرفهجویی توکن به دلیل پرامپت کوتاهتر و تأخیر کمتر توصیف میکند.[۵]
- به گفتهٔ OpenAI حداقل شمار نمونه برای فاینتیون نظارتشده ۱۰ است، بهبود از ۵۰ تا ۱۰۰ نمونه دیده میشود و توصیه، شروع با ۵۰ نمونهٔ دقیق است.[۲]
- اگر ۵۰ نمونهٔ باکیفیت اثری نداشته باشد، توصیهٔ OpenAI بازنگری در تعریف مسئله یا پرامپت است، نه افزودن داده.[۲]
- پژوهش پایهای ۲۰۲۳ نشان داده بود فراموشی فاجعهبار در آموزش پیوستهٔ مدلهای ۱ تا ۷ میلیارد پارامتر عموماً مشاهده میشود و در همین بازه با افزایش مقیاس شدیدتر است.[۸]
- مستندات OpenAI اعلام کرده پلتفرم فاینتیونینگ در حال جمعشدن است و مدلهای فاینتیونشده تا زمان منسوخشدن مدل پایه برای استنتاج در دسترس میمانند.[۱][۲]
- در برآورد راهنمای خلاصهسازی حقوقی Anthropic، خلاصهسازی ۱٬۰۰۰ قرارداد با Claude Opus 5 معادل ۴۳۸٫۷۵ دلار و با Claude Haiku 4.5 معادل ۸۷٫۷۵ دلار تخمین زده شده است.[۳]
آنچه مستندات سازندگان واقعاً وعده میدهند
فهرست فایدههایی که Microsoft Foundry برای فاینتیونینگ برمیشمارد، چهار قلم است: کیفیت بالاتر از آنچه فقط با مهندسی پرامپت به دست میآید، امکان آموزش روی نمونههایی بیش از آنچه در محدودهٔ زمینهٔ یک درخواست جا میشود، صرفهجویی در توکن به دلیل کوتاهتر شدن پرامپت، و تأخیر کمتر بهویژه در مدلهای کوچکتر[۵]. همان مستندات توضیح میدهد چون وزنها با وظیفهٔ شما سازگار میشوند، نیاز به گنجاندن نمونه و دستورالعمل در هر فراخوانی کم میشود و همین، توکن و هزینه و تأخیر را پایین میآورد[۵]. هیچیک از این چهار قلم به افزایش دانستهٔ مدل مربوط نیست؛ هر چهار مورد دربارهٔ شکل و پایداری رفتار است.
مصداق روشنتر، فراخوانی ابزار است. مستندات Foundry فایدهٔ فاینتیون روی نمونههای فراخوانی تابع را کاهش توکن پرامپت و دقت و یکدستی بیشتر خروجی میداند و توصیه میکند برای حفظ کیفیت، تعریف توابع در دادهٔ آموزش و در فراخوانیهای بعدی یکسان بماند[۶]. همان مستندات تصریح میکند که فایل نمونههای فراخوانی ابزار هم مانند هر آموزش دیگری دستکم به ۱۰ نمونه نیاز دارد[۶].
در سمت کاربرد سازمانی، مایکروسافت فاینتیون نظارتشدهٔ GPT-4.1-nano را راهی برای القای لحن، اصطلاحات، جریانهای کاری و خروجی ساختیافتهٔ شرکت معرفی میکند و فاینتیون تقویتی روی o4-mini را برای منطق تصمیم سازمانی که در پرامپت ثابت نمیگنجد[۷]. در همان متن، به ادعای مایکروسافت، استارتاپ حقوقی DraftWise با فاینتیون تقویتی روی دادهٔ حقوقی اختصاصی خود ۳۰ درصد بهبود در کیفیت نتایج جستوجو گزارش کرده است[۷].
دانش متغیر جای دیگری مینشیند
تعریف RAG در واژهنامهٔ Claude دقیقاً همان کاری را توصیف میکند که تیمها اشتباهاً از فاینتیونینگ میخواهند: داده در زمان اجرا و بر اساس پرسش از پایگاه دانش بیرونی بازیابی و همراه پرسش به مدل داده میشود، و این روش برای وظایفی که به اطلاعات بهروز، دانش دامنهای یا استناد صریح به منبع نیاز دارند مناسب است؛ اثربخشیاش هم به کیفیت همان پایگاه دانش وابسته است[۴]. همان منبع تصریح میکند که API کلود در حال حاضر فاینتیونینگ ارائه نمیدهد[۴].
شاهد پایهای در سمت ریسک هم وجود دارد. پژوهش تجربی منتشرشده در ۲۰۲۳ دربارهٔ فراموشی فاجعهبار نشان داده بود که در آموزش پیوستهٔ دستورمحور، افت دانش دامنهای، استدلال و درک متن در مدلهای ۱ تا ۷ میلیارد پارامتر عموماً مشاهده میشود و در همین بازه با بزرگتر شدن مدل شدیدتر است[۸]. برداشت ما این است که تلاش برای نشاندن دانش در وزنها، علاوه بر هزینهٔ آشکار، یک هزینهٔ پنهان هم دارد: تضعیف تواناییهایی که پیشتر رایگان در اختیار داشتید.
مسیر جایگزین هم مستند است. راهنمای خلاصهسازی حقوقی Anthropic بهجای آموزش مدل، بر تعیین دقیق جزئیاتی که باید استخراج شود، پرامپت ساختیافته با برچسبهای XML، تعریف معیار موفقیت و ارزیابی تجربی تکیه میکند و انتخاب مدل را یک اهرم هزینه میداند؛ در برآورد آن راهنما، خلاصهسازی ۱٬۰۰۰ قرارداد اجارهٔ فرعی با Claude Opus 5 معادل ۴۳۸٫۷۵ دلار و با Claude Haiku 4.5 معادل ۸۷٫۷۵ دلار تخمین زده شده است[۳].

واحد هزینه، اجرای آموزش نیست
راهنمای بهترینشیوههای OpenAI که در ۲۰۲۴ منتشر شد، سقف کیفیت را نه در محاسبات که در داده میبیند: اگر چند نفر دادهٔ آموزش را ساخته باشند، عملکرد مدل به سطح توافق آنها محدود میشود و در وظیفهٔ استخراج متن، توافق ۷۰ درصدی یعنی مدل هم احتمالاً بهتر از ۷۰ درصد نخواهد شد[۱]. توزیع داده هم مستقیماً به رفتار نشت میکند؛ اگر ۶۰ درصد پاسخهای دستیار در دادهٔ آموزش امتناع از پاسخگویی باشد اما در عمل فقط ۵ درصد پاسخها باید چنین باشند، مدل بیش از اندازه امتناع میکند[۱].
همان راهنما توصیه میکند داده از ابتدا به بخش آموزش و آزمون تقسیم شود تا مبنای ارزیابی پس از آموزش وجود داشته باشد، و هشدار میدهد که کوتاهکردن دستورالعملهای تکرارشونده در نمونهها برای صرفهجویی، نیاز به شمار بیشتری نمونه را به دنبال دارد[۱]. برآورد بازده هم ساده است: با هر دو برابر شدن شمار نمونهها، مقدار مشابهی بهبود انتظار میرود[۱]. مستندات ۲۰۲۵ همین سازنده نقطهٔ شروع را دقیقتر کرده است: حداقل ۱۰ نمونه، بهبود قابل مشاهده در محدودهٔ ۵۰ تا ۱۰۰ نمونه، و شروع با ۵۰ نمونهٔ دقیق[۲].
مهمتر از همه، چرخهٔ عمر است. مستندات OpenAI اعلام کرده که پلتفرم فاینتیونینگ در حال جمعشدن است، کاربران جدید به آن دسترسی ندارند و مدلهای فاینتیونشده تنها تا زمان منسوخشدن مدلهای پایه برای استنتاج در دسترس میمانند[۱][۲]. در سمت آموزش، Foundry با روش LoRA تنها زیرمجموعهای از پارامترها را تنظیم میکند تا آموزش سریعتر و کمهزینهتر شود[۵]. یعنی همان بخشی که در بودجهها بزرگ نوشته میشود ارزانتر شده، و بخشی که معمولاً نوشته نمیشود، یعنی نگهداری دادهٔ آموزش، مجموعهٔ آزمون و بازآموزی هنگام تغییر مدل پایه، باقی مانده است.
چه چیزی در بودجه دیده نمیشود
اگر این تفکیک را جدی بگیریم، برندهٔ اصلی تیمهایی هستند که پیش از هر آموزشی معیار موفقیت و مجموعهٔ آزمون دارند؛ برای آنها فاینتیون یک بهینهسازی سنجشپذیر است. بازنده تیمهایی هستند که آن را پروژهای یکباره با تاریخ تحویل تعریف میکنند، چون در نخستین ارتقای مدل پایه یا نخستین تغییر سیاست داخلی، داراییشان بیاعتبار میشود و چیزی برای سنجش این بیاعتباری هم ندارند.
زبان بازاریابی این حوزه معمولاً بیش از شواهد وعده میدهد. وقتی ادعا میشود مدل با کسبوکار شما سازگار میشود، آنچه مستندات فنی پشت آن میگذارند سبک، قالب، پیروی از الگو و فراخوانی ابزار است، نه حافظهٔ سازمانی. به نظر میرسد عنوانها معمولاً اندازهٔ تغییر را درست میگویند اما جنس تغییر را نه.
یک اثر ثانویهٔ محتمل، و این برداشت ماست نه یافتهٔ منابع، جابهجایی گلوگاه است: هرچه آموزش ارزانتر و در دسترستر شود، تفاوت میان تیمها به کیفیت و سازگاری برچسبگذاری و به نظم فرایند ارزیابی منتقل میشود؛ یعنی به کار انسانیای که مقیاسپذیریاش کمتر از محاسبات است. برای مدیر محصول و مدیر داده، نتیجهٔ عملی این است که بودجهٔ فاینتیون باید سالانه دیده شود، با یک ردیف مشخص برای بازآموزی و یک مالک مشخص برای مجموعهٔ ارزیابی؛ و پیش از هر آموزش، این پرسش پاسخ داده شود که آیا نیاز واقعی رفتار است یا دانشی که فردا تغییر میکند.
| نیاز | رویکرد مستندشده | نکتهٔ عملی | منبع |
|---|---|---|---|
| قالب، لحن و محتوای یکدست | فاینتیون نظارتشده | نتیجه، مدلی سفارشی است که سبک و محتوای مطلوب را قابلاتکاتر تولید میکند | S2 |
| فراخوانی پایدار ابزار | فاینتیون با نمونههای فراخوانی تابع | کاهش توکن پرامپت و دقت بیشتر؛ تعریف توابع باید در آموزش و اجرا یکسان بماند | S6 |
| پرامپت کوتاهتر و تأخیر کمتر | فاینتیون بهجای نمونهدهی در پرامپت | صرفهجویی توکن و تأخیر کمتر، بهویژه در مدلهای کوچکتر | S5 |
| دانش بهروز و قابل استناد | بازیابی و تولید افزوده (RAG) | داده در زمان اجرا بازیابی و همراه پرسش به مدل داده میشود | S4 |
خط زمانی
- 2023-08-17: انتشار پژوهش تجربی دربارهٔ فراموشی فاجعهبار در فاینتیون پیوستهٔ مدلهای زبانی[۸]
- 2024-07-18: انتشار راهنمای بهترینشیوههای فاینتیونینگ OpenAI با تأکید بر کیفیت داده و تفکیک مجموعهٔ آموزش و آزمون[۱]
- 2025-04-14: مستندات فاینتیون نظارتشدهٔ OpenAI: حداقل ۱۰ نمونه، بهبود در محدودهٔ ۵۰ تا ۱۰۰ نمونه و شروع با ۵۰ نمونه[۲]
برای کسبوکارهای ایرانی
برای تیمهایی که دسترسیشان به پلتفرمهای مدیریتشده محدود یا پرنوسان است، نکتهٔ کاربردی این است که فهرست مدلهای قابل فاینتیون در Foundry شامل مدلهای متنباز مانند Llama-3.3-70B-Instruct، Qwen-32B و gpt-oss-20b هم هست و روش LoRA با تنظیم زیرمجموعهای از پارامترها، آموزش را سریعتر و کمهزینهتر میکند[۵]. به نظر میرسد ترکیب یک مدل کوچک متنباز برای رفتار بههمراه لایهٔ بازیابی برای دانش، از نظر پایداری تصمیم معماری قابلدفاعتر از تکیه بر یک مدل میزبانیشدهٔ خاص باشد، چون چرخهٔ منسوخشدن مدل پایه در اختیار خود تیم میماند. برداشت ما این است که مهارت تعیینکننده در این مسیر بیشتر ساخت مجموعهٔ ارزیابی، برچسبگذاری سازگار و نگهداری پایگاه دانش است تا اجرای خود job آموزش، و تیمهایی که این بخش را نساختهاند معمولاً معیاری هم برای داوری دربارهٔ نتیجهٔ آموزش ندارند.
چه چیزی را باید دنبال کرد
- جدول مدلهای قابل فاینتیون در پلتفرمهای ابری و اینکه کدام نسخههای پایه از فهرست خارج میشوند؛ هر حذف یعنی یک چرخهٔ بازآموزی اجباری برای مدلهای فاینتیونشدهٔ متکی به آنها.
- گسترش فاینتیون تقویتی از مدلهای استدلالی گزینشی به دسترسی عمومی؛ این روش بهجای نمونهٔ پاسخ، به تابع پاداش و در نتیجه به نوع تازهای از مجموعهٔ ارزیابی نیاز دارد.
- اینکه ابزارهای ارزیابی و نگهداری مجموعهٔ آزمون در محصولات ابری چقدر جدی گرفته میشوند؛ محل واقعی هزینهٔ فاینتیون همانجاست، نه در اجرای آموزش.
- مقایسهٔ عملی هزینهٔ فاینتیون مدل کوچک با انتخاب مدل ارزانتر و پرامپت بهتر برای همان وظیفه، در سناریوهای حجمبالا مانند خلاصهسازی اسناد.
منابع
- Fine-tuning best practices | OpenAI API — OpenAI Developers، انتشار: 2024-07-18، مرجع پایه، دسترسی: 2026-09-29
- Supervised fine-tuning | OpenAI API — OpenAI Developers، انتشار: 2025-04-14، شواهد تازه، دسترسی: 2026-09-29
- Legal summarization — Claude Platform Docs، منبع مرجع، دسترسی: 2026-09-29
- Glossary — Claude Platform Docs، منبع مرجع، دسترسی: 2026-09-29
- Customize a model with fine-tuning - Microsoft Foundry — MicrosoftLearn، منبع مرجع، دسترسی: 2026-09-29
- Fine-tuning function calls with Azure OpenAI in Microsoft Foundry Models - Microsoft Foundry — MicrosoftLearn، منبع مرجع، دسترسی: 2026-09-29
- Announcing new fine-tuning models and techniques in Azure AI Foundry | Microsoft Azure Blog — Microsoft Azure Blog، منبع مرجع، دسترسی: 2026-09-29
- An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning — arXiv.org، انتشار: 2023-08-17، مرجع پایه، دسترسی: 2026-09-29
روش تهیه: این تحلیل با سامانه پایش خودکار khavarzadeh.com و کمک مدلهای زبانی از منابع بالا تهیه شده و پیش از انتشار، تطابق اعداد، تاریخها و ارجاعها با منابع بهصورت خودکار کنترل شده است. واقعیتها با شماره منبع مشخص شدهاند و بقیه متن برداشت تحلیلی است. تاریخ تهیه: 2026-09-29.
نظرات
هنوز نظری ثبت نشده است؛ اولین نفر باشید.
افزودن نظر