هر مدل زبانی متنباز که روی پلتفرمهایی مثل Hugging Face منتشر میشود، معمولاً همراه با یک «کارت مدل» (model card) عرضه میشود؛ سندی که اطلاعات فنی و حقوقی مهمی دربارهٔ آن مدل در خود دارد. مشکل اینجاست که خیلی از توسعهدهندگان مستقیم سراغ دستور دانلود میروند و کارت مدل را حتی نگاه هم نمیکنند. نتیجه گاهی یک مدل نامناسب برای سختافزار موجود است، گاهی یک نقض ناخواسته لایسنس، و گاهی یک مدل که ادعای «چندزبانه بودن» دارد اما در فارسی عملاً قابلاستفاده نیست. این مقاله نشان میدهد دقیقاً به کدام سه بخش کارت مدل باید نگاه دقیقتری بیندازید.
لیست مطالب
اندازه؛ عدد پارامتر چه میگوید و چه نمیگوید
عددی مثل ۷B، ۱۳B یا ۷۰B در نام مدل، تعداد پارامترهای آن را به میلیارد نشان میدهد. این عدد تقریباً مستقیم با حجم حافظهای که برای اجرای مدل نیاز دارید مرتبط است؛ هرچه پارامتر بیشتر، حافظهٔ بیشتری لازم است و اجرا کندتر میشود. رابطهٔ پارامتر با «توانایی» مدل کیفی است نه دقیق: بهطور کلی مدل بزرگتر در وظایف پیچیدهتر بهتر عمل میکند، اما این رابطه خطی نیست و به کیفیت دادهٔ آموزشی، معماری مدل و روش تنظیم آن هم بستگی دارد. یک مدل ۷B که خوب آموزش دیده، میتواند در وظایف مشخص از یک مدل بزرگتر اما بیکیفیتتر بهتر عمل کند.
نکتهٔ مهم دیگر اینست که حجم فایل قابلدانلود مدل، همان تعداد پارامتر خام نیست؛ به سطح کوانتیزیشنی که برای آن نسخه انتخاب شده هم بستگی دارد. این موضوع را در مقالهٔ ششم همین مجموعه با عنوان کوانتیزیشن به زبان ساده بهطور کامل توضیح دادهایم.

لایسنس؛ جایی که خیلیها فقط اسم را میبینند نه متن را
«متنباز بودن» یک مدل به معنای آزاد بودن کامل آن برای استفادهٔ تجاری نیست. برخی مدلها با لایسنسهای واقعاً آزاد مثل Apache 2.0 یا MIT منتشر میشوند که عملاً هیچ محدودیت جدیای برای استفادهٔ تجاری ندارند. برخی دیگر با لایسنسهای اختصاصی و مشروط منتشر میشوند که ممکن است استفادهٔ تجاری در مقیاس بزرگ را ممنوع کنند، استفاده از خروجی مدل برای آموزش مدلهای رقیب را منع کنند، یا فقط برای مصارف پژوهشی مجاز باشند. اصطلاح رایجتری هم که این روزها دیده میشود «open-weight» است؛ یعنی وزنهای مدل عمومی و قابلدانلودند، اما از نظر حقوقی الزاماً با یک لایسنس متنباز استاندارد منتشر نشدهاند.
توصیهٔ عملی این است که پیش از استفادهٔ تجاری از هر مدل، متن کامل لایسنس آن را بخوانید، نه فقط برچسبی که کنار نامش نوشته شده. یک جمله در توضیحات مثل «رایگان برای استفاده» میتواند در متن کامل لایسنس شرطهای محدودکنندهای داشته باشد که فقط با خواندن سند اصلی مشخص میشود.
پشتیبانی از فارسی؛ جایی که باید بدبین باشید
واقعیت صادقانه این است که بیشتر مدلهای کوچک متنباز، بهخصوص آنهایی که زیر ده میلیارد پارامتر دارند، در زبان فارسی عملکرد نسبتاً ضعیفی دارند. علت اصلی اینست که سهم دادهٔ فارسی در مجموعهدادهٔ آموزشی این مدلها معمولاً بسیار کوچکتر از انگلیسی یا حتی زبانهای پرکاربرد دیگر است. کارت مدل معمولاً فهرستی از زبانهای پشتیبانیشده را ذکر میکند، اما «پشتیبانی ادعایی» با «کیفیت واقعی» یکی نیست؛ ذکر شدن فارسی در آن فهرست تضمینی برای گرامر درست یا درک ظرافتهای زبانی نمیدهد.
تنها راه مطمئن، تست مستقیم مدل با نمونههای واقعی فارسی خودتان است؛ چند پرسش نوشتاری، چند دستور با ساختار پیچیدهتر، و بررسی اینکه آیا مدل غلطهای دستوری یا معنایی تولید میکند یا نه. برای شروع این مسیر و شناخت مدلهایی که واقعاً در فارسی قابلاتکاترند، نقشهٔ راه مدلهای متنباز و اجرای محلی منبع خوبی برای مقایسه است.
خانوادهٔ مدل و نسخههای تخصصیشده
خیلی از توسعهدهندگان اسم یک خانوادهٔ مدل را میبینند و فرض میکنند همهٔ نسخههای آن یکسانند، در حالیکه معمولاً چند نسخهٔ متفاوت از یک مدل پایه منتشر میشود: نسخهٔ پایه (base) که فقط برای پیشبینی متن آموزش دیده، نسخهٔ instruct یا chat که برای پیروی از دستور و مکالمه تنظیم شده، و گاهی نسخههای تخصصیشده برای کد یا استدلال ریاضی. برای اغلب کاربردهای عملی، نسخهٔ instruct همان چیزی است که نیاز دارید؛ استفاده از نسخهٔ پایه بهجای آن معمولاً نتیجهای عجیب و ناهماهنگ میدهد چون آن مدل اصلاً برای پاسخگویی به دستور تنظیم نشده است.
یک قاعدهٔ ساده: اگر در نام مدل کلمهٔ instruct، chat یا it دیده نمیشود، احتمالاً نسخهٔ پایه است و برای مکالمهٔ مستقیم مناسب نیست.
چکلیست خواندن کارت مدل
- اندازهٔ پارامتر مدل و حداقل حافظهٔ موردنیاز برای اجرای آن را بررسی کنید.
- متن کامل لایسنس را بخوانید و مشخص کنید آیا استفادهٔ تجاری بدون محدودیت مجاز است یا نه.
- ببینید آیا فارسی بهصراحت در دادهٔ آموزشی ذکر شده یا فقط جزو ادعای «چندزبانه» است.
- تاریخ انتشار و آخرین بهروزرسانی مدل را چک کنید تا از نسخهٔ منسوخ استفاده نکنید.
- اگر امتیاز یا نتیجهٔ benchmark ذکر شده، منبع و روش سنجش آن را بررسی کنید؛ عددهای بدون منبع مشخص قابلاتکا نیستند.
| عامل | چه چیزی را بررسی کنید | چرا مهم است |
|---|---|---|
| اندازهٔ پارامتر | مقدار ۷B / ۱۳B / ۷۰B و نیاز حافظهٔ معادل | تعیین سختافزار لازم برای اجرا |
| لایسنس | آزاد تجاری، محدود، یا فقط پژوهشی | ریسک حقوقی استفادهٔ تجاری |
| زبانهای پشتیبانیشده | ذکر صریح فارسی در دادهٔ آموزشی | کیفیت واقعی خروجی فارسی |
| تاریخ و نسخه | آخرین بهروزرسانی مدل | جلوگیری از استفاده از نسخهٔ منسوخ |
| امتیازها و benchmark | منبع و روش سنجش | اعتبار ادعاهای کیفیت |
جمعبندی
- عدد پارامتر رابطهٔ کیفی، نه دقیق، با توانایی مدل دارد؛ همیشه هم بزرگتر بهتر نیست.
- حجم فایل دانلودی به سطح کوانتیزیشن هم بستگی دارد، نه فقط به تعداد پارامتر.
- «متنباز» و «آزاد برای استفادهٔ تجاری» دو مفهوم متفاوتاند؛ همیشه متن کامل لایسنس را بخوانید.
- بیشتر مدلهای کوچک در فارسی ضعیف عمل میکنند؛ به ادعای «چندزبانه بودن» در کارت مدل بهتنهایی اعتماد نکنید.
- پیش از استفادهٔ جدی از هر مدل، آن را با نمونههای واقعی فارسی خودتان تست کنید.
