ورود ای‌ام‌دی به بازار مدل‌های زبانی با انتشار اینستلا-موی

ای‌ام‌دی با مدل اینستلا-موی وارد بازار مدل‌های هوش مصنوعی شد

اخبار · هوش مصنوعی

شرکتی که سال‌ها فقط به‌عنوان رقیب انویدیا در بازار تراشه شناخته می‌شد، این‌بار خودش یک مدل زبانی منتشر کرد. اما نکته‌ی اصلی نه اندازه‌ی مدل است و نه امتیاز آن در بنچمارک‌ها؛ نکته این است که کل مسیر ساخت آن روی سخت‌افزار خودِ ای‌ام‌دی طی شده و تقریباً همه‌چیز، از کد آموزش تا ترکیب داده‌ها، منتشر شده است. این حرکت بیش از آنکه ورود به بازار مدل باشد، اعلام موضع در بازار تراشه است.

چکیده. شرکت ای‌ام‌دی مدل اینستلا-موی با ۱۶ میلیارد پارامتر کل و ۲.۸ میلیارد پارامتر فعال در هر توکن را منتشر کرده است. این مدل از معماری ترکیب متخصصان استفاده می‌کند، روی پردازنده‌های گرافیکی اینستینکت همین شرکت آموزش دیده و پنجره‌ی زمینه‌ی آن تا ۶۴ هزار توکن گسترش یافته است. میانگین امتیاز نسخه‌ی پایه در بنچمارک‌های اصلی ۷۶.۷ گزارش شده است. وزن‌های مدل تحت مجوز پژوهشی منتشر شده‌اند و کد آموزش با مجوز آزادتری در دسترس است؛ تفاوتی که در بحث «کاملاً باز بودن» اهمیت دارد.
ورود ای‌ام‌دی به بازار مدل‌های زبانی با انتشار اینستلا-موی

۱) ای‌ام‌دی چه چیزی منتشر کرد؟

نام کامل مدل اینستلا-موی با پیکربندی ۱۶ میلیارد پارامتر کل و ۲.۸ میلیارد پارامتر فعال است. عدد دوم مهم‌تر از عدد اول است، چون در معماری ترکیب متخصصان تنها بخشی از شبکه در هر مرحله فعال می‌شود. یعنی مدل حافظه‌ی یک مدل ۱۶ میلیاردی می‌خواهد اما هزینه‌ی محاسباتی هر توکن نزدیک به یک مدل حدود سه میلیاردی است.

انتشار در قالب چند نسخه انجام شده است: نسخه‌ی پایه، نسخه‌ی تنظیم‌شده با نظارت، نسخه‌ی بهینه‌شده بر پایه‌ی ترجیح مستقیم و یک نسخه‌ی استدلالی. این تفکیک به پژوهشگران اجازه می‌دهد اثر هر مرحله از فرایند پس‌آموزش را جداگانه بررسی کنند؛ چیزی که در انتشارهای تجاری معمول نیست.

در کنار وزن‌ها، ای‌ام‌دی کد آموزش، پیکربندی‌ها و ترکیب داده‌ها را هم منتشر کرده است. برای جامعه‌ی پژوهشی این بخش ارزشمندتر از خود مدل است، چون امکان بازتولید و تغییر مسیر آموزش را فراهم می‌کند. برای مرور دیگر انتشارهای مهم امسال می‌توانید بایگانی اخبار هوش مصنوعی را ببینید.

۲) معماری ترکیب متخصصان چطور کار می‌کند؟

در یک شبکه‌ی متعارف، هر توکن ورودی از همه‌ی وزن‌های مدل عبور می‌کند. در معماری ترکیب متخصصان، شبکه به چندین زیرشبکه‌ی تخصصی تقسیم می‌شود و یک سازوکار مسیریابی تصمیم می‌گیرد هر توکن به کدام زیرشبکه‌ها فرستاده شود. نتیجه این است که ظرفیت کل مدل بالا می‌ماند اما محاسبه‌ی هر مرحله سبک می‌شود.

در این مدل، طبق مستندات فنی، ترکیبی از متخصص‌های مشترک و متخصص‌های مسیریابی‌شده از میان مجموعه‌ای بزرگ‌تر استفاده شده است. متخصص‌های مشترک برای هر توکن فعال‌اند و دانش عمومی را نگه می‌دارند، در حالی که متخصص‌های انتخابی، تخصص‌های موضوعی را حمل می‌کنند.

هزینه‌ی این معماری، پیچیدگی مهندسی است. توزیع متخصص‌ها روی چند شتاب‌دهنده، متوازن‌کردن بار میان آن‌ها و جلوگیری از تمرکز ترافیک روی چند متخصص خاص، مسائلی هستند که تیم‌های زیادی روی آن‌ها کار می‌کنند. ای‌ام‌دی اعلام کرده که با موازی‌سازی متخصص‌ها توانسته زمان تولید نخستین توکن را به‌طور محسوسی کاهش دهد.

معماری ترکیب متخصصان در مدل اینستلا-موی ای‌ام‌دی

۳) آموزش روی سخت‌افزار ای‌ام‌دی؛ پیام اصلی همین است

مهم‌ترین بخش این خبر برای صنعت، نه معماری مدل که بستر آموزش آن است. این مدل روی پردازنده‌های گرافیکی خانواده‌ی اینستینکت ای‌ام‌دی و با پشته‌ی نرم‌افزاری راک‌ام آموزش دیده است. تا امروز یکی از قوی‌ترین استدلال‌ها به سود انویدیا، بلوغ اکوسیستم نرم‌افزاری آن بوده است؛ نه صرفاً برتری سخت‌افزار.

وقتی یک شرکت تراشه‌ساز مدل بزرگی را از صفر روی سخت‌افزار خودش آموزش می‌دهد و کد کامل آن را هم منتشر می‌کند، در واقع یک اثبات عملی ارائه می‌دهد: این مسیر شدنی است و مستندات آن در دسترس است. برای تیم‌هایی که به‌دنبال کاهش وابستگی به یک تأمین‌کننده‌ی واحد هستند، این پیام وزن دارد.

البته باید واقع‌بین بود. یک مدل ۱۶ میلیاردی با معماری اقتصادی، فاصله‌ی زیادی با مدل‌های مرزی امروز دارد و اثبات توانایی در این مقیاس لزوماً به مقیاس‌های بسیار بزرگ‌تر تعمیم نمی‌یابد. اما نقطه‌ی شروع معتبری است. تصویر کلی رقابت تراشه و اهمیت آن برای کسب‌وکارها در اهمیت هوش مصنوعی در کسب‌وکار بررسی شده است.

۴) اعداد عملکرد چه می‌گویند؟

طبق گزارش‌های منتشرشده، میانگین امتیاز نسخه‌ی پایه در مجموعه‌ی بنچمارک‌های اصلی ۷۶.۷ اعلام شده است. این عدد در محدوده‌ی مدل‌های هم‌اندازه قرار می‌گیرد؛ از برخی رقبای نزدیک کمی جلوتر و از برخی مدل‌های فشرده‌ی نسل تازه کمی عقب‌تر است. در آزمون‌های تخصصی، نتایج در حوزه‌های استدلال زبانی و تولید کد گزارش شده و نسخه‌های پس‌آموزش‌شده بهبود تدریجی نشان می‌دهند.

نکته‌ی مهم در خواندن این اعداد، توجه به هزینه است. مقایسه‌ی منصفانه‌ی یک مدل ترکیب متخصصان با یک مدل متراکم باید هم کیفیت و هم مصرف منابع را در نظر بگیرد. مدلی که با ۲.۸ میلیارد پارامتر فعال به امتیاز مدل‌های متراکم بزرگ‌تر نزدیک می‌شود، از نظر اقتصاد استنتاج برنده است، حتی اگر در جدول خام امتیاز بالاترین نباشد.

پنجره‌ی زمینه هم به ۶۴ هزار توکن رسیده است؛ عددی که برای بیشتر کاربردهای عملی مانند خلاصه‌سازی اسناد بلند یا کار روی مخازن کد متوسط کافی است. برای درک اینکه اختلاف کیفیت میان مدل‌ها در عمل چقدر خود را نشان می‌دهد، مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک نمونه‌ی ملموسی است.

۵) نکته‌ی مهم درباره‌ی مجوز انتشار

عبارت «کاملاً باز» در پوشش خبری این انتشار زیاد تکرار شده، اما جزئیات ظریف‌تری دارد. طبق گزارش‌ها، کد آموزش با مجوز آزاد و بدون محدودیت کاربرد منتشر شده، در حالی که وزن‌های مدل تحت مجوزی قرار گرفته که استفاده را به کاربردهای پژوهشی و دانشگاهی محدود می‌کند.

این تفکیک برای کاربر نهایی پیامد عملی دارد. اگر پژوهشگر یا دانشجو هستید، تقریباً هیچ محدودیتی سر راهتان نیست. اما اگر می‌خواهید این مدل را در یک محصول تجاری به‌کار بگیرید، باید متن مجوز را با دقت بخوانید و احتمالاً به سراغ گزینه‌های دیگر بروید.

این الگو در چند انتشار بزرگ اخیر تکرار شده است: باز بودن فرایند و شفافیت کامل مستندات، اما محدودیت روی استفاده‌ی تجاری از وزن‌ها. برای جامعه‌ی پژوهشی این هنوز یک پیشرفت بزرگ است، چون بیشترین ارزش علمی در همان کد و ترکیب داده نهفته است.

آموزش مدل روی پردازنده‌های گرافیکی اینستینکت ای‌ام‌دی

۶) این خبر برای رقابت بازار چه معنایی دارد؟

سال‌هاست تحلیل‌گران درباره‌ی وابستگی بازار به یک تأمین‌کننده‌ی واحد شتاب‌دهنده هشدار می‌دهند. مشکل هرگز فقط سخت‌افزار نبوده؛ کتابخانه‌ها، ابزارهای اشکال‌زدایی، بهینه‌سازهای اختصاصی و تجربه‌ی انباشته‌ی مهندسان، همگی به سود بازیگر مسلط عمل کرده‌اند.

انتشار یک مدل کامل به‌همراه کد آموزش، یکی از مؤثرترین راه‌های شکستن این چرخه است، چون به تیم‌های دیگر نقشه‌ی راه می‌دهد. هر تیمی که بخواهد روی این سخت‌افزار آموزش بدهد، حالا یک نمونه‌ی کارکرده در دست دارد و مجبور نیست از صفر شروع کند.

در سمت مقابل، فاصله همچنان قابل‌توجه است. مقیاس مدل‌های مرزی، حجم سرمایه‌گذاری و بلوغ ابزارها هنوز به سود رقیب اصلی است. اما تاریخ صنعت نرم‌افزار نشان داده که مزیت‌های اکوسیستمی، هرچند دیرپا، نفوذناپذیر نیستند.

۷) چه کسانی باید به این مدل توجه کنند؟

گروه اول پژوهشگران حوزه‌ی معماری مدل هستند. انتشار وزن‌های همه‌ی مراحل آموزش، امکان مطالعه‌ی تحول مدل در طول فرایند را می‌دهد؛ چیزی که تقریباً هیچ‌جای دیگر در دسترس نیست و می‌تواند به فهم بهتر پدیده‌هایی مثل ظهور توانایی‌ها کمک کند.

گروه دوم تیم‌های زیرساختی هستند که به‌دنبال تنوع در تأمین سخت‌افزارند. برای این تیم‌ها، ارزش اصلی در کد و پیکربندی‌هاست، نه در خود مدل. گروه سوم توسعه‌دهندگانی هستند که به مدل‌های کم‌مصرف با پنجره‌ی زمینه‌ی بلند نیاز دارند و می‌خواهند روی سخت‌افزار محلی اجرا کنند.

برای کاربر عادی اما این خبر تأثیر مستقیم فوری ندارد. اگر تازه وارد این حوزه شده‌اید، یادگیری کار با ابزارهای موجود اولویت بیشتری دارد؛ آموزش‌های چت‌جی‌پی‌تی و راهنمای پرامپت‌نویسی برای مبتدی‌ها برای همین طراحی شده‌اند. درباره‌ی مرز میان انتظارات و واقعیت این فناوری هم توان و محدودیت‌های واقعی هوش مصنوعی خواندنی است.

پرسش‌های پرتکرار درباره‌ی مدل تازه‌ی ای‌ام‌دی

آیا این مدل رایگان و برای همه در دسترس است؟

وزن‌های مدل عمومی منتشر شده‌اند اما تحت مجوزی که استفاده را به کاربردهای پژوهشی و دانشگاهی محدود می‌کند؛ کد آموزش با مجوز آزادتری در دسترس است.

معنی «۱۶ میلیارد پارامتر با ۲.۸ میلیارد فعال» چیست؟

یعنی مدل در مجموع ۱۶ میلیارد پارامتر دارد اما در پردازش هر توکن تنها بخشی از آن‌ها فعال می‌شود؛ نتیجه، مصرف محاسباتی کمتر در ازای حافظه‌ی بیشتر است.

آیا این مدل با مدل‌های بزرگ تجاری قابل‌مقایسه است؟

خیر. این مدل در رده‌ی مدل‌های میان‌مقیاس قرار می‌گیرد و هدفش رقابت با مدل‌های مرزی نیست، بلکه اثبات امکان‌پذیری آموزش روی سخت‌افزار ای‌ام‌دی است.

چرا انتشار کد آموزش مهم‌تر از خود مدل است؟

چون امکان بازتولید، بررسی و تغییر فرایند آموزش را به دیگران می‌دهد و مانع اصلی ورود تیم‌های تازه به این حوزه را کاهش می‌دهد.

آیا این یعنی دوران وابستگی به یک تأمین‌کننده تمام شده است؟

نه به این سرعت. فاصله در مقیاس و بلوغ ابزارها همچنان زیاد است، اما این انتشار یکی از جدی‌ترین گام‌ها در جهت تنوع‌بخشی به بازار به‌شمار می‌رود.

جمع‌بندی. ارزش این انتشار بیش از آنکه در امتیاز بنچمارک باشد، در شفافیت و در پیامی است که به بازار تراشه می‌فرستد. وقتی کد، داده و وزن‌های همه‌ی مراحل منتشر می‌شود، انحصار دانش شکسته می‌شود؛ و این معمولاً مقدمه‌ی شکسته‌شدن انحصارهای دیگر است. برای دنبال‌کردن روزانه‌ی این تحولات به @MrChatGPT_IR بپیوندید.
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *