شراکت ای‌ام‌دی و سربراس برای استنتاج هوش مصنوعی

اتحاد ای‌ام‌دی و سربراس؛ تقسیم کار در استنتاج هوش مصنوعی

اخبار · هوش مصنوعی

دو شرکتی که سال‌ها هرکدام راه خودشان را می‌رفتند، حالا تصمیم گرفته‌اند کار استنتاج هوش مصنوعی را بین خودشان تقسیم کنند. ای‌ام‌دی و سربراس در ۲۳ ژوئیه ۲۰۲۶ از یک سامانه‌ی مشترک رونمایی کردند که در آن هر تراشه دقیقاً همان کاری را می‌کند که در آن بهترین است. ادعای روی کاغذ چشمگیر است: تا پنج برابر توکن بیشتر در ثانیه به ازای هر وات. اما پانویسی زیر همین ادعا هست که خواندنش واجب‌تر از خود ادعاست.

چکیده. شرکت‌های ای‌ام‌دی و سربراس شراکتی رسمی برای استنتاج هوش مصنوعی اعلام کردند که در آن پردازش پرامپت و پنجره‌ی زمینه به زیرساخت رک‌مقیاس هلیوس و پردازنده‌های اپیک ای‌ام‌دی سپرده می‌شود و تولید توکن به موتور مقیاس‌ویفری سربراس. این معماری که به آن «استنتاج تفکیک‌شده» می‌گویند، بر پایه‌ی مدل‌سازی آزمایشگاه‌های دو شرکت تا ۵ برابر بهره‌وری انرژی بیشتر نسبت به پیکربندی تک‌تراشه‌ای سربراس نشان داده است. سامانه قرار است در نیمه‌ی دوم ۲۰۲۶ از راه سربراس کلاود در دسترس قرار بگیرد.
شراکت ای‌ام‌دی و سربراس برای استنتاج هوش مصنوعی

۱) ماجرا دقیقاً از چه قرار است؟

روز ۲۳ ژوئیه ۲۰۲۶، شرکت ای‌ام‌دی و شرکت سربراس در جریان رویداد Advancing AI اعلام کردند که یک راهکار مشترک برای استنتاج هوش مصنوعی می‌سازند. ایده در یک جمله خلاصه می‌شود: به‌جای آنکه یک نوع تراشه تمام مراحل پاسخ‌دادن یک مدل زبانی را انجام دهد، کار را دو نیم کنیم و هر نیمه را به سخت‌افزاری بسپاریم که برای همان نیمه ساخته شده است.

در این معماری، زیرساخت رک‌مقیاس هلیوس ای‌ام‌دی همراه با پردازنده‌های اپیک، بار سنگین پردازش پرامپت و پنجره‌های زمینه‌ی بزرگ را برمی‌دارد؛ و موتور مقیاس‌ویفری سربراس، که یک تراشه‌ی غول‌پیکر به اندازه‌ی یک ویفر سیلیکونی است، مرحله‌ی تولید توکن را با تأخیر بسیار پایین انجام می‌دهد.

دکتر لیزا سو، مدیرعامل ای‌ام‌دی، در بیانیه‌ی رسمی گفت استنتاج در حال تبدیل‌شدن به یکی از بزرگ‌ترین فرصت‌های زیرساختی هوش مصنوعی است و تنوع روزافزون آن به رویکردی منعطف‌تر نیاز دارد. اندرو فلدمن، مدیرعامل و هم‌بنیان‌گذار سربراس هم تأکید کرد که تقاضا برای استنتاج فوق‌سریع با سرعتی بی‌سابقه رشد می‌کند.

۲) استنتاج تفکیک‌شده یعنی چه؟

برای فهم اهمیت این خبر باید بدانیم وقتی از یک مدل زبانی سؤال می‌پرسید، پشت صحنه دو کار کاملاً متفاوت انجام می‌شود.

مرحله‌ی نخست: خواندن پرسش

مدل ابتدا باید تمام متن ورودی شما — پرسش، تاریخچه‌ی گفت‌وگو، فایل‌های پیوست و هر چیزی که در پنجره‌ی زمینه هست — را یک‌جا بخواند و به بازنمایی داخلی تبدیل کند. این مرحله را prefill می‌نامند. کار در اینجا موازی‌پذیر است: هزاران توکن هم‌زمان پردازش می‌شوند و آنچه اهمیت دارد توان محاسباتی خام و ظرفیت بالاست.

مرحله‌ی دوم: نوشتن پاسخ

سپس مدل باید کلمه‌به‌کلمه پاسخ بسازد. هر توکن جدید به توکن قبلی وابسته است، پس این مرحله ذاتاً سریالی است. اینجا دیگر توان محاسباتی گلوگاه نیست؛ پهنای باند حافظه است. هر بار باید وزن‌های مدل از حافظه خوانده شوند تا یک توکن ساخته شود. این مرحله را decode می‌نامند.

سال‌هاست که صنعت هر دو مرحله را روی یک نوع شتاب‌دهنده اجرا می‌کند و ناچار است سخت‌افزاری بخرد که در هیچ‌کدام بهینه‌ی مطلق نیست. تفکیک این دو مرحله روی دو سخت‌افزار متفاوت، همان کاری است که ای‌ام‌دی و سربراس حالا رسمی‌اش کرده‌اند.

۳) سهم هلیوس ای‌ام‌دی از این معامله

هلیوس نام زیرساخت رک‌مقیاس ای‌ام‌دی است؛ یعنی به‌جای فروش تک‌تراشه، یک رک کامل با پردازنده، شتاب‌دهنده، شبکه و خنک‌کننده‌ی هماهنگ عرضه می‌شود. این همان مسیری است که رقبا هم رفته‌اند، چون در مقیاس دیتاسنتر، بهره‌وری واقعی از هماهنگی کل رک بیرون می‌آید نه از سرعت یک تراشه.

در معماری مشترک، هلیوس بخش پرحجم و پرمصرف کار را می‌گیرد: پرامپت‌های طولانی، پنجره‌های زمینه‌ی چندصدهزار توکنی و بارهای کاری با حجم بالای درخواست. این دقیقاً همان جایی است که کارایی هزینه‌ای رک‌مقیاس معنا پیدا می‌کند.

معماری استنتاج تفکیک‌شده هلیوس و موتور مقیاس‌ویفری

۴) سهم سربراس؛ تراشه‌ای به اندازه‌ی یک بشقاب

سربراس سال‌هاست مسیری عجیب و پرریسک را دنبال می‌کند: به‌جای بریدن ویفر سیلیکونی به صدها تراشه‌ی کوچک، کل ویفر را به‌عنوان یک تراشه‌ی واحد نگه می‌دارد. نتیجه شتاب‌دهنده‌ای است با حافظه‌ی روی‌تراشه‌ی بسیار زیاد و پهنای باند داخلی بسیار بالا.

همین ویژگی، سربراس را برای مرحله‌ی تولید توکن ایده‌آل می‌کند. وقتی وزن‌های مدل روی خود تراشه جا می‌شوند، دیگر لازم نیست هر توکن با رفت‌وبرگشت به حافظه‌ی خارجی ساخته شود و تأخیر به‌شدت پایین می‌آید. اگر تجربه‌ی مدل‌هایی را داشته‌اید که پاسخ را با سرعتی غیرعادی تایپ می‌کنند، احتمالاً پشت آن سخت‌افزاری از همین خانواده بوده است.

نکته‌ی جالب اینجاست که ای‌ام‌دی عملاً نیمی از کار استنتاج را به سخت‌افزاری سپرده که خودش نمی‌سازد. این پذیرش صریح یک واقعیت است: در استنتاج، هیچ معماری واحدی برنده‌ی همه‌ی میدان‌ها نیست.

۵) ادعای پنج برابری و پانویسی که باید خواند

عدد تیتر‌شده این است: تا ۵ برابر توکن بیشتر در ثانیه به ازای هر وات. اما جزئیات مهم‌اند و در پانویس بیانیه آمده‌اند.

نخست، مبنای مقایسه پیکربندی فقط‌سربراس است، نه یک سامانه‌ی رقیب مانند محصولات انویدیا. یعنی این عدد می‌گوید «افزودن هلیوس به مسیر، کارایی انرژی خود سربراس را چند برابر می‌کند»، نه اینکه این سامانه پنج برابر بهتر از هر چیز دیگری در بازار است.

دوم، این رقم حاصل مدل‌سازی آزمایشگاه‌های عملکرد ای‌ام‌دی و سربراس در ژوئیه‌ی ۲۰۲۶ است، نه اندازه‌گیری روی سامانه‌ی مستقر. بار کاری مرجع هم مدل Kimi 2.6 با یک تریلیون پارامتر اعلام شده است. خود بیانیه تصریح می‌کند نتایج بسته به پیکربندی سامانه متفاوت خواهد بود.

این نوع عددخوانی دقیق، تفاوت میان تحلیل و تبلیغ است. اگر می‌خواهید عادت کنید ادعاهای هوش مصنوعی را با چشم باز بخوانید، نگاهی به پتانسیل‌ها و محدودیت‌های واقعی هوش مصنوعی بیندازید.

۶) چرا این خبر مستقیماً به انویدیا مربوط است

بازار شتاب‌دهنده‌های هوش مصنوعی سال‌هاست عملاً یک بازیگر مسلط دارد. اما ترکیب بازار در حال تغییر است: اگر تا دیروز بیشتر بودجه صرف آموزش مدل‌ها می‌شد، امروز با میلیاردها درخواست روزانه، وزنه به سمت استنتاج سنگینی می‌کند.

استنتاج بازی متفاوتی است. اینجا معیار موفقیت، هزینه به ازای هر میلیون توکن و تأخیر پاسخ است، نه صرفاً بیشینه‌ی توان محاسباتی. و دقیقاً در همین شکاف است که رقبا می‌توانند وارد شوند. راهبرد ای‌ام‌دی و سربراس این است که به‌جای رقابت رودررو در همه‌ی جبهه‌ها، در یک جبهه‌ی مشخص با تخصص‌گرایی برنده شوند.

البته تجربه نشان داده که سد اصلی انویدیا سخت‌افزار نیست، بلکه اکوسیستم نرم‌افزاری آن است. هر رقیبی باید ابزارها، کتابخانه‌ها و مسیر مهاجرت روانی برای توسعه‌دهندگان فراهم کند و این کار سال‌ها طول می‌کشد.

ادعای پنج برابر توکن در ثانیه به ازای هر وات

۷) واکنش بازار و ابهام‌هایی که باقی است

واکنش بورس به این اعلام یکدست نبود و گزارش‌های رسانه‌ای از آن روایت‌های متفاوتی دادند؛ بخشی از این تفاوت به آن برمی‌گردد که اعلام شراکت هم‌زمان با سایر خبرهای رویداد Advancing AI منتشر شد و جداکردن اثر هر خبر بر قیمت سهام ساده نیست.

فارغ از قیمت سهام، چند ابهام جدی باقی است. هزینه‌ی نهایی به ازای هر میلیون توکن هنوز اعلام نشده. جزئیات اینکه انتقال وضعیت میان دو سخت‌افزار — یعنی همان حافظه‌ی نهان کلید و مقدار — با چه سرعتی و از چه مسیری انجام می‌شود، منتشر نشده است. و مهم‌تر از همه، هیچ سنجه‌ی مستقل شخص‌ثالثی روی سامانه‌ی واقعی هنوز در دست نیست.

۸) این خبر برای کاربر و توسعه‌دهنده‌ی ایرانی چه معنایی دارد؟

در کوتاه‌مدت، تقریباً هیچ کاربری قرار نیست رکی از هلیوس بخرد. اثر واقعی این‌گونه خبرها غیرمستقیم است و از مسیر قیمت به دست کاربر می‌رسد.

هر بار که رقابت در لایه‌ی سخت‌افزار جدی‌تر می‌شود، هزینه‌ی هر میلیون توکن در سرویس‌های ابری پایین می‌آید. کاهش هزینه یعنی مدل‌های قوی‌تر روی پلن‌های ارزان‌تر، پنجره‌های زمینه‌ی بزرگ‌تر و سقف‌های استفاده‌ی بازتر. همان الگویی که در دو سال گذشته بارها تکرار شده است. برای دیدن اینکه رقابت قیمتی چطور کل بازار را جابه‌جا می‌کند، مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک نمونه‌ی خوبی است.

برای کسب‌وکارها هم پیام روشن است: اگر معماری استنتاج در حال تفکیک‌شدن است، قفل‌شدن به یک تأمین‌کننده‌ی واحد ریسک دارد. لایه‌ی انتزاعی روی ارائه‌دهنده‌ی مدل بگذارید تا فردا بتوانید بدون بازنویسی کل محصول جابه‌جا شوید. اهمیت این جنس تصمیم‌ها را در چرایی اهمیت هوش مصنوعی در کسب‌وکار بیشتر شکافته‌ایم.

۹) زمان‌بندی عرضه و آنچه باید رصد کرد

طبق اعلام دو شرکت، راهکار مشترک قرار است در نیمه‌ی دوم ۲۰۲۶ از راه سربراس کلاود در دسترس قرار بگیرد. یعنی نخستین کاربران، توسعه‌دهندگانی خواهند بود که از راه ابر به آن وصل می‌شوند، نه خریداران سخت‌افزار.

سه چیز ارزش رصدکردن دارند: نخست، انتشار قیمت رسمی به ازای هر میلیون توکن؛ دوم، نتایج سنجش مستقل روی بارهای کاری واقعی؛ و سوم، اینکه آیا سازندگان بزرگ مدل حاضر می‌شوند بخشی از ترافیک تولیدی خود را روی این معماری ببرند یا نه. تا وقتی نام‌های بزرگ روی این سامانه نیایند، ماجرا در حد یک وعده‌ی فنی جذاب باقی می‌ماند.

برای دنبال‌کردن تحولات بعدی این حوزه، بخش اخبار هوش مصنوعی را دنبال کنید و اگر می‌خواهید از پایه با مفاهیم و بازیگران این صنعت آشنا شوید، اوپن‌ای‌آی چیست نقطه‌ی شروع خوبی است.

پرسش‌های پرتکرار درباره‌ی شراکت ای‌ام‌دی و سربراس

آیا این سامانه جایگزین کارت‌های گرافیک انویدیا می‌شود؟

خیر، دست‌کم فعلاً نه. این راهکار برای بخش استنتاج طراحی شده و آموزش مدل‌های بزرگ همچنان میدان دیگری است. ضمناً اکوسیستم نرم‌افزاری انویدیا مزیتی است که با یک اعلام شراکت جابه‌جا نمی‌شود.

ادعای پنج برابر بهره‌وری انرژی چقدر قابل اتکاست؟

این عدد بر پایه‌ی مدل‌سازی آزمایشگاه‌های خود دو شرکت در ژوئیه‌ی ۲۰۲۶ و روی یک مدل مرجع اعلام شده و مبنای مقایسه‌اش پیکربندی فقط‌سربراس است. تا انتشار سنجه‌های مستقل، بهتر است آن را یک تخمین خوش‌بینانه بدانید نه عدد قطعی.

چه زمانی می‌توانم از این سامانه استفاده کنم؟

دو شرکت اعلام کرده‌اند که عرضه در نیمه‌ی دوم ۲۰۲۶ از راه سربراس کلاود انجام می‌شود. تاریخ دقیق و قیمت‌گذاری هنوز منتشر نشده است.

تفاوت پردازش پرامپت و تولید توکن دقیقاً چیست؟

پردازش پرامپت یعنی خواندن یک‌باره‌ی کل ورودی که کاری موازی و وابسته به توان محاسباتی است؛ تولید توکن یعنی ساختن کلمه‌به‌کلمه‌ی پاسخ که کاری سریالی و وابسته به پهنای باند حافظه است. همین تفاوت بنیادی، منطق تقسیم کار میان دو سخت‌افزار را می‌سازد.

آیا این خبر روی قیمت اشتراک سرویس‌های هوش مصنوعی اثر می‌گذارد؟

مستقیم و فوری نه، اما رقابت بیشتر در لایه‌ی سخت‌افزار استنتاج در بلندمدت هزینه‌ی هر توکن را پایین می‌آورد و این کاهش معمولاً با تأخیر به پلن‌های کاربران می‌رسد.

جمع‌بندی. شراکت ای‌ام‌دی و سربراس بیش از آنکه یک محصول باشد، یک اعتراف مهندسی است: استنتاج هوش مصنوعی دو کار متفاوت است و شاید بهتر باشد دو سخت‌افزار متفاوت انجامش دهند. ادعای پنج برابری هنوز نیازمند تأیید مستقل است و تا نیمه‌ی دوم ۲۰۲۶ باید منتظر ماند. برای دنبال‌کردن تحولات بعدی و آموزش‌های کاربردی هوش مصنوعی به @MrChatGPT_IR بپیوندید و آموزش‌های چت‌جی‌پی‌تی را از دست ندهید.

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *