رکورد سرعت استنتاج؛ تراشهٔ GROQ 3 LPX انویدیا وارد تولید انبوه شد

اخبار · هوش مصنوعی

شرکت انویدیا تراشهٔ تازهٔ استنتاج خود، GROQ 3 LPX، را وارد تولید انبوه کرد؛ محصولی که با رسیدن به ۳۴۰۰ توکن در ثانیه، رکورد سرعت پاسخ‌گویی برای ایجنت‌های هوش مصنوعی را جابه‌جا کرده است.

چکیده. انویدیا تولید انبوه شتاب‌دهندهٔ GROQ 3 LPX را آغاز کرد؛ تراشه‌ای اختصاصی برای تولید سریع توکن که بخشی از پلتفرم ورا روبین است. در آزمایش مستقل، این تراشه روی مدل جمّا ۴ به رکورد ۳۴۰۰ توکن در ثانیه برای هر کاربر رسید. نبیوس نخستین ابر عمومی است که آن را در سرویس کارخانهٔ توکن خود فعال کرده و بدون نیاز به مهاجرت پلتفرم در اختیار توسعه‌دهندگان قرار داده است.
تراشه GROQ 3 LPX انویدیا با رکورد ۳۴۰۰ توکن در ثانیه برای استنتاج هوش مصنوعی

۱. چیست: تراشهٔ GROQ 3 LPX دقیقاً چه می‌کند؟

گروک ۳ ال‌پی‌ایکس یک شتاب‌دهندهٔ استنتاج اختصاصی است، نه یک تراشهٔ همه‌کاره برای آموزش مدل‌ها. وظیفهٔ آن تنها یک چیز است: تولید هرچه سریع‌تر توکن‌های خروجی پس از آنکه مدل زبانی آموزش دیده و آماده به‌کارگیری شد. انویدیا این تراشه را به‌عنوان لایهٔ مکمل سیستم‌های Vera Rubin NVL72 معرفی کرده؛ یعنی سخت‌افزار قدرتمند فعلی برای پردازش، اکنون یک همراه تخصصی برای پاسخ‌گویی فوری هم پیدا کرده است.

ساختار داخلی این تراشه از ۲۵۶ شتاب‌دهندهٔ LPU در هر رَک همراه با ۱۲۸ گیگابایت حافظهٔ SRAM روی تراشه تشکیل شده است. این طراحی برخلاف حافظه‌های HBM معمول در تراشه‌های گرافیکی، تأخیر دسترسی به داده را به حداقل می‌رساند و همین موضوع دلیل اصلی جهش چشمگیر سرعت تولید توکن است.

۲. رکورد ۳۴۰۰ توکن در ثانیه از کجا آمد؟

مؤسسهٔ مستقل Artificial Analysis عملکرد این تراشه را روی مدل جمّا ۴ با سی‌ویک میلیارد پارامتر و پنجرهٔ زمینهٔ صد هزار توکنی محک زد. نتیجه ۳۴۰۰ توکن در ثانیه برای یک کاربر منفرد بود؛ عددی که تا پیش از این برای این مدل مشخص ثبت نشده بود. انویدیا مدعی است این سرعت نزدیک به چهار برابر سریع‌تر از نزدیک‌ترین گزینهٔ رقیب در بار کاری‌های حساس به تأخیر است.

باید توجه داشت رکوردهای بنچمارک معمولاً به مدل، طول زمینه و شرایط آزمایش وابسته‌اند و در کاربرد واقعی ممکن است اعداد اندکی پایین‌تر بیایند. با این حال، حتی با در نظر گرفتن این نکته، فاصلهٔ گزارش‌شده با رقبا به‌قدری زیاد است که تحلیل‌گران صنعت آن را جهشی نسلی توصیف کرده‌اند، نه صرفاً یک بهبود تدریجی.

۳. یک نکتهٔ مهم: گروک تراشه با گراک ربات گفت‌وگو اشتباه گرفته نشود

نام این محصول، GROQ، از نظر تلفظ بسیار به گراک، ربات گفت‌وگوی شرکت ایکس‌ای‌آی، نزدیک است؛ اما این دو هیچ ارتباطی به هم ندارند. گروک نام شرکتی مستقل بود که پیش‌تر در معامله‌ای نزدیک به بیست میلیارد دلاری توسط انویدیا جذب شد و اکنون فناوری آن زیر برند GROQ 3 LPX به بازار عرضه می‌شود. اگر می‌خواهید تفاوت میان بازیگران اصلی این حوزه را بهتر بشناسید، مطلب اوپن‌ای‌آی چیست نگاه خوبی به یکی از رقبای اصلی این اکوسیستم می‌اندازد.

پیش از این معامله، گروک به‌عنوان یک استارتاپ مستقل شناخته می‌شد که از همان روزهای نخست، به‌جای ساخت تراشه‌های همه‌کاره برای آموزش مدل، تمرکز کامل خود را روی یک مسئلهٔ مشخص گذاشته بود: چگونه می‌توان توکن خروجی را با کمترین تأخیر ممکن تولید کرد. همین تمرکز تک‌منظوره باعث شد معماری LPU آن‌ها، برخلاف پردازنده‌های گرافیکی معمول، از ابتدا حول محور حافظهٔ سریع روی‌تراشه طراحی شود. جذب این تیم توسط انویدیا عملاً به معنای وارد کردن یک دههٔ تخصص در بهینه‌سازی تأخیر به‌درون بزرگ‌ترین تولیدکنندهٔ تراشهٔ هوش مصنوعی جهان بود.

۴. جایگاه گروک ۳ ال‌پی‌ایکس در پلتفرم ورا روبین

پلتفرم ورا روبین انویدیا مجموعه‌ای هفت‌تراشه‌ای و پنج‌رَک ویژه است که شامل پردازندهٔ Vera، پردازندهٔ داده‌ای BlueField-4، فضای ذخیره‌سازی اختصاصی Vera BlueField-4 STX و شبکهٔ اترنت اسپکترام-۶ SPX می‌شود. گروک ۳ ال‌پی‌ایکس به‌عنوان لایهٔ تخصصی استنتاج به این مجموعه اضافه شده تا در کنار قدرت خام پردازشی سیستم‌های NVL72، سرعت پاسخ‌دهی نهایی را نیز تضمین کند.

این رویکرد نشان می‌دهد استراتژی انویدیا دیگر صرفاً ساخت قوی‌ترین تراشهٔ منفرد نیست، بلکه کنترل کل زنجیرهٔ زیرساخت هوش مصنوعی از پردازش تا شبکه و ذخیره‌سازی است؛ چیزی که رقابت را برای رقبای کوچک‌تر سخت‌تر می‌کند.

پلتفرم ورا روبین انویدیا و شتاب‌دهنده گروک ۳ ال‌پی‌ایکس برای ایجنت‌های هوش مصنوعی

۵. چرا سرعت تولید توکن برای ایجنت‌های هوش مصنوعی حیاتی است؟

ایجنت‌های هوش مصنوعی، برخلاف یک چت‌بات ساده که یک پاسخ می‌دهد، معمولاً باید صدها یا هزاران مرحلهٔ استنتاج پشت سر هم انجام دهند؛ هر مرحله شامل خواندن نتیجهٔ قبلی، تصمیم‌گیری و تولید فرمان بعدی است. اگر هر مرحله چند ثانیه طول بکشد، یک کار پیچیدهٔ کدنویسی یا تحلیل داده می‌تواند ساعت‌ها به طول بینجامد. با شتاب‌دهنده‌ای مانند گروک ۳ ال‌پی‌ایکس، همان زنجیرهٔ تصمیم‌گیری در چند دقیقه کامل می‌شود.

این تفاوت، مرز میان یک دستیار کاربردی و یک ابزار خسته‌کننده را مشخص می‌کند. برای درک بهتر این‌که چرا شرکت‌ها روی چنین سرعتی سرمایه‌گذاری سنگین می‌کنند، مطلب اهمیت هوش مصنوعی در کسب‌وکار زاویهٔ کاربردی‌تری از این موضوع را باز می‌کند.

کاربرد در ایجنت‌های کدنویسی

یکی از روشن‌ترین کاربردها، ایجنت‌های خودکار برنامه‌نویسی است که باید فایل بخوانند، کد بنویسند، تست اجرا کنند و بر اساس نتیجه دوباره تصمیم بگیرند. طبق ادعای انویدیا، افزایش سرعت تولید توکن می‌تواند این چرخهٔ کامل را از چند ساعت به چند دقیقه کاهش دهد. برای مقایسهٔ این نسل از ابزارهای کدنویسی هوشمند با نگاه انسانی به مهندسی نرم‌افزار، خواندن توهم هوش مصنوعی در برابر مهندس واقعی خالی از لطف نیست.

۶. نبیوس؛ اولین ابر عمومی با کارخانهٔ توکن مجهز به گروک ۳

پلتفرم ابری نبیوس اعلام کرد نخستین شرکتی است که گروک ۳ ال‌پی‌ایکس را در سرویس تجاری خود، موسوم به کارخانهٔ توکن، فعال کرده است. نکتهٔ کلیدی در این ادغام، نبود نیاز به مهاجرت پلتفرم است؛ توسعه‌دهندگانی که پیش‌تر از این سرویس استفاده می‌کردند، بدون تغییر کیت توسعه، فروشندهٔ خدمات یا سیستم صورت‌حساب می‌توانند مدل موردنظر خود را روی این شتاب‌دهنده اجرا کنند.

شرکت گروک، که پیش از پیوستن به انویدیا خود یک ابر تخصصی استنتاج بود، نیز از پذیرندگان اولیهٔ این فناوری در سرویس‌های خودش خواهد بود. چنین همکاری‌هایی نشان می‌دهد بازار استنتاج سریع، به‌سرعت از یک مزیت رقابتی به یک استاندارد صنعتی تبدیل می‌شود.

۷. این تحول در برابر رقبا چه معنایی دارد؟

رقابت بر سر سرعت استنتاج تنها به انویدیا محدود نیست. آزمایشگاه‌های بزرگی مانند اوپن‌ای‌آی و آنتروپیک نیز روی تراشه‌های اختصاصی استنتاج سرمایه‌گذاری کرده‌اند تا وابستگی خود به تأمین‌کنندگان بیرونی را کم کنند. در چنین فضایی، هر جهش سرعتی از سوی انویدیا فشار بیشتری بر رقبا برای تسریع برنامه‌های سخت‌افزاری خودشان وارد می‌کند. رقابت میان مدل‌های زبانی نیز از این معادله جدا نیست؛ برای نمونه‌ای از این کشمکش می‌توانید مطلب چت‌جی‌پی‌تی در برابر دیپ‌سیک را بخوانید.

در سوی دیگر، شرکت‌هایی که صرفاً مصرف‌کنندهٔ این زیرساخت‌ها هستند، از این رقابت سود می‌برند؛ چون هزینهٔ هر توکن تولیدشده رفته‌رفته کاهش می‌یابد و دسترسی به ایجنت‌های سریع‌تر برای کسب‌وکارهای کوچک‌تر نیز مقرون‌به‌صرفه‌تر می‌شود.

نبیوس به عنوان اولین ابر عمومی پذیرندهٔ تراشه گروک ۳ ال‌پی‌ایکس انویدیا در کارخانه توکن

۸. چشم‌انداز: تأثیر بر قیمت و بازار خدمات ابری هوش مصنوعی

تجربهٔ تاریخی صنعت تراشه نشان داده هر جهش بزرگ در کارایی سخت‌افزار، دیر یا زود به کاهش قیمت خدمات ابری منتهی می‌شود؛ همان‌طور که پیش‌تر با کاهش قیمت مدل‌های زبانی بزرگ اتفاق افتاد. اگر گروک ۳ ال‌پی‌ایکس بتواند در مقیاس صنعتی همان رکوردهای آزمایشگاهی را تکرار کند، هزینهٔ هر درخواست برای شرکت‌های ارائه‌دهندهٔ سرویس‌های ایجنتی کاهش می‌یابد و این کاهش معمولاً بخشی از آن به مصرف‌کنندهٔ نهایی هم منتقل می‌شود.

از سوی دیگر، این تحول رقابت میان ارائه‌دهندگان زیرساخت ابری را نیز شدت می‌بخشد. ابرهای بزرگ‌تر که زودتر به این نسل از شتاب‌دهنده‌ها دسترسی پیدا می‌کنند، می‌توانند مشتریان سازمانی حساس به سرعت را جذب کنند؛ در حالی که ارائه‌دهندگان کوچک‌تر باید یا با قیمت رقابت کنند یا در انتظار موج بعدی سخت‌افزار بمانند. چنین پویایی‌ای می‌تواند نقشهٔ قدرت بازار ابر هوش مصنوعی را در یکی دو سال آینده به‌طور محسوسی تغییر دهد.

۹. محدودیت‌ها و پرسش‌های باز

با وجود ارقام چشمگیر، چند نکته هنوز روشن نیست. اول این‌که قیمت دقیق استفاده از این تراشه در سرویس‌های ابری هنوز به‌طور رسمی اعلام نشده است. دوم این‌که رکورد ۳۴۰۰ توکن در ثانیه برای یک کاربر منفرد ثبت شده، نه برای بار همزمان صدها کاربر که در محیط تولیدی واقعی رخ می‌دهد؛ عملکرد در آن شرایط ممکن است متفاوت باشد. سوم، مانند هر فناوری نوظهور دیگری، توزیع گستردهٔ آن به مراکز داده در سراسر جهان زمان می‌برد.

برای دیدن تصویر کلی‌تر از این‌که هوش مصنوعی امروز چه توانی واقعی دارد و کجا هنوز محدود است، مطلب توان و محدودیت‌های واقعی هوش مصنوعی را از دست ندهید. برای پیگیری دائمی این‌گونه اخبار زیرساختی نیز می‌توانید سری به بخش اخبار هوش مصنوعی ما بزنید.

۱۰. پرسش‌های پرتکرار

آیا گروک ۳ ال‌پی‌ایکس همان ربات گراک است؟
خیر. گروک ۳ ال‌پی‌ایکس یک تراشهٔ سخت‌افزاری از انویدیاست که با گراک، ربات گفت‌وگوی ایکس‌ای‌آی، هیچ ارتباطی ندارد؛ شباهت تنها در نام است.

چرا ۳۴۰۰ توکن در ثانیه مهم است؟
هرچه توکن سریع‌تر تولید شود، ایجنت‌های هوش مصنوعی زودتر به نتیجه می‌رسند و کارهای چندمرحله‌ای مانند کدنویسی خودکار در زمان بسیار کوتاه‌تری انجام می‌شود.

کاربران عادی کِی می‌توانند از این سرعت بهره ببرند؟
در حال حاضر دسترسی از طریق سرویس‌های ابری مانند کارخانهٔ توکن نبیوس آغاز شده و به‌مرور به سایر ارائه‌دهندگان و ابزارهای مصرفی هم می‌رسد.

آیا این تراشه جایگزین پردازنده‌های گرافیکی آموزش می‌شود؟
خیر. گروک ۳ ال‌پی‌ایکس تراشه‌ای مکمل است که کنار سیستم‌های Vera Rubin NVL72 کار می‌کند و صرفاً مرحلهٔ استنتاج، یعنی تولید پاسخ نهایی پس از آماده شدن مدل، را تسریع می‌کند؛ آموزش مدل‌ها همچنان بر عهدهٔ خوشه‌های پردازش گرافیکی سنگین باقی می‌ماند.

در یک جمع‌بندی کوتاه، ورود تولید انبوه گروک ۳ ال‌پی‌ایکس نشان می‌دهد رقابت هوش مصنوعی از سطح مدل‌های زبانی به سطح زیرساخت فیزیکی و سرعت خام رسیده است. برای ادامهٔ پوشش دقیق و به‌روز این‌گونه رویدادها، کانال تلگرام @MrChatGPT_IR را دنبال کنید.
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *