خرید استارتاپ Taalas توسط AMD برای حک مدل‌های هوش مصنوعی روی تراشه

AMD با خرید Taalas مدل‌های هوش مصنوعی را در دل سیلیکون حک می‌کند

تراشه · هوش مصنوعی

شرکت AMD با خرید استارتاپ کانادایی Taalas وارد میدان تازه‌ای از رقابت تراشه‌های هوش مصنوعی شد؛ میدانی که در آن مدل‌های زبانی به‌جای اجرا روی حافظه، مستقیم در دل سیلیکون حک می‌شوند.

چکیده. غول تراشه‌سازی آمریکایی AMD خرید استارتاپ Taalas را رسمی اعلام کرد؛ شرکتی که فناوری حک کردن وزن‌های مدل‌های هوش مصنوعی را مستقیم در ساختار فیزیکی تراشه توسعه داده است. این فناوری در آزمایش‌های اولیه توانسته سرعت اجرای مدل زبانی Llama 3.1 را به نزدیک هفده هزار توکن در ثانیه برساند؛ رقمی که به گفته‌ی سازندگان تا چهل و هشت برابر سریع‌تر از پردازنده‌های گرافیکی انویدیا است. این معامله بخشی از تلاش گسترده‌ی AMD برای ساختن پلتفرمی کامل در برابر سلطه‌ی انویدیا بر بازار سخت‌افزار استنتاج هوش مصنوعی محسوب می‌شود.

خرید استارتاپ Taalas توسط AMD برای حک مدل‌های هوش مصنوعی روی تراشه

۱. خرید رسمی: AMD چه چیزی از Taalas به دست آورد؟

شرکت AMD روز پنجشنبه به‌طور رسمی اعلام کرد که استارتاپ کانادایی Taalas را خریداری کرده است. جزئیات مالی این معامله فاش نشده، اما این خرید یک تملک کامل است، نه صرفاً جذب تیم فنی. مقر Taalas در تورنتوی کانادا قرار دارد و این شرکت از سال ۲۰۲۳ روی رویکردی کاملاً متفاوت برای اجرای مدل‌های هوش مصنوعی کار می‌کند. طبق برنامه‌ی اعلام‌شده، این معامله تا پایان سه‌ماهه‌ی چهارم سال جاری میلادی و پس از تأیید نهادهای نظارتی نهایی خواهد شد. برای AMD که سال‌هاست تلاش می‌کند سهم بیشتری از بازار پرسود تراشه‌های هوش مصنوعی را از انویدیا بگیرد، این خرید یک قدم استراتژیک محسوب می‌شود، نه یک آزمایش کوچک تحقیقاتی.

جالب اینجاست که خرید Taalas تنها چند هفته پس از توافق دیگر AMD با شرکت سرکراس رخ داده است؛ نشانه‌ای از سرعت گرفتن رقابت تسلیحاتی در حوزه‌ی سخت‌افزار استنتاج. اگر می‌خواهید عقب‌تر بروید و ببینید اصلاً هوش مصنوعی مولد و شرکت‌هایی مثل OpenAI چگونه این موج را شکل دادند، مقاله‌ی مرجع ما را از دست ندهید.

۲. فناوری عجیب: یعنی چه که مدل در سیلیکون «حک» می‌شود؟

فناوری اصلی Taalas بر پایه‌ی چیزی است که خودشان آن را «مدارهای مجتمع مخصوص مدل» می‌نامند. برخلاف پردازنده‌های گرافیکی معمولی که وزن‌های مدل را در حافظه‌ی جداگانه ذخیره می‌کنند و در زمان اجرا آن‌ها را می‌خوانند، تراشه‌های Taalas دو بخش اصلی دارند. بخش نخست بستری از حافظه‌ی Mask-ROM است که وزن‌های مدل به‌صورت دائمی و فیزیکی در آن حک می‌شود؛ درست مثل نقشی که روی فلز حکاکی شده باشد. بخش دوم بستری از حافظه‌ی SRAM است که برای ذخیره‌ی کش‌های موقت گفت‌وگو و تنظیم‌های سبک و قابل‌تغییر مدل استفاده می‌شود.

نتیجه‌ی این طراحی، حذف بخش بزرگی از تأخیر ناشی از انتقال داده بین حافظه و واحد پردازش است؛ همان گلوگاهی که سال‌هاست سرعت اجرای مدل‌های زبانی بزرگ را محدود کرده است. به بیان ساده، وقتی مدل «در خود تراشه» زندگی می‌کند، دیگر نیازی به رفت‌وآمد داده بین حافظه و پردازنده نیست. اگر تازه با مفهوم مدل‌های زبانی بزرگ آشنا شده‌اید، پیشنهاد می‌کنیم نگاهی هم به توان و محدودیت‌های واقعی هوش مصنوعی بیندازید.

۳. رکورد سرعت: هفده هزار توکن در ثانیه

در آزمایش‌های اولیه‌ای که Taalas اوایل امسال منتشر کرد، تراشه‌ی نسل اول این شرکت با نام‌گذاری HC1 توانست مدل زبانی متن‌باز Llama 3.1 با هشت میلیارد پارامتر را با سرعتی نزدیک به هفده هزار توکن در ثانیه اجرا کند. این تراشه روی فرایند تولید ۶ نانومتری شرکت TSMC ساخته شده است. سازندگان مدعی‌اند این عملکرد نزدیک به چهل و هشت برابر سریع‌تر از پردازنده‌های گرافیکی انویدیا و حدود هشت و نیم برابر سریع‌تر از شتاب‌دهنده‌های شرکت سرکراس است؛ ادعایی که اگر در مقیاس صنعتی هم تکرار شود، می‌تواند معادلات هزینه‌ی اجرای مدل‌های هوش مصنوعی را به‌کلی تغییر دهد.

برای شرکت‌هایی که مدل‌های هوش مصنوعی را در مقیاس میلیونی کاربر اجرا می‌کنند، هر میلی‌ثانیه تأخیر و هر واحد انرژی مصرفی مستقیماً روی هزینه‌های عملیاتی اثر می‌گذارد. به همین دلیل، ادعای کاهش چشمگیر تأخیر و افزایش توان عملیاتی، توجه بازیگران بزرگ صنعت تراشه را به این فناوری جلب کرده است.

مقایسه سرعت تراشه هوش مصنوعی Taalas با پردازنده‌های انویدیا

۴. از HC1 تا HC2: مسیر رشد به‌سمت مدل‌های تریلیون‌پارامتری

تراشه‌ی نسل دوم Taalas با نام HC2 که برای عرضه در تابستان امسال برنامه‌ریزی شده، ظرفیت پشتیبانی از مدل‌هایی تا بیست میلیارد پارامتر را دارد. نکته‌ی مهم‌تر اینجاست که با استفاده از موازی‌سازی خطی روی حدود پنجاه شتاب‌دهنده، این معماری می‌تواند حتی مدل‌های در مقیاس تریلیون پارامتر را نیز اجرا کند؛ مقیاسی که امروز تنها بزرگ‌ترین آزمایشگاه‌های هوش مصنوعی جهان به آن دست یافته‌اند. این روند رشد نشان می‌دهد Taalas صرفاً یک پروژه‌ی آزمایشگاهی برای مدل‌های کوچک نیست، بلکه نقشه‌ی راهی برای رقابت در سطح مدل‌های پرچم‌دار صنعت دارد.

محدودیت فنی مهم که نباید نادیده گرفت

هرچند سرعت این معماری چشمگیر است، اما یک هزینه‌ی پنهان هم دارد: هر تراشه تنها برای یک نسخه‌ی خاص از یک مدل کار می‌کند. وقتی وزن‌های مدل به‌صورت فیزیکی در سیلیکون حک شده باشند، ارتقا به مدل بعدی عملاً به معنای تغییر سخت‌افزار است، نه فقط به‌روزرسانی نرم‌افزار. شرکت سازنده می‌گوید تغییر تنها دو لایه‌ی فلزی روی تراشه، ارزان‌تر و سریع‌تر از بازطراحی کامل مدار است، اما در صنعتی که مدل‌های تازه گاهی هر چند هفته یک‌بار منتشر می‌شوند، این محدودیت همچنان چالشی جدی برای مشتریان به‌شمار می‌رود.

۵. چرا AMD این خرید را انجام داد؟

پاسخ کوتاه: انویدیا. شرکت انویدیا در حال حاضر سهم غالب بازار تراشه‌های آموزش و استنتاج هوش مصنوعی را در اختیار دارد و AMD سال‌هاست تلاش می‌کند با شتاب‌دهنده‌های سری Instinct جای پایی در این بازار پیدا کند. معاون ارشد بخش هوش مصنوعی AMD در توضیح این خرید گفته است هدف شرکت ساختن یک پلتفرم کامل هوش مصنوعی است که به مشتریان اجازه دهد برای هر نوع بار پردازشی، سخت‌افزار مناسب همان کار را انتخاب کنند؛ نه یک راه‌حل یکسان برای همه‌ی سناریوها.

بر اساس برنامه‌ی فعلی، AMD قصد دارد فناوری Taalas را در کنار شتاب‌دهنده‌های Instinct و سامانه‌های رَکی Helios به کار بگیرد. در این مدل ترکیبی، پردازنده‌های گرافیکی معمولی وظیفه‌ی پردازش اولیه‌ی درخواست کاربر را برعهده می‌گیرند، در حالی که تراشه‌های حک‌شده‌ی Taalas مرحله‌ی حساس تولید متن را با سرعتی بسیار بالاتر انجام می‌دهند. اگر می‌خواهید بدانید چرا شرکت‌ها تا این حد روی سرعت و هزینه‌ی هوش مصنوعی حساس شده‌اند، مقاله‌ی ما درباره‌ی اهمیت هوش مصنوعی در کسب‌وکار را بخوانید.

۶. مقایسه با رقبا: سرکراس، گروک و بازار داغ تراشه‌های استنتاج

خرید Taalas در بستری اتفاق می‌افتد که کل صنعت تراشه به‌سمت راه‌حل‌های اختصاصی‌تر برای استنتاج هوش مصنوعی حرکت کرده است. پیش‌تر شرکت انویدیا قراردادی میلیارددلاری با استارتاپ گروک برای دسترسی به سرویس‌های استنتاج پریمیوم امضا کرده بود. شرکت سرکراس هم مدتی است با معماری ویفر-اسکیل خود، رکوردهای سرعت پردازش را جابه‌جا می‌کند. حالا AMD با ورود به این میدان از طریق خرید Taalas، عملاً می‌گوید که در دوره‌ی بعدی رقابت تراشه‌های هوش مصنوعی، برنده کسی است که بتواند سریع‌ترین و ارزان‌ترین توکن را تحویل دهد، نه صرفاً قدرتمندترین تراشه‌ی عمومی را بسازد.

این رقابت فشرده روی سخت‌افزار، بازتاب مستقیمی از رقابت روی خودِ مدل‌های هوش مصنوعی هم هست. اگر علاقه‌مندید ببینید مدل‌های مختلف چطور در عمل با هم مقایسه می‌شوند، نگاهی به تحلیل ما درباره‌ی مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک بیندازید.

فناوری حک وزن‌های مدل هوش مصنوعی مستقیم در ساختار تراشه سیلیکونی

۷. این خرید چه معنایی برای آینده‌ی صنعت هوش مصنوعی دارد؟

اگر تراشه‌های حک‌شده در مقیاس صنعتی موفق شوند، می‌توانند هزینه‌ی اجرای مدل‌های پرمصرف و پرترافیک را به‌شکل چشمگیری کاهش دهند؛ موضوعی که مستقیماً روی قیمت سرویس‌های هوش مصنوعی برای کاربران نهایی هم اثر می‌گذارد. از سوی دیگر، این مسیر می‌تواند بازار را به دو دسته تقسیم کند: تراشه‌های عمومی و قابل‌برنامه‌ریزی برای پژوهش و مدل‌های تازه، و تراشه‌های اختصاصی و فوق‌سریع برای اجرای مدل‌های ثابت و پرتکرار در مقیاس بزرگ. شرکت‌هایی که یک مدل مشخص را برای میلیون‌ها کاربر اجرا می‌کنند، بیشترین سود را از این فناوری خواهند برد.

برای توسعه‌دهندگانی که می‌خواهند از همین حالا با تفاوت ابزارهای واقعی و ادعاهای تبلیغاتی صنعت هوش مصنوعی آشنا شوند، مطالعه‌ی مطلب توهم هوش مصنوعی در برابر واقعیت مهندسی خواندنی خواهد بود.

۸. جمع‌بندی روند: از رقابت مدل‌ها به رقابت سیلیکون

در دو سال اخیر، تمرکز اصلی خبرهای هوش مصنوعی روی مدل‌های زبانی بزرگ و قابلیت‌های آن‌ها بوده است. خرید Taalas توسط AMD نشان می‌دهد که میدان نبرد واقعی دارد به لایه‌ی زیرین‌تر، یعنی سخت‌افزار، منتقل می‌شود. وقتی سرعت و هزینه‌ی اجرای مدل به اندازه‌ی خودِ کیفیت مدل اهمیت پیدا می‌کند، شرکت‌هایی که کنترل بیشتری روی زنجیره‌ی تراشه دارند، برتری رقابتی بزرگ‌تری به دست می‌آورند. علاقه‌مندان به یادگیری عملی کار با ابزارهای هوش مصنوعی می‌توانند سری آموزش‌های آموزش چت‌جی‌پی‌تی را هم دنبال کنند تا از این تحولات سخت‌افزاری و نرم‌افزاری عقب نمانند.

سوالات متداول درباره‌ی خرید Taalas توسط AMD

آیا این معامله قطعی شده است؟
بله، AMD خرید Taalas را رسمی اعلام کرده، هرچند تکمیل نهایی معامله تا پایان سه‌ماهه‌ی چهارم سال جاری و پس از تأیید نهادهای نظارتی زمان می‌برد.

چه مدل‌هایی روی این تراشه‌ها اجرا می‌شوند؟
در آزمایش‌های عمومی، مدل متن‌باز Llama 3.1 با هشت میلیارد پارامتر اجرا شده است؛ نسل بعدی تراشه قرار است مدل‌هایی تا بیست میلیارد پارامتر، و در حالت ترکیبی، حتی مقیاس تریلیون پارامتر را هم پوشش دهد.

آیا این فناوری روی نحوه‌ی نوشتن پرامپت کاربران هم اثر می‌گذارد؟
مستقیماً نه؛ سرعت بیشتر پاسخ‌دهی مدل تجربه‌ی کاربری را بهتر می‌کند، اما اصول نوشتن پرامپت خوب همچنان همان است. اگر تازه‌کار هستید، آموزش نوشتن پرامپت برای مبتدیان نقطه‌ی شروع خوبی است.

مهم‌ترین محدودیت این فناوری چیست؟
قفل‌شدن سخت‌افزار روی یک مدل مشخص. برای استفاده از مدل جدید، باید تراشه هم تغییر کند که این موضوع می‌تواند برای کاربردهایی با به‌روزرسانی مکرر مدل، هزینه‌بر باشد.

این خرید چه تأثیری روی رقابت با انویدیا دارد؟
AMD امیدوار است با ترکیب پردازنده‌های گرافیکی عمومی و تراشه‌های اختصاصی Taalas، پلتفرمی کامل‌تر از راه‌حل‌های فعلی انویدیا برای بازار استنتاج هوش مصنوعی ارائه دهد.

این خبر یکی از مهم‌ترین تحولات هفته‌ی اخیر در صنعت سخت‌افزار هوش مصنوعی بود؛ نشانه‌ای روشن از اینکه رقابت غول‌های فناوری از سطح مدل‌ها به سطح تراشه‌ها رسیده است. برای دنبال‌کردن لحظه‌به‌لحظه‌ی این‌گونه اخبار و تحلیل‌های تازه‌ی هوش مصنوعی، کانال تلگرام @MrChatGPT_IR را دنبال کنید و سری مقاله‌های مرتبط ما را هم در بخش اخبار هوش مصنوعی سایت بخوانید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *