دو شرکتی که سالها هرکدام راه خودشان را میرفتند، حالا تصمیم گرفتهاند کار استنتاج هوش مصنوعی را بین خودشان تقسیم کنند. ایامدی و سربراس در ۲۳ ژوئیه ۲۰۲۶ از یک سامانهی مشترک رونمایی کردند که در آن هر تراشه دقیقاً همان کاری را میکند که در آن بهترین است. ادعای روی کاغذ چشمگیر است: تا پنج برابر توکن بیشتر در ثانیه به ازای هر وات. اما پانویسی زیر همین ادعا هست که خواندنش واجبتر از خود ادعاست.

لیست مطالب
۱) ماجرا دقیقاً از چه قرار است؟
روز ۲۳ ژوئیه ۲۰۲۶، شرکت ایامدی و شرکت سربراس در جریان رویداد Advancing AI اعلام کردند که یک راهکار مشترک برای استنتاج هوش مصنوعی میسازند. ایده در یک جمله خلاصه میشود: بهجای آنکه یک نوع تراشه تمام مراحل پاسخدادن یک مدل زبانی را انجام دهد، کار را دو نیم کنیم و هر نیمه را به سختافزاری بسپاریم که برای همان نیمه ساخته شده است.
در این معماری، زیرساخت رکمقیاس هلیوس ایامدی همراه با پردازندههای اپیک، بار سنگین پردازش پرامپت و پنجرههای زمینهی بزرگ را برمیدارد؛ و موتور مقیاسویفری سربراس، که یک تراشهی غولپیکر به اندازهی یک ویفر سیلیکونی است، مرحلهی تولید توکن را با تأخیر بسیار پایین انجام میدهد.
دکتر لیزا سو، مدیرعامل ایامدی، در بیانیهی رسمی گفت استنتاج در حال تبدیلشدن به یکی از بزرگترین فرصتهای زیرساختی هوش مصنوعی است و تنوع روزافزون آن به رویکردی منعطفتر نیاز دارد. اندرو فلدمن، مدیرعامل و همبنیانگذار سربراس هم تأکید کرد که تقاضا برای استنتاج فوقسریع با سرعتی بیسابقه رشد میکند.
۲) استنتاج تفکیکشده یعنی چه؟
برای فهم اهمیت این خبر باید بدانیم وقتی از یک مدل زبانی سؤال میپرسید، پشت صحنه دو کار کاملاً متفاوت انجام میشود.
مرحلهی نخست: خواندن پرسش
مدل ابتدا باید تمام متن ورودی شما — پرسش، تاریخچهی گفتوگو، فایلهای پیوست و هر چیزی که در پنجرهی زمینه هست — را یکجا بخواند و به بازنمایی داخلی تبدیل کند. این مرحله را prefill مینامند. کار در اینجا موازیپذیر است: هزاران توکن همزمان پردازش میشوند و آنچه اهمیت دارد توان محاسباتی خام و ظرفیت بالاست.
مرحلهی دوم: نوشتن پاسخ
سپس مدل باید کلمهبهکلمه پاسخ بسازد. هر توکن جدید به توکن قبلی وابسته است، پس این مرحله ذاتاً سریالی است. اینجا دیگر توان محاسباتی گلوگاه نیست؛ پهنای باند حافظه است. هر بار باید وزنهای مدل از حافظه خوانده شوند تا یک توکن ساخته شود. این مرحله را decode مینامند.
سالهاست که صنعت هر دو مرحله را روی یک نوع شتابدهنده اجرا میکند و ناچار است سختافزاری بخرد که در هیچکدام بهینهی مطلق نیست. تفکیک این دو مرحله روی دو سختافزار متفاوت، همان کاری است که ایامدی و سربراس حالا رسمیاش کردهاند.
۳) سهم هلیوس ایامدی از این معامله
هلیوس نام زیرساخت رکمقیاس ایامدی است؛ یعنی بهجای فروش تکتراشه، یک رک کامل با پردازنده، شتابدهنده، شبکه و خنککنندهی هماهنگ عرضه میشود. این همان مسیری است که رقبا هم رفتهاند، چون در مقیاس دیتاسنتر، بهرهوری واقعی از هماهنگی کل رک بیرون میآید نه از سرعت یک تراشه.
در معماری مشترک، هلیوس بخش پرحجم و پرمصرف کار را میگیرد: پرامپتهای طولانی، پنجرههای زمینهی چندصدهزار توکنی و بارهای کاری با حجم بالای درخواست. این دقیقاً همان جایی است که کارایی هزینهای رکمقیاس معنا پیدا میکند.

۴) سهم سربراس؛ تراشهای به اندازهی یک بشقاب
سربراس سالهاست مسیری عجیب و پرریسک را دنبال میکند: بهجای بریدن ویفر سیلیکونی به صدها تراشهی کوچک، کل ویفر را بهعنوان یک تراشهی واحد نگه میدارد. نتیجه شتابدهندهای است با حافظهی رویتراشهی بسیار زیاد و پهنای باند داخلی بسیار بالا.
همین ویژگی، سربراس را برای مرحلهی تولید توکن ایدهآل میکند. وقتی وزنهای مدل روی خود تراشه جا میشوند، دیگر لازم نیست هر توکن با رفتوبرگشت به حافظهی خارجی ساخته شود و تأخیر بهشدت پایین میآید. اگر تجربهی مدلهایی را داشتهاید که پاسخ را با سرعتی غیرعادی تایپ میکنند، احتمالاً پشت آن سختافزاری از همین خانواده بوده است.
نکتهی جالب اینجاست که ایامدی عملاً نیمی از کار استنتاج را به سختافزاری سپرده که خودش نمیسازد. این پذیرش صریح یک واقعیت است: در استنتاج، هیچ معماری واحدی برندهی همهی میدانها نیست.
۵) ادعای پنج برابری و پانویسی که باید خواند
عدد تیترشده این است: تا ۵ برابر توکن بیشتر در ثانیه به ازای هر وات. اما جزئیات مهماند و در پانویس بیانیه آمدهاند.
نخست، مبنای مقایسه پیکربندی فقطسربراس است، نه یک سامانهی رقیب مانند محصولات انویدیا. یعنی این عدد میگوید «افزودن هلیوس به مسیر، کارایی انرژی خود سربراس را چند برابر میکند»، نه اینکه این سامانه پنج برابر بهتر از هر چیز دیگری در بازار است.
دوم، این رقم حاصل مدلسازی آزمایشگاههای عملکرد ایامدی و سربراس در ژوئیهی ۲۰۲۶ است، نه اندازهگیری روی سامانهی مستقر. بار کاری مرجع هم مدل Kimi 2.6 با یک تریلیون پارامتر اعلام شده است. خود بیانیه تصریح میکند نتایج بسته به پیکربندی سامانه متفاوت خواهد بود.
این نوع عددخوانی دقیق، تفاوت میان تحلیل و تبلیغ است. اگر میخواهید عادت کنید ادعاهای هوش مصنوعی را با چشم باز بخوانید، نگاهی به پتانسیلها و محدودیتهای واقعی هوش مصنوعی بیندازید.
۶) چرا این خبر مستقیماً به انویدیا مربوط است
بازار شتابدهندههای هوش مصنوعی سالهاست عملاً یک بازیگر مسلط دارد. اما ترکیب بازار در حال تغییر است: اگر تا دیروز بیشتر بودجه صرف آموزش مدلها میشد، امروز با میلیاردها درخواست روزانه، وزنه به سمت استنتاج سنگینی میکند.
استنتاج بازی متفاوتی است. اینجا معیار موفقیت، هزینه به ازای هر میلیون توکن و تأخیر پاسخ است، نه صرفاً بیشینهی توان محاسباتی. و دقیقاً در همین شکاف است که رقبا میتوانند وارد شوند. راهبرد ایامدی و سربراس این است که بهجای رقابت رودررو در همهی جبههها، در یک جبههی مشخص با تخصصگرایی برنده شوند.
البته تجربه نشان داده که سد اصلی انویدیا سختافزار نیست، بلکه اکوسیستم نرمافزاری آن است. هر رقیبی باید ابزارها، کتابخانهها و مسیر مهاجرت روانی برای توسعهدهندگان فراهم کند و این کار سالها طول میکشد.

۷) واکنش بازار و ابهامهایی که باقی است
واکنش بورس به این اعلام یکدست نبود و گزارشهای رسانهای از آن روایتهای متفاوتی دادند؛ بخشی از این تفاوت به آن برمیگردد که اعلام شراکت همزمان با سایر خبرهای رویداد Advancing AI منتشر شد و جداکردن اثر هر خبر بر قیمت سهام ساده نیست.
فارغ از قیمت سهام، چند ابهام جدی باقی است. هزینهی نهایی به ازای هر میلیون توکن هنوز اعلام نشده. جزئیات اینکه انتقال وضعیت میان دو سختافزار — یعنی همان حافظهی نهان کلید و مقدار — با چه سرعتی و از چه مسیری انجام میشود، منتشر نشده است. و مهمتر از همه، هیچ سنجهی مستقل شخصثالثی روی سامانهی واقعی هنوز در دست نیست.
۸) این خبر برای کاربر و توسعهدهندهی ایرانی چه معنایی دارد؟
در کوتاهمدت، تقریباً هیچ کاربری قرار نیست رکی از هلیوس بخرد. اثر واقعی اینگونه خبرها غیرمستقیم است و از مسیر قیمت به دست کاربر میرسد.
هر بار که رقابت در لایهی سختافزار جدیتر میشود، هزینهی هر میلیون توکن در سرویسهای ابری پایین میآید. کاهش هزینه یعنی مدلهای قویتر روی پلنهای ارزانتر، پنجرههای زمینهی بزرگتر و سقفهای استفادهی بازتر. همان الگویی که در دو سال گذشته بارها تکرار شده است. برای دیدن اینکه رقابت قیمتی چطور کل بازار را جابهجا میکند، مقایسهی چتجیپیتی و دیپسیک نمونهی خوبی است.
برای کسبوکارها هم پیام روشن است: اگر معماری استنتاج در حال تفکیکشدن است، قفلشدن به یک تأمینکنندهی واحد ریسک دارد. لایهی انتزاعی روی ارائهدهندهی مدل بگذارید تا فردا بتوانید بدون بازنویسی کل محصول جابهجا شوید. اهمیت این جنس تصمیمها را در چرایی اهمیت هوش مصنوعی در کسبوکار بیشتر شکافتهایم.
۹) زمانبندی عرضه و آنچه باید رصد کرد
طبق اعلام دو شرکت، راهکار مشترک قرار است در نیمهی دوم ۲۰۲۶ از راه سربراس کلاود در دسترس قرار بگیرد. یعنی نخستین کاربران، توسعهدهندگانی خواهند بود که از راه ابر به آن وصل میشوند، نه خریداران سختافزار.
سه چیز ارزش رصدکردن دارند: نخست، انتشار قیمت رسمی به ازای هر میلیون توکن؛ دوم، نتایج سنجش مستقل روی بارهای کاری واقعی؛ و سوم، اینکه آیا سازندگان بزرگ مدل حاضر میشوند بخشی از ترافیک تولیدی خود را روی این معماری ببرند یا نه. تا وقتی نامهای بزرگ روی این سامانه نیایند، ماجرا در حد یک وعدهی فنی جذاب باقی میماند.
برای دنبالکردن تحولات بعدی این حوزه، بخش اخبار هوش مصنوعی را دنبال کنید و اگر میخواهید از پایه با مفاهیم و بازیگران این صنعت آشنا شوید، اوپنایآی چیست نقطهی شروع خوبی است.
پرسشهای پرتکرار دربارهی شراکت ایامدی و سربراس
آیا این سامانه جایگزین کارتهای گرافیک انویدیا میشود؟
خیر، دستکم فعلاً نه. این راهکار برای بخش استنتاج طراحی شده و آموزش مدلهای بزرگ همچنان میدان دیگری است. ضمناً اکوسیستم نرمافزاری انویدیا مزیتی است که با یک اعلام شراکت جابهجا نمیشود.
ادعای پنج برابر بهرهوری انرژی چقدر قابل اتکاست؟
این عدد بر پایهی مدلسازی آزمایشگاههای خود دو شرکت در ژوئیهی ۲۰۲۶ و روی یک مدل مرجع اعلام شده و مبنای مقایسهاش پیکربندی فقطسربراس است. تا انتشار سنجههای مستقل، بهتر است آن را یک تخمین خوشبینانه بدانید نه عدد قطعی.
چه زمانی میتوانم از این سامانه استفاده کنم؟
دو شرکت اعلام کردهاند که عرضه در نیمهی دوم ۲۰۲۶ از راه سربراس کلاود انجام میشود. تاریخ دقیق و قیمتگذاری هنوز منتشر نشده است.
تفاوت پردازش پرامپت و تولید توکن دقیقاً چیست؟
پردازش پرامپت یعنی خواندن یکبارهی کل ورودی که کاری موازی و وابسته به توان محاسباتی است؛ تولید توکن یعنی ساختن کلمهبهکلمهی پاسخ که کاری سریالی و وابسته به پهنای باند حافظه است. همین تفاوت بنیادی، منطق تقسیم کار میان دو سختافزار را میسازد.
آیا این خبر روی قیمت اشتراک سرویسهای هوش مصنوعی اثر میگذارد؟
مستقیم و فوری نه، اما رقابت بیشتر در لایهی سختافزار استنتاج در بلندمدت هزینهی هر توکن را پایین میآورد و این کاهش معمولاً با تأخیر به پلنهای کاربران میرسد.
