معرفی مدل هوش مصنوعی Nemotron 3.5 Lightning انویدیا با معماری MoE و سرعت بالا

انویدیا Nemotron 3.5 Lightning و NeMo Switchyard را معرفی کرد؛ هزینه ایجنت‌های هوش مصنوعی سازمانی تا یک‌سوم کاهش یافت

اخبار · هوش مصنوعی

انویدیا با معرفی مدل کوچک و تند Nemotron 3.5 Lightning و ابزار متن‌باز مسیریابی NeMo Switchyard، وارد میدان تازه‌ای از رقابت هوش مصنوعی سازمانی شده است؛ میدانی که در آن برنده کسی نیست که بزرگ‌ترین مدل را دارد، بلکه کسی است که هزینه‌ی اجرای واقعی را پایین‌تر می‌آورد.

چکیده. انویدیا دو محصول مکمل منتشر کرده: مدل زبانی Nemotron 3.5 Lightning با ۳۰ میلیارد پارامتر کل و تنها ۳ میلیارد پارامتر فعال، و کتابخانه‌ی متن‌باز NeMo Switchyard برای مسیریابی هوشمند کارها بین مدل‌های کوچک و بزرگ. نتیجه، طبق گزارش شرکای انویدیا مانند LangChain و Ramp، کاهش هزینه‌ی اجرای ایجنت‌های هوش مصنوعی تا حدود یک‌سوم و افزایش سرعت تا چهار برابر بوده است.
معرفی مدل هوش مصنوعی Nemotron 3.5 Lightning انویدیا با معماری MoE و سرعت بالا

۱. چه اتفاقی افتاد؟

انویدیا در یک اعلامیه‌ی مشترک، دو محصول جدید را رونمایی کرد که قرار است لایه‌ی «اجرا»ی ایجنت‌های هوش مصنوعی را متحول کنند. اولی مدل زبانی Nemotron 3.5 Lightning است؛ مدلی سبک و سریع که برای اجرای دقیق و ارزان وظایف تخصصی طراحی شده، نه برای رقابت مستقیم با غول‌های استدلالی. دومی کتابخانه‌ی متن‌باز NeMo Switchyard است که وظیفه‌اش تصمیم‌گیری هوشمندانه درباره‌ی این است که هر مرحله از یک گردش‌کار ایجنتی باید به کدام مدل سپرده شود. برای آشنایی بیشتر با روند کلی این نوع اخبار، می‌توانید سری اخبار هوش مصنوعی سایت را هم دنبال کنید.

۲. معماری Nemotron 3.5 Lightning از نزدیک

این مدل از یک معماری ترکیبی بهره می‌برد: لایه‌های مامبا-۲ برای پردازش کارآمد توالی‌های طولانی، آمیزه‌ی متخصصان (Mixture-of-Experts) برای فعال‌سازی گزینشی بخش‌هایی از شبکه، و مکانیزم توجه استاندارد برای حفظ دقت در وظایف پیچیده. از میان ۳۰ میلیارد پارامتر کل مدل، در هر مرحله تنها حدود ۳ میلیارد پارامتر فعال می‌شوند؛ همین موضوع باعث می‌شود مصرف حافظه و توان پردازشی به‌شکل چشمگیری کاهش پیدا کند.

پنجره‌ی زمینه‌ی این مدل به یک میلیون توکن می‌رسد، یعنی می‌تواند اسناد بسیار طولانی، تاریخچه‌ی مکالمات گسترده یا مجموعه‌ای بزرگ از کد را در یک درخواست پردازش کند. انویدیا مدل را روی بیش از ۲۰ تریلیون توکن و با دستور NVFP4 آموزش داده که فشرده‌سازی وزن‌ها را بدون افت محسوس دقت ممکن می‌کند.

۳. اعداد و ارقام: سرعت، دقت و بنچمارک‌ها

طبق گزارش انویدیا، Nemotron 3.5 Lightning تا چهار برابر سریع‌تر از مدل‌های هم‌اندازه خروجی تولید می‌کند. در آزمون PinchBench که شامل ده‌هزار وظیفه‌ی واقعی است، این مدل با دقت ۸۶ درصد، سی درصد سریع‌تر از رقیبی مانند Qwen۳.۶ با ۳۵ میلیارد پارامتر عمل کرده است. در بنچمارک‌های استاندارد هم امتیازهای قابل‌قبولی ثبت شده: نزدیک به ۸۲ در MMLU Pro، حدود ۷۵ در GPQA Diamond و بالای ۵۱ در SWE-bench Verified.

با این حال، در برخی سنجش‌ها این مدل هنوز از رقیب هم‌رده‌اش یعنی Gemma۴ با ۳۱ میلیارد پارامتر گوگل عقب می‌ماند. انویدیا صراحتاً می‌گوید هدف اصلی این مدل، رتبه‌ی اول در جدول بنچمارک‌های عمومی نیست، بلکه دقت بالا روی وظایف مشخص و تکرارشونده‌ی سازمانی است؛ نکته‌ای که در بخش‌های بعدی بیشتر به آن می‌پردازیم.

نمودار مسیریابی هوشمند مدل‌های هوش مصنوعی با ابزار متن‌باز NeMo Switchyard انویدیا

۴. NeMo Switchyard چیست و مسیریابی مدل‌ها چگونه کار می‌کند؟

NeMo Switchyard یک کتابخانه‌ی مسیریابی متن‌باز و نوشته‌شده با زبان برنامه‌نویسی Rust است. توسعه‌دهندگان با آن می‌توانند «استخری» از مدل‌های مختلف تعریف کنند و قوانینی برای انتخاب مدل بر اساس کیفیت، تأخیر و هزینه بنویسند. این ابزار چند نوع مسیریاب ارائه می‌دهد: مسیریاب دسته‌بند بر پایه‌ی یک مدل کوچک زبانی، مسیریاب مرحله‌ای برای گردش‌کارهای چندگامی، مسیریاب تشدید که وظایف سخت‌تر را به مدل قوی‌تر ارجاع می‌دهد، و یک مسیریاب قابل‌یادگیری که با تحلیل جریان درونی مدل تصمیم می‌گیرد.

ایده‌ی پشت این معماری ساده اما مؤثر است: مدل‌های بزرگ و گران‌قیمت مثل Claude Opus برای تصمیم‌های سطح بالا و پیچیده نگه داشته می‌شوند، در حالی که وظایف تکراری مثل فراخوانی ابزار، اعتبارسنجی خروجی، بازیابی از حافظه‌ی بلندمدت یا بازبینی کد به مدل‌های کوچک و تندی مانند Lightning سپرده می‌شود. برای آشنایی با نحوه‌ی نوشتن دستورهای دقیق برای این نوع مدل‌ها، مطلب آموزش نوشتن پرامپت برای مبتدیان می‌تواند نقطه‌ی شروع خوبی باشد.

۵. نتایج در دنیای واقعی: LangChain، Ramp و شرکای دیگر

انویدیا برای اثبات ادعاهای خود، نتایج چند شریک تجاری را هم منتشر کرده است. تیم LangChain با مسیریابی هوشمند و ارسال تنها هفت درصد از درخواست‌ها به مدل‌های گران‌قیمت، توانسته هزینه‌ی گردش‌کارهای چندمرحله‌ای را تا ۷۴ درصد کاهش دهد. شرکت مالی Ramp هم گزارش کرده با همین رویکرد، هزینه را ۵۸ درصد پایین آورده و در عین حفظ دقت، سرعت اجرای وظایف را ۳۳ درصد افزایش داده است.

در آزمایش داخلی خود انویدیا، سیستمی که ترکیبی از Lightning و یک مدل بزرگ‌تر را از طریق Switchyard مسیریابی می‌کرد، به دقتی در حد مدل‌های فرونتیر رسید، اما هزینه‌ی تکمیل کار را تا حدود یک‌سوم هزینه‌ی اتکای کامل به یک مدل بزرگ مانند Opus کاهش داد. شرکت‌های دیگری مانند CrowdStrike و CodeRabbit هم گزارش داده‌اند نسخه‌های پس‌آموزش‌دیده‌ی Lightning روی وظایف تخصصی خودشان، عملکردی هم‌تراز یا حتی بهتر از مدل‌های بزرگ‌تر داشته است.

۶. چرا انویدیا به‌جای مدل بزرگ‌تر، مدل کوچک‌تر منتشر کرد؟

پاسخ کوتاه این است: چون بازار هدف انویدیا در این عرضه، آزمایشگاه‌های تحقیقاتی نیستند، بلکه تیم‌های مهندسی سازمانی‌اند که می‌خواهند ایجنت‌های هوش مصنوعی را در مقیاس بزرگ و با هزینه‌ی قابل پیش‌بینی اجرا کنند. یکی از مدیران انویدیا در این زمینه گفته است که «بنچمارک‌های عمومی ایجنتی فقط نقطه‌ی شروع‌اند، اما در محیط عملیاتی واقعی، آنچه اهمیت دارد دقت روی وظیفه‌ی خاص شماست؛ و این جایی است که پس‌آموزش بیشترین تفاوت را ایجاد می‌کند». این رویکرد با نگاه کلی‌تری که در مطلب اهمیت هوش مصنوعی در کسب‌وکار بررسی شده هم‌راستاست: ارزش واقعی هوش مصنوعی سازمانی، نه در بزرگ‌ترین مدل، بلکه در استقرار درست و کم‌هزینه‌ی آن نهفته است.

۷. جایگاه این عرضه در جنگ مدل‌های متن‌باز

این حرکت انویدیا در بستر رقابتی داغ میان مدل‌های متن‌باز معنا پیدا می‌کند. گوگل با خانواده‌ی Gemma، علی‌بابا با Qwen و شرکت‌های دیگر هم مدل‌های سبک و رایگان خود را عرضه کرده‌اند تا سهم بیشتری از توسعه‌دهندگان و شرکت‌های کوچک‌تر را جذب کنند. تفاوت اصلی رویکرد انویدیا این است که به‌جای رقابت مستقیم بر سر بالاترین امتیاز در جدول‌های رتبه‌بندی، تمرکز خود را روی لایه‌ی اجرای عملیاتی و ابزارهای زیرساختی مثل Switchyard گذاشته است. اگر می‌خواهید ببینید رقابت میان مدل‌های مختلف در عمل چه شکلی دارد، مطلب مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک نمونه‌ی خوبی از این نوع تحلیل‌هاست.

مجوز عرضه‌ی Nemotron 3.5 Lightning هم قابل‌توجه است: مدل تحت مجوز OpenMDW-1.1 منتشر شده که علاوه بر وزن‌های باز، داده‌های آموزشی و دستورالعمل ساخت مدل را هم در اختیار توسعه‌دهندگان می‌گذارد و برای استفاده‌ی تجاری آماده است. این مدل روی یک کارت گرافیک مدرن مثل DGX Spark یا H100 قابل اجراست و از طریق پلتفرم‌هایی مانند Hugging Face، Baseten، Together AI و Nebius هم در دسترس قرار گرفته است.

۸. این خبر برای توسعه‌دهندگان و کسب‌وکارهای ایرانی چه معنایی دارد؟

برای تیم‌های محصول و توسعه‌دهندگانی که در حال ساخت ایجنت‌های هوش مصنوعی هستند، این عرضه یک پیام روشن دارد: لازم نیست هر درخواست کاربر را به گران‌ترین مدل موجود بفرستید. با طراحی درست معماری مسیریابی، می‌توان بخش بزرگی از هزینه‌ها را بدون افت محسوس کیفیت کاهش داد. اگر تازه با مفهوم ایجنت‌های هوش مصنوعی و کاربردهای عملی آن‌ها آشنا می‌شوید، آموزش‌های سایت در بخش آموزش‌های چت‌جی‌پی‌تی نقطه‌ی خوبی برای شروع است.

در عین حال باید واقع‌بین بود؛ همان‌طور که در مطلب توانایی‌ها و محدودیت‌های واقعی هوش مصنوعی اشاره شده، هیچ مدلی، حتی با معماری بهینه، جایگزین کامل نظارت انسانی روی وظایف حساس نیست. مسیریابی هوشمند هزینه را کاهش می‌دهد، اما مسئولیت طراحی درست گردش‌کار همچنان بر عهده‌ی تیم توسعه است.

۹. چالش‌ها و نکات احتیاط

وابستگی به زیرساخت انویدیا یکی از نکاتی است که منتقدان مطرح می‌کنند؛ هرچند مدل و مسیریاب متن‌باز هستند، بهترین عملکرد آن‌ها روی سخت‌افزار خود انویدیا دیده می‌شود. نکته‌ی دیگر، عقب‌ماندن نسبی این مدل از رقبای هم‌رده در برخی بنچمارک‌های عمومی است که نشان می‌دهد این محصول برای همه‌ی کاربردها گزینه‌ی ایده‌آل نیست. در نهایت، فاصله‌ی میان تبلیغات یک شرکت فناوری و عملکرد واقعی محصول در محیط تولید، همیشه موضوعی است که باید با دقت بیشتری بررسی شود؛ موضوعی که در مطلب توهم هوش مصنوعی؛ توسعه‌دهنده‌ی تنها در برابر مهندس واقعی هم به‌تفصیل به آن پرداخته شده است.

سوالات متداول

Nemotron 3.5 Lightning دقیقاً چیست؟

مدلی زبانی از انویدیا با ۳۰ میلیارد پارامتر کل و تنها ۳ میلیارد پارامتر فعال در هر مرحله است که برای سرعت بالا و هزینه‌ی پایین در اجرای وظایف ایجنتی طراحی شده است.

NeMo Switchyard چه کاری انجام می‌دهد؟

کتابخانه‌ای متن‌باز است که تصمیم می‌گیرد هر مرحله از یک گردش‌کار هوش مصنوعی باید به کدام مدل، بر اساس کیفیت، سرعت و هزینه، سپرده شود.

آیا این مدل رایگان و متن‌باز است؟

بله؛ Nemotron 3.5 Lightning تحت مجوز OpenMDW-1.1 با وزن‌ها، داده‌های آموزشی و دستورالعمل ساخت باز منتشر شده و برای استفاده‌ی تجاری هم در دسترس است.

چقدر می‌توان با این روش در هزینه صرفه‌جویی کرد؟

بر اساس گزارش شرکای انویدیا مانند LangChain و Ramp، کاهش هزینه در برخی گردش‌کارها بین ۵۸ تا ۷۴ درصد گزارش شده، و در برخی سناریوهای داخلی انویدیا هزینه تا یک‌سوم پایین آمده است.

جمع‌بندی. عرضه‌ی Nemotron 3.5 Lightning و NeMo Switchyard نشان می‌دهد رقابت هوش مصنوعی سازمانی وارد فاز تازه‌ای شده: به‌جای رقابت صرف بر سر بزرگ‌ترین مدل، شرکت‌ها اکنون به دنبال ترکیب هوشمند مدل‌های بزرگ و کوچک برای کاهش هزینه‌ی واقعی هستند. برای دنبال‌کردن ادامه‌ی این روند و تازه‌ترین اخبار هوش مصنوعی، کانال تلگرام @MrChatGPT_IR را از دست ندهید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *