دیپ‌سیک با مدل V4.1 Flash حافظه ایجنت‌های هوش مصنوعی را ۸ برابر کوچک کرد

اخبار هوش مصنوعی · هوش مصنوعی

دیپ‌سیک با معرفی مدل تازه‌ی V4.1 Flash، یکی از بزرگ‌ترین چالش‌های عملی صنعت هوش مصنوعی یعنی هزینه‌ی سرسام‌آور اجرای طولانی‌مدت ایجنت‌ها را هدف گرفته و مصرف حافظه را تا هشت برابر پایین آورده است.

چکیده. شرکت چینی دیپ‌سیک از مدل جدید V4.1 Flash رونمایی کرده که با معماری رمزگذار-رمزگشای علّی و فشرده‌سازی چندلایه‌ی حافظه، حجم کش موردنیاز هر توکن را به حدود ۸۹۰ بایت رسانده است؛ رقمی که تا ۴۳۷ برابر کوچک‌تر از نسل اول این خانواده و حدود یک‌چهارم مدل قبلی همین شرکت است. این مدل با پنجره‌ی زمینه‌ی یک‌میلیون توکنی، درک تصویر و متن، و انتشار متن‌باز وزن‌ها، در آزمون‌های سخت کدنویسی عملکردی نزدیک به مدل‌های گران‌قیمت رقبا از جمله کلود اوپوس-۵ ثبت کرده است.
دیپ‌سیک V4.1 Flash با معماری تازه حافظه موردنیاز ایجنت‌های هوش مصنوعی را کاهش می‌دهد

۱. چرا حافظه‌ی ایجنت‌های هوش مصنوعی این‌قدر مهم شده است؟

تا همین چند سال پیش، معیار اصلی سنجش یک مدل هوش مصنوعی صرفاً امتیازش در آزمون‌های استدلال و دانش عمومی بود. اما با گسترش کاربرد هوش مصنوعی در کسب‌وکارها و ظهور ایجنت‌هایی که ساعت‌ها بدون توقف کار می‌کنند، مشکل تازه‌ای پدیدار شد: هرچه یک ایجنت بیشتر کار کند، تاریخچه‌ی مکالمه و فراخوانی ابزارهایش بزرگ‌تر می‌شود و نگه‌داشتن این حافظه در سرورها هزینه‌ای سرسام‌آور ایجاد می‌کند.

دقیقاً همین‌جاست که دیپ‌سیک وارد میدان شده. این شرکت به‌جای رقابت صرف سر هوشمندی خام، مدل تازه‌اش را از پایه برای دنیایی طراحی کرده که در آن ایجنت‌ها باید برای ساعت‌ها زنده بمانند، ابزار فراخوانی کنند و تاریخچه‌ی طولانی جمع کنند، بدون این‌که هزینه از کنترل خارج شود.

واقعیت این است که در بسیاری از شرکت‌هایی که ایجنت‌های هوش مصنوعی را به‌صورت جدی در فرایندهای کاری خود به‌کار گرفته‌اند، بخش قابل‌توجهی از هزینه‌ی ماهانه نه صرف پردازش خام، بلکه صرف نگه‌داری حافظه‌ی مکالمات طولانی می‌شود. هر بار که یک ایجنت باید تاریخچه‌ی چند ساعته‌ی خود را به‌خاطر بسپارد، حجم عظیمی از داده باید در حافظه‌ی سرورها ذخیره و مدیریت شود؛ موضوعی که با افزایش تعداد کاربران، به‌سرعت به یک چالش مالی جدی تبدیل می‌شود.

۲. دیپ‌سیک V4.1 Flash دقیقاً چیست؟

مدل V4.1 Flash یک سامانه‌ی چندوجهی با معماری آمیخته از متخصصان (Mixture-of-Experts) است که مجموعاً ۵۵۲ میلیارد پارامتر اصلی به‌همراه ۱۹۶ میلیارد پارامتر اضافه برای ماژول حافظه‌ای به نام Engram دارد. در عمل، در هر لحظه فقط بخش کوچکی از این پارامترها فعال می‌شوند؛ حدود ۸ میلیارد پارامتر در مرحله‌ی پردازش اولیه (Prefill) و ۱۶ میلیارد پارامتر در مرحله‌ی تولید پاسخ (Decode). همین طراحی باعث می‌شود مدل بدون نیاز به سخت‌افزار غول‌پیکر، عملکردی رقابتی داشته باشد.

برای آشنایی بیشتر با ماهیت مدل‌های زبانی و تفاوت آن‌ها با نسل‌های قبلی، می‌توانید مقاله‌ی توضیح ساختار شرکت‌های پیشرو هوش مصنوعی مانند OpenAI را هم در سایت ما بخوانید.

۳. معماری رمزگذار-رمزگشای علّی؛ ترفند اصلی کاهش هزینه

هسته‌ی نوآوری این مدل در معماری ۴۰ لایه‌ای آن نهفته است که به دو نیمه‌ی ۲۰ لایه‌ای تقسیم شده: یک بخش رمزگذار و یک بخش رمزگشا. نیمه‌ی رمزگذار، متن ورودی را پردازش می‌کند و سپس نتیجه‌ی نهایی را بدون نیاز به بازخوانی کامل زمینه به نیمه‌ی رمزگشا منتقل می‌کند. طبق گزارش فنی منتشرشده، همین ترفند به‌تنهایی محاسبات مرحله‌ی پردازش اولیه را تقریباً نصف می‌کند.

سازوکار بازپخش محدود در پنجره‌ی لغزان

علاوه‌بر این، بخش رمزگشا از یک پنجره‌ی توجه لغزان ۱۲۸ توکنی استفاده می‌کند که به‌جای نگه‌داری دائمی داده‌های کوتاه‌مدت، آن‌ها را موقتاً در حافظه‌ی توزیع‌شده نگه می‌دارد و در صورت نیاز با «بازپخش تقریبی» بازسازی می‌کند. این یعنی داده‌هایی که قبلاً باید ساعت‌ها ذخیره می‌شدند، دیگر بار دائمی روی حافظه نمی‌گذارند.

مقایسه عملکرد دیپ‌سیک V4.1 Flash با کلود اوپوس در آزمون‌های کدنویسی و برنامه‌نویسی

۴. فشرده‌سازی چندلایه و کوانتیزاسیون چهاربیتی

فناوری دیگری که در گزارش‌های فنی با نام CSA2 (Compressed Sparse Attention 2) معرفی شده، به لایه‌های مختلف مدل اجازه می‌دهد به‌جای نگه‌داری حافظه‌ی کاملاً مستقل، بخشی از کش کلید-مقدار و شاخص‌هایشان را با یکدیگر به اشتراک بگذارند؛ گاهی به‌صورت کامل و گاهی با تنظیمات جزئی. ترکیب این روش با کوانتیزاسیون چهاربیتی کش اصلی (با فرمت FP4) و نگه‌داشتن کش پنجره‌ی لغزان در دقت هشت‌بیتی، باعث شده حجم حافظه‌ی موردنیاز هر توکن به حدود ۸۹۰ بایت برسد؛ یعنی تقریباً یک‌چهارم نسل قبلی همین شرکت و حدود ۴۳۷ برابر کوچک‌تر از نخستین مدل خانواده‌ی دیپ‌سیک.

این سطح از فشرده‌سازی، مستقیماً روی هزینه‌ی نهایی اجرای ایجنت‌ها اثر می‌گذارد؛ موضوعی که برای هر کسب‌وکاری که به دنبال استفاده‌ی مقرون‌به‌صرفه از هوش مصنوعی است، اهمیت زیادی دارد. اگر می‌خواهید بدانید چگونه می‌توان از چنین ابزارهایی در عمل بهره برد، راهنمای نوشتن پرامپت برای مبتدیان نقطه‌ی شروع خوبی است.

۵. پنجره‌ی زمینه‌ی یک‌میلیون توکنی و درک تصویر

پیش‌آموزش این مدل روی حدود ۴۵ تریلیون توکن چندوجهی با نسبت تقریبی هفت‌به‌یک متن به داده‌های تصویری انجام شده و همین باعث شده V4.1 Flash بتواند در کنار متن، تصاویر را هم به‌صورت بومی پردازش کند. پنجره‌ی زمینه‌ی این مدل تا یک میلیون توکن گسترش یافته؛ رقمی که برای تحلیل اسناد بلند، مرور کدهای حجیم یا اجرای ایجنت‌هایی با تاریخچه‌ی طولانی کاملاً کاربردی است.

۶. عملکرد در آزمون‌ها؛ مقایسه با کلود و رقبا

نتایج منتشرشده نشان می‌دهد V4.1 Flash در بسیاری از آزمون‌های سخت، عملکردی نزدیک به مدل‌های گران‌قیمت رقبا از خود نشان داده است. در آزمون Terminal-Bench 2.1 امتیاز ۹۰.۶ ثبت کرده که نسبت به نسخه‌ی قبلی همین شرکت (۸۲.۷) جهش قابل توجهی است و حتی از امتیاز ۸۹.۱ کلود اوپوس-۵ هم پیشی گرفته. در آزمون کدنویسی DeepSWE v1.1 نیز امتیاز ۷۴.۲ به‌دست آورده که تقریباً برابر با امتیاز ۷۴.۰ کلود اوپوس-۵ است. رتبه‌ی این مدل در Codeforces به ۳۴۷۱ رسیده که نسبت به نسل قبلی (۳۲۸۹) پیشرفت محسوسی دارد.

جایی که رقبا هنوز جلوترند

با این‌حال، این برتری همه‌جانبه نیست. در آزمون‌های سخت‌تر مانند Terminal-Bench نسخه‌ی ۳.۰، دیپ‌سیک امتیاز ۳۰.۰ کسب کرده در حالی‌که کلود اوپوس-۵ به ۴۳.۳ رسیده است؛ نشانه‌ای از این‌که برای وظایف پیچیده‌تر و چندمرحله‌ای، مدل‌های پرچمدار غربی همچنان برتری دارند. برای درک بهتر تفاوت رویکرد شرکت‌های چینی و آمریکایی در ساخت مدل‌های هوش مصنوعی، مطالعه‌ی مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک در سایت ما خالی از لطف نیست.

نکته‌ی جالب‌توجه دیگری که تحلیلگران به آن اشاره کرده‌اند این است که نتیجه‌ی نهایی یک ایجنت، تنها به مدل زیرین بستگی ندارد. نحوه‌ی طراحی چارچوب اجرایی یا همان «هارنس» که مدل در آن اجرا می‌شود، می‌تواند امتیاز نهایی را چند واحد تغییر دهد. این یافته نشان می‌دهد مهندسی سیستم اطراف مدل، به‌اندازه‌ی خود معماری مدل اهمیت پیدا کرده است.

۷. متن‌باز بودن؛ چرا این تصمیم اهمیت دارد؟

یکی از نکات مهم این عرضه، انتشار کامل وزن‌های مدل تحت مجوز آزاد MIT است. توسعه‌دهندگان می‌توانند این مدل را از طریق مسیرهای رایج مانند vLLM، SGLang و Transformers روی زیرساخت هاگینگ‌فیس دانلود و اجرا کنند، بدون این‌که وابسته به یک ارائه‌دهنده‌ی خاص باشند. چنین رویکردی معمولاً باعث می‌شود جامعه‌ی توسعه‌دهندگان سریع‌تر نقاط ضعف مدل را کشف و اصلاح کنند و کاربردهای تازه‌ای برایش پیدا کنند.

کسانی که به دنبال ساخت ابزار یا محصول روی چنین مدل‌هایی هستند، می‌توانند برای درک بهتر مرز میان کار واقعی مهندسی و استفاده‌ی سطحی از هوش مصنوعی، نگاهی هم به مقاله‌ی توسعه‌دهنده‌ی تنها در برابر مهندس واقعی بیندازند.

رقابت تازه صنعت هوش مصنوعی بر سر هزینه اجرای طولانی‌مدت ایجنت‌ها

۸. این تحول چه معنایی برای آینده‌ی ایجنت‌های هوش مصنوعی دارد؟

گزارش‌های تحلیلی صنعت هوش مصنوعی تأکید می‌کنند که رقابت این روزها دیگر فقط بر سر رتبه‌ی برتر در آزمون‌ها نیست، بلکه معیار تازه‌ای وارد میدان شده: هزینه‌ی واقعی «زنده نگه‌داشتن» یک ایجنت برای ساعت‌ها کار مداوم. مدلی که بتواند با هزینه‌ی کمتر، عملکردی نزدیک به مدل‌های گران‌قیمت ارائه دهد، برای شرکت‌هایی که می‌خواهند ایجنت‌های هوش مصنوعی را در مقیاس واقعی به‌کار بگیرند، جذابیت اقتصادی بسیار بیشتری دارد.

هرچند این فناوری هنوز جای رشد دارد و در برخی آزمون‌های پیچیده از رقبای گران‌قیمت‌تر عقب است، اما مسیر آن نشان می‌دهد صنعت هوش مصنوعی به‌سرعت به سمت بهینه‌سازی اقتصادی حرکت می‌کند، نه فقط افزایش خام هوشمندی. اگر به کاربردهای واقعی و محدودیت‌های فعلی چنین فناوری‌هایی علاقه‌مندید، مقاله‌ی پتانسیل واقعی و محدودیت‌های هوش مصنوعی را از دست ندهید.

۹. جمع‌بندی: رقابت تازه‌ی صنعت هوش مصنوعی آغاز شده است

دیپ‌سیک با V4.1 Flash نشان داده که راه پیشرفت در هوش مصنوعی، همیشه از مسیر بزرگ‌تر کردن مدل‌ها نمی‌گذرد؛ گاهی یک بازطراحی هوشمندانه در معماری کافی است تا هزینه‌های عملیاتی به‌شدت کاهش یابد. برای پیگیری تازه‌ترین تحولات این حوزه، سری به بخش اخبار هوش مصنوعی سایت و آموزش‌های عملی چت‌جی‌پی‌تی بزنید.

پرسش‌های متداول

دیپ‌سیک V4.1 Flash چه تفاوتی با نسخه‌های قبلی دارد؟
این مدل با معماری رمزگذار-رمزگشای علّی و فشرده‌سازی چندلایه‌ی حافظه ساخته شده و مصرف کش کلید-مقدار را نسبت به نسل قبلی همین شرکت تا حدود چهار برابر و نسبت به نخستین مدل خانواده تا ۴۳۷ برابر کاهش داده است.

آیا این مدل رایگان و متن‌باز است؟
بله، وزن‌های مدل تحت مجوز آزاد MIT منتشر شده و از طریق پلتفرم‌های رایج مانند هاگینگ‌فیس در دسترس توسعه‌دهندگان قرار دارد.

عملکرد این مدل در مقایسه با کلود و سایر رقبا چگونه است؟
در بسیاری از آزمون‌های کدنویسی نتایجی نزدیک یا حتی بهتر از کلود اوپوس-۵ ثبت کرده، هرچند در برخی آزمون‌های پیچیده‌تر همچنان از رقبای گران‌قیمت‌تر عقب‌تر است.

چرا کاهش مصرف حافظه برای کسب‌وکارها اهمیت دارد؟
وقتی ایجنت‌های هوش مصنوعی برای ساعت‌ها بدون توقف در حال کار هستند، حجم حافظه‌ی موردنیاز برای نگه‌داری تاریخچه‌ی مکالمه مستقیماً روی هزینه‌ی نهایی سرویس اثر می‌گذارد؛ کاهش این هزینه یعنی امکان استفاده‌ی گسترده‌تر و مقرون‌به‌صرفه‌تر از ایجنت‌ها در مقیاس واقعی.

جمع‌بندی این‌که رقابت تازه‌ی صنعت هوش مصنوعی دیگر تنها بر سر هوشمندی خام نیست، بلکه کارایی و هزینه‌ی اجرای واقعی ایجنت‌ها به معیار تعیین‌کننده تبدیل شده است. برای دریافت تحلیل‌های بعدی و اخبار لحظه‌به‌لحظه‌ی هوش مصنوعی، کانال تلگرام @MrChatGPT_IR را دنبال کنید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *