شیائومی با مدل تریلیون‌پارامتری میمو ۲.۶ وارد جنگ هوش مصنوعی شد

اخبار · هوش مصنوعی

شیائومی با انتشار رایگان و متن‌باز مدل هزار میلیارد پارامتری میمو ۲.۶، در برخی آزمون‌های عامل هوشمند از جمنای و گراک جلو افتاد و قیمت اجرای آن را به یک‌سوم رقبای غربی رساند.

چکیده. شرکت شیائومی دو مدل جدید به نام‌های میمو ۲.۶ پرو و میمو ۲.۶ فلش را با مجوز کاملاً متن‌باز منتشر کرد. نسخه پرو با هزار و بیست میلیارد پارامتر کل و تنها چهل و دو میلیارد پارامتر فعال، در شاخص هوش شرکت آرتیفیشال آنالیسیس نمره چهل‌وشش گرفت و از مدل‌های جمنای ۳.۸ فلش گوگل و دیپ‌سیک جلو زد. هزینه اجرای هر وظیفه با این مدل تنها حدود سیزده سنت است، در حالی که مدل‌های بسته غربی برای همان کار تا هشت دلار هزینه می‌گیرند.
مدل هوش مصنوعی میمو ۲.۶ شیائومی با هزار میلیارد پارامتر در برابر گراک

۱. شیائومی دقیقاً چه چیزی معرفی کرد؟

غول فناوری چین، شیائومی، از خانواده مدل‌های زبانی میمو ۲.۶ رونمایی کرد؛ مجموعه‌ای شامل دو مدل به نام‌های میمو ۲.۶ پرو و میمو ۲.۶ فلش. هر دو مدل به‌صورت کاملاً متن‌باز و با مجوز آزاد تجاری روی پلتفرم هاگینگ‌فیس در دسترس همه قرار گرفته‌اند؛ یعنی هر توسعه‌دهنده یا شرکتی می‌تواند آن‌ها را رایگان دانلود، اجرا و حتی در محصولات تجاری خودش استفاده کند. این رویکرد کاملاً در تضاد با سیاست شرکت‌های آمریکایی مثل اوپن‌ای‌آی و آنتروپیک است که مدل‌های پیشرفته خود را پشت درهای بسته و برنامه‌های دسترسی محدود نگه می‌دارند.

برای آشنایی بیشتر با اینکه شرکت‌های بزرگ آمریکایی مثل اوپن‌ای‌آی چگونه کار می‌کنند و چه تفاوتی با رویکرد متن‌باز چینی‌ها دارند، می‌توانید این مطلب را درباره اوپن‌ای‌آی بخوانید.

نکته مهم این است که شیائومی تا چند سال پیش بیشتر با گوشی‌های هوشمند، لوازم خانگی هوشمند و اخیراً خودروهای الکتریکی شناخته می‌شد، نه با تحقیقات پیشرفته هوش مصنوعی بنیادین. تیم میمو زیرمجموعه‌ای نسبتاً جوان درون این غول فناوری است که طی یک تا دو سال اخیر، پروژه به پروژه، وارد رقابت جدی با آزمایشگاه‌های تخصصی هوش مصنوعی مثل اوپن‌ای‌آی، آنتروپیک، گوگل دیپ‌مایند، ایکس‌ای‌آی و دیپ‌سیک شده است. همین موضوع نشان می‌دهد که مرز میان «شرکت‌های سخت‌افزاری» و «آزمایشگاه‌های هوش مصنوعی» روزبه‌روز کم‌رنگ‌تر می‌شود.

۲. مشخصات فنی: از تعداد پارامترها تا پنجره یک‌میلیون‌توکنی

نسخه پرو این مدل هزار و بیست میلیارد پارامتر دارد، اما به لطف معماری میکسچرآواکسپرت، در هر لحظه فقط چهل‌ودو میلیارد پارامتر از آن فعال می‌شود. نسخه فلش هم سیصد و ده میلیارد پارامتر کل و پانزده میلیارد پارامتر فعال دارد و برای کارهای پرحجم و سریع بهینه شده است. هر دو مدل پنجره متنی یک‌میلیون توکنی دارند و به‌طور کامل چندرسانه‌ای هستند؛ یعنی متن، تصویر، صدا و ویدئو را همزمان می‌فهمند.

ورودی چندرسانه‌ای یعنی چه؟

وقتی یک مدل چندرسانه‌ای واقعی باشد، دیگر نیازی به مدل‌های جداگانه برای پردازش عکس یا صدا نیست. کاربر می‌تواند یک عکس، یک فایل صوتی یا حتی یک کلیپ ویدئویی را همراه سوال خود بفرستد و مدل بدون واسطه به آن پاسخ دهد؛ قابلیتی که تا همین چند سال پیش فقط در اختیار معدودی از مدل‌های بسیار گران‌قیمت بود.

۳. معماری میکسچرآواکسپرت‌ها چگونه کار می‌کند؟

در مدل پرو، هفتاد لایه پردازشی با ترکیبی از توجه محلی و سراسری وجود دارد که در مجموع سیصد و هشتاد و چهار «کارشناس» یا زیرشبکه تخصصی را در خود جای داده است؛ اما برای هر توکن ورودی، تنها هشت‌تا از این کارشناسان فعال می‌شوند. همین ترفند باعث می‌شود مدلی به این بزرگی، هزینه اجرای بسیار پایین‌تری نسبت به مدل‌های چگال سنتی داشته باشد؛ چون بار پردازشی واقعی بسیار کمتر از حجم کل مدل است.

۴. نتایج بنچمارک‌ها: میمو پرو کجای رقابت جهانی ایستاده؟

طبق ارزیابی مستقل شرکت آرتیفیشال آنالیسیس، میمو ۲.۶ پرو در شاخص هوش این شرکت نمره چهل‌وشش گرفته و همتراز گراک ۴.۷ ایکس‌ای‌آی شده است؛ نمره‌ای که از جمنای ۳.۸ فلش گوگل، دیپ‌سیک وی۴.۱ فلش و دیپ‌سیک وی۴.۱ پرو بالاتر است. در آزمون‌های تخصصی عامل‌های هوشمند هم نتایج قابل‌توجهی ثبت شده؛ برای نمونه نمره پنجاه‌وسه‌ممیزیک در آزمون اتومیشن‌بنچ، نمره هشتادونه‌ممیزنه در ترمینال‌بنچ نسخه ۲.۱ و نمره نود‌وچهار در سایبرگیم، که در همه این موارد از کلود اوپوس ۵ و جی‌پی‌تی۵.۶ سول پیشی گرفته است.

اگر می‌خواهید بدانید این رقابت شدید بین مدل‌های چینی و غربی در عمل چه تفاوتی در زندگی روزمره ایجاد می‌کند، این تحلیل درباره پتانسیل واقعی و محدودیت‌های هوش مصنوعی را از دست ندهید.

مقایسه هزینه اجرای مدل میمو ۲.۶ شیائومی با کلود اوپوس و جی‌پی‌تی

۵. مقایسه با کلود اوپوس، جی‌پی‌تی و گراک

البته میمو پرو در همه زمینه‌ها پیشتاز نیست. در آزمون دیپ‌اس‌دبلیوای نسخه ۱.۱، این مدل نمره هفتادویک‌ممیزنه گرفته که کمی پایین‌تر از نمره هفتادوچهار کلود اوپوس ۵ است. در آزمون بسیار سخت‌تر ترمینال‌بنچ نسخه ۴.۰ هم فاصله بیشتر می‌شود؛ سی‌وچهارممیزنه در برابر چهل‌ونه امتیاز کلود. این یعنی روی سخت‌ترین وظایف برنامه‌نویسی و اکسپلویت امنیتی، مدل‌های آنتروپیک هنوز جلوتر هستند، اما فاصله در بسیاری از آزمون‌های روزمره عامل هوشمند تقریباً از بین رفته است.

پیش از این هم دیده بودیم که مدل‌های چینی مثل دیپ‌سیک چطور وارد رقابت مستقیم با چت‌جی‌پی‌تی شده بودند؛ برای مرور کامل آن ماجرا می‌توانید مقایسه چت‌جی‌پی‌تی و دیپ‌سیک را بخوانید.

واکنش جامعه توسعه‌دهندگان به این انتشار هم قابل‌توجه بوده است. تیم دتمرز، پژوهشگر شناخته‌شده حوزه یادگیری ماشین که پیش‌تر روی بهینه‌سازی مدل‌های بزرگ کار کرده، درباره نسخه فلش نوشته این مدل «حس بسیار خوبی» می‌دهد و آن را بهترین مدل در رده سیصد تا پانصدوپنجاه میلیارد پارامتر توصیف کرده است. چنین واکنش‌هایی از سوی چهره‌های مستقل و بی‌طرف، معمولاً وزن بیشتری نسبت به تبلیغات رسمی خود شرکت‌ها دارد و نشان می‌دهد این مدل صرفاً یک ادعای بازاریابی نیست.

۶. قیمت و در دسترس بودن: متن‌باز و به‌شدت ارزان

نسخه فلش با نرخ حدود چهارده‌سنت برای هر میلیون توکن ورودی و بیست‌وهشت‌سنت برای هر میلیون توکن خروجی قیمت‌گذاری شده است. نسخه پرو هم چهل‌وسه‌سنت برای ورودی و هشتادوهفت‌سنت برای خروجی هزینه دارد. طبق برآورد آرتیفیشال آنالیسیس، هزینه اجرای هر وظیفه با میمو پرو تنها حدود سیزده‌سنت است؛ در مقابل، مدل‌های بسته غربی معمولاً بین سه تا هشت دلار برای همان وظیفه هزینه می‌گیرند. از آنجا که هر دو مدل با مجوز آزاد منتشر شده‌اند، شرکت‌ها می‌توانند آن‌ها را روی سرورهای خودشان هم اجرا کنند و حتی هزینه‌ای به شیائومی پرداخت نکنند.

برای کسب‌وکارهایی که به دنبال کاهش هزینه ابزارهای هوش مصنوعی خود هستند، خواندن این راهنما درباره اهمیت هوش مصنوعی در کسب‌وکار خالی از لطف نیست.

۷. شش روز آموزش فشرده و شفافیتی غیرمعمول

یکی از جالب‌ترین بخش‌های این خبر، شیوه آموزش این مدل‌هاست. طبق گزارش‌ها، تیم میمو حدود دو میلیون و ششصد و بیست هزار دلار برای آموزش نسخه پرو و حدود هشتصد و پنجاه هزار دلار برای نسخه فلش هزینه کرده و کل فرآیند یادگیری تقویتی را روی هفتصد و پنجاه هزار مسیر تصمیم‌گیری، در کمتر از شش روز انجام داده است. فولی لو، سرپرست تیم میمو و پژوهشگر پیشین دیپ‌سیک، گفته است در دورانی که قدرت پردازشی به‌شدت کمیاب است، آن‌ها ترجیح دادند چند ده مهندس را برای مدت طولانی روی یک هدف واحد متمرکز کنند: مقیاس‌دادن یادگیری تقویتی.

نکته جالب دیگر این است که شیائومی یک داشبورد زنده از روند آموزش منتشر کرد و حتی شکست‌ها و داده‌های حذف‌شده به‌خاطر افت کیفیت را هم علنی اعلام کرد؛ سطحی از شفافیت که کمتر در پروژه‌های بزرگ هوش مصنوعی دیده می‌شود. این نوع رویکرد یادآور تفاوت میان تیم‌های کوچک و مستقل با آزمایشگاه‌های غول‌پیکر است؛ موضوعی که در این مطلب درباره توهم توسعه‌دهنده تنها در برابر مهندس واقعی هم بررسی شده است.

روند آموزش شفاف مدل متن‌باز میمو ۲.۶ شیائومی در برابر مدل‌های بسته اوپن‌ای‌آی

۸. این خبر چه معنایی برای کاربران و کسب‌وکارهای ایرانی دارد؟

برای بسیاری از توسعه‌دهندگان ایرانی که به‌خاطر محدودیت‌های پرداخت یا تحریم، دسترسی راحتی به مدل‌های بسته آمریکایی ندارند، وجود یک مدل قدرتمند، رایگان و متن‌باز مثل میمو ۲.۶ فرصت بزرگی است. می‌توان این مدل را روی سرورهای داخلی یا سرویس‌های ابری در دسترس اجرا کرد و بدون نیاز به کارت بین‌المللی، از قابلیت‌هایی نزدیک به کلود و جی‌پی‌تی بهره برد. البته برای استفاده مؤثر از چنین مدل‌هایی، دانستن اصول درست پرامپت‌نویسی همچنان ضروری است؛ در این آموزش ساده پرامپت‌نویسی می‌توانید این اصول را یاد بگیرید.

برای کسانی که می‌خواهند مهارت کار با ابزارهایی مثل چت‌جی‌پی‌تی را هم تقویت کنند، مجموعه آموزش‌های چت‌جی‌پی‌تی در سایت ما نقطه شروع خوبی است، و برای دنبال کردن ادامه این رقابت نفس‌گیر بین شرکت‌های چینی و آمریکایی، صفحه اخبار هوش مصنوعی همیشه به‌روز می‌شود.

پرسش‌های متداول

آیا میمو ۲.۶ واقعاً رایگان است؟ بله، هر دو مدل با مجوز آزاد تجاری منتشر شده‌اند و می‌توان آن‌ها را رایگان دانلود و حتی در پروژه‌های تجاری استفاده کرد.

آیا میمو ۲.۶ از کلود یا جی‌پی‌تی بهتر است؟ در برخی آزمون‌های عامل هوشمند و اجرای وظایف عملی، بله؛ اما در سخت‌ترین آزمون‌های برنامه‌نویسی و امنیتی، کلود اوپوس ۵ همچنان جلوتر است.

هزینه استفاده از این مدل چقدر است؟ بسته به نسخه، هر میلیون توکن بین چهارده تا هشتادوهفت سنت هزینه دارد که به‌مراتب ارزان‌تر از مدل‌های بسته غربی است.

چه کسانی می‌توانند از میمو ۲.۶ استفاده کنند؟ چون متن‌باز است، هر توسعه‌دهنده، استارتاپ یا شرکتی در هر نقطه از جهان، از جمله ایران، می‌تواند آن را روی زیرساخت خودش اجرا کند.

چه سخت‌افزاری برای اجرای این مدل لازم است؟ نسخه پرو به‌خاطر حجم بالا معمولاً روی چند کارت گرافیک قدرتمند یا سرویس‌های ابری تخصصی اجرا می‌شود، اما نسخه فلش با حجم کوچک‌تر، برای بسیاری از تیم‌های کوچک‌تر هم قابل اجراست.

آیا این مدل به فارسی هم پاسخ می‌دهد؟ مدل‌های چندزبانه بزرگ مثل میمو معمولاً از زبان فارسی هم پشتیبانی می‌کنند، هرچند کیفیت آن ممکن است به‌اندازه انگلیسی یا چینی نباشد؛ بهترین راه، آزمایش مستقیم مدل با یک پرامپت فارسی ساده است.

در یک جمله: شیائومی نشان داد که رقابت هوش مصنوعی دیگر فقط بین چند غول آمریکایی نیست، و مدل‌های متن‌باز چینی دارند با سرعتی نفس‌گیر به آن‌ها می‌رسند. برای دنبال کردن لحظه‌به‌لحظه این رقابت و دریافت تحلیل‌های ساده و قابل‌فهم از هر خبر مهم هوش مصنوعی، کانال تلگرام @MrChatGPT_IR را دنبال کنید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *