شیائومی با انتشار رایگان و متنباز مدل هزار میلیارد پارامتری میمو ۲.۶، در برخی آزمونهای عامل هوشمند از جمنای و گراک جلو افتاد و قیمت اجرای آن را به یکسوم رقبای غربی رساند.

لیست مطالب
۱. شیائومی دقیقاً چه چیزی معرفی کرد؟
غول فناوری چین، شیائومی، از خانواده مدلهای زبانی میمو ۲.۶ رونمایی کرد؛ مجموعهای شامل دو مدل به نامهای میمو ۲.۶ پرو و میمو ۲.۶ فلش. هر دو مدل بهصورت کاملاً متنباز و با مجوز آزاد تجاری روی پلتفرم هاگینگفیس در دسترس همه قرار گرفتهاند؛ یعنی هر توسعهدهنده یا شرکتی میتواند آنها را رایگان دانلود، اجرا و حتی در محصولات تجاری خودش استفاده کند. این رویکرد کاملاً در تضاد با سیاست شرکتهای آمریکایی مثل اوپنایآی و آنتروپیک است که مدلهای پیشرفته خود را پشت درهای بسته و برنامههای دسترسی محدود نگه میدارند.
برای آشنایی بیشتر با اینکه شرکتهای بزرگ آمریکایی مثل اوپنایآی چگونه کار میکنند و چه تفاوتی با رویکرد متنباز چینیها دارند، میتوانید این مطلب را درباره اوپنایآی بخوانید.
نکته مهم این است که شیائومی تا چند سال پیش بیشتر با گوشیهای هوشمند، لوازم خانگی هوشمند و اخیراً خودروهای الکتریکی شناخته میشد، نه با تحقیقات پیشرفته هوش مصنوعی بنیادین. تیم میمو زیرمجموعهای نسبتاً جوان درون این غول فناوری است که طی یک تا دو سال اخیر، پروژه به پروژه، وارد رقابت جدی با آزمایشگاههای تخصصی هوش مصنوعی مثل اوپنایآی، آنتروپیک، گوگل دیپمایند، ایکسایآی و دیپسیک شده است. همین موضوع نشان میدهد که مرز میان «شرکتهای سختافزاری» و «آزمایشگاههای هوش مصنوعی» روزبهروز کمرنگتر میشود.
۲. مشخصات فنی: از تعداد پارامترها تا پنجره یکمیلیونتوکنی
نسخه پرو این مدل هزار و بیست میلیارد پارامتر دارد، اما به لطف معماری میکسچرآواکسپرت، در هر لحظه فقط چهلودو میلیارد پارامتر از آن فعال میشود. نسخه فلش هم سیصد و ده میلیارد پارامتر کل و پانزده میلیارد پارامتر فعال دارد و برای کارهای پرحجم و سریع بهینه شده است. هر دو مدل پنجره متنی یکمیلیون توکنی دارند و بهطور کامل چندرسانهای هستند؛ یعنی متن، تصویر، صدا و ویدئو را همزمان میفهمند.
ورودی چندرسانهای یعنی چه؟
وقتی یک مدل چندرسانهای واقعی باشد، دیگر نیازی به مدلهای جداگانه برای پردازش عکس یا صدا نیست. کاربر میتواند یک عکس، یک فایل صوتی یا حتی یک کلیپ ویدئویی را همراه سوال خود بفرستد و مدل بدون واسطه به آن پاسخ دهد؛ قابلیتی که تا همین چند سال پیش فقط در اختیار معدودی از مدلهای بسیار گرانقیمت بود.
۳. معماری میکسچرآواکسپرتها چگونه کار میکند؟
در مدل پرو، هفتاد لایه پردازشی با ترکیبی از توجه محلی و سراسری وجود دارد که در مجموع سیصد و هشتاد و چهار «کارشناس» یا زیرشبکه تخصصی را در خود جای داده است؛ اما برای هر توکن ورودی، تنها هشتتا از این کارشناسان فعال میشوند. همین ترفند باعث میشود مدلی به این بزرگی، هزینه اجرای بسیار پایینتری نسبت به مدلهای چگال سنتی داشته باشد؛ چون بار پردازشی واقعی بسیار کمتر از حجم کل مدل است.
۴. نتایج بنچمارکها: میمو پرو کجای رقابت جهانی ایستاده؟
طبق ارزیابی مستقل شرکت آرتیفیشال آنالیسیس، میمو ۲.۶ پرو در شاخص هوش این شرکت نمره چهلوشش گرفته و همتراز گراک ۴.۷ ایکسایآی شده است؛ نمرهای که از جمنای ۳.۸ فلش گوگل، دیپسیک وی۴.۱ فلش و دیپسیک وی۴.۱ پرو بالاتر است. در آزمونهای تخصصی عاملهای هوشمند هم نتایج قابلتوجهی ثبت شده؛ برای نمونه نمره پنجاهوسهممیزیک در آزمون اتومیشنبنچ، نمره هشتادونهممیزنه در ترمینالبنچ نسخه ۲.۱ و نمره نودوچهار در سایبرگیم، که در همه این موارد از کلود اوپوس ۵ و جیپیتی۵.۶ سول پیشی گرفته است.
اگر میخواهید بدانید این رقابت شدید بین مدلهای چینی و غربی در عمل چه تفاوتی در زندگی روزمره ایجاد میکند، این تحلیل درباره پتانسیل واقعی و محدودیتهای هوش مصنوعی را از دست ندهید.

۵. مقایسه با کلود اوپوس، جیپیتی و گراک
البته میمو پرو در همه زمینهها پیشتاز نیست. در آزمون دیپاسدبلیوای نسخه ۱.۱، این مدل نمره هفتادویکممیزنه گرفته که کمی پایینتر از نمره هفتادوچهار کلود اوپوس ۵ است. در آزمون بسیار سختتر ترمینالبنچ نسخه ۴.۰ هم فاصله بیشتر میشود؛ سیوچهارممیزنه در برابر چهلونه امتیاز کلود. این یعنی روی سختترین وظایف برنامهنویسی و اکسپلویت امنیتی، مدلهای آنتروپیک هنوز جلوتر هستند، اما فاصله در بسیاری از آزمونهای روزمره عامل هوشمند تقریباً از بین رفته است.
پیش از این هم دیده بودیم که مدلهای چینی مثل دیپسیک چطور وارد رقابت مستقیم با چتجیپیتی شده بودند؛ برای مرور کامل آن ماجرا میتوانید مقایسه چتجیپیتی و دیپسیک را بخوانید.
واکنش جامعه توسعهدهندگان به این انتشار هم قابلتوجه بوده است. تیم دتمرز، پژوهشگر شناختهشده حوزه یادگیری ماشین که پیشتر روی بهینهسازی مدلهای بزرگ کار کرده، درباره نسخه فلش نوشته این مدل «حس بسیار خوبی» میدهد و آن را بهترین مدل در رده سیصد تا پانصدوپنجاه میلیارد پارامتر توصیف کرده است. چنین واکنشهایی از سوی چهرههای مستقل و بیطرف، معمولاً وزن بیشتری نسبت به تبلیغات رسمی خود شرکتها دارد و نشان میدهد این مدل صرفاً یک ادعای بازاریابی نیست.
۶. قیمت و در دسترس بودن: متنباز و بهشدت ارزان
نسخه فلش با نرخ حدود چهاردهسنت برای هر میلیون توکن ورودی و بیستوهشتسنت برای هر میلیون توکن خروجی قیمتگذاری شده است. نسخه پرو هم چهلوسهسنت برای ورودی و هشتادوهفتسنت برای خروجی هزینه دارد. طبق برآورد آرتیفیشال آنالیسیس، هزینه اجرای هر وظیفه با میمو پرو تنها حدود سیزدهسنت است؛ در مقابل، مدلهای بسته غربی معمولاً بین سه تا هشت دلار برای همان وظیفه هزینه میگیرند. از آنجا که هر دو مدل با مجوز آزاد منتشر شدهاند، شرکتها میتوانند آنها را روی سرورهای خودشان هم اجرا کنند و حتی هزینهای به شیائومی پرداخت نکنند.
برای کسبوکارهایی که به دنبال کاهش هزینه ابزارهای هوش مصنوعی خود هستند، خواندن این راهنما درباره اهمیت هوش مصنوعی در کسبوکار خالی از لطف نیست.
۷. شش روز آموزش فشرده و شفافیتی غیرمعمول
یکی از جالبترین بخشهای این خبر، شیوه آموزش این مدلهاست. طبق گزارشها، تیم میمو حدود دو میلیون و ششصد و بیست هزار دلار برای آموزش نسخه پرو و حدود هشتصد و پنجاه هزار دلار برای نسخه فلش هزینه کرده و کل فرآیند یادگیری تقویتی را روی هفتصد و پنجاه هزار مسیر تصمیمگیری، در کمتر از شش روز انجام داده است. فولی لو، سرپرست تیم میمو و پژوهشگر پیشین دیپسیک، گفته است در دورانی که قدرت پردازشی بهشدت کمیاب است، آنها ترجیح دادند چند ده مهندس را برای مدت طولانی روی یک هدف واحد متمرکز کنند: مقیاسدادن یادگیری تقویتی.
نکته جالب دیگر این است که شیائومی یک داشبورد زنده از روند آموزش منتشر کرد و حتی شکستها و دادههای حذفشده بهخاطر افت کیفیت را هم علنی اعلام کرد؛ سطحی از شفافیت که کمتر در پروژههای بزرگ هوش مصنوعی دیده میشود. این نوع رویکرد یادآور تفاوت میان تیمهای کوچک و مستقل با آزمایشگاههای غولپیکر است؛ موضوعی که در این مطلب درباره توهم توسعهدهنده تنها در برابر مهندس واقعی هم بررسی شده است.

۸. این خبر چه معنایی برای کاربران و کسبوکارهای ایرانی دارد؟
برای بسیاری از توسعهدهندگان ایرانی که بهخاطر محدودیتهای پرداخت یا تحریم، دسترسی راحتی به مدلهای بسته آمریکایی ندارند، وجود یک مدل قدرتمند، رایگان و متنباز مثل میمو ۲.۶ فرصت بزرگی است. میتوان این مدل را روی سرورهای داخلی یا سرویسهای ابری در دسترس اجرا کرد و بدون نیاز به کارت بینالمللی، از قابلیتهایی نزدیک به کلود و جیپیتی بهره برد. البته برای استفاده مؤثر از چنین مدلهایی، دانستن اصول درست پرامپتنویسی همچنان ضروری است؛ در این آموزش ساده پرامپتنویسی میتوانید این اصول را یاد بگیرید.
برای کسانی که میخواهند مهارت کار با ابزارهایی مثل چتجیپیتی را هم تقویت کنند، مجموعه آموزشهای چتجیپیتی در سایت ما نقطه شروع خوبی است، و برای دنبال کردن ادامه این رقابت نفسگیر بین شرکتهای چینی و آمریکایی، صفحه اخبار هوش مصنوعی همیشه بهروز میشود.
پرسشهای متداول
آیا میمو ۲.۶ واقعاً رایگان است؟ بله، هر دو مدل با مجوز آزاد تجاری منتشر شدهاند و میتوان آنها را رایگان دانلود و حتی در پروژههای تجاری استفاده کرد.
آیا میمو ۲.۶ از کلود یا جیپیتی بهتر است؟ در برخی آزمونهای عامل هوشمند و اجرای وظایف عملی، بله؛ اما در سختترین آزمونهای برنامهنویسی و امنیتی، کلود اوپوس ۵ همچنان جلوتر است.
هزینه استفاده از این مدل چقدر است؟ بسته به نسخه، هر میلیون توکن بین چهارده تا هشتادوهفت سنت هزینه دارد که بهمراتب ارزانتر از مدلهای بسته غربی است.
چه کسانی میتوانند از میمو ۲.۶ استفاده کنند؟ چون متنباز است، هر توسعهدهنده، استارتاپ یا شرکتی در هر نقطه از جهان، از جمله ایران، میتواند آن را روی زیرساخت خودش اجرا کند.
چه سختافزاری برای اجرای این مدل لازم است؟ نسخه پرو بهخاطر حجم بالا معمولاً روی چند کارت گرافیک قدرتمند یا سرویسهای ابری تخصصی اجرا میشود، اما نسخه فلش با حجم کوچکتر، برای بسیاری از تیمهای کوچکتر هم قابل اجراست.
آیا این مدل به فارسی هم پاسخ میدهد؟ مدلهای چندزبانه بزرگ مثل میمو معمولاً از زبان فارسی هم پشتیبانی میکنند، هرچند کیفیت آن ممکن است بهاندازه انگلیسی یا چینی نباشد؛ بهترین راه، آزمایش مستقیم مدل با یک پرامپت فارسی ساده است.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
