پوستر خبری معرفی مدل هوش مصنوعی جمنای ۳.۷ فلش گوگل

جمنای ۳.۷ فلش گوگل با تخفیف ۵۰ درصدی رونمایی شد؛ ادعای پیشی گرفتن از کلود

اخبار · هوش مصنوعی

گوگل با عرضه‌ی جمنای ۳.۷ فلش، تنها سه هفته پس از نسخه‌ی قبلی، بار دیگر معادلات بازار مدل‌های زبانی را به هم زد؛ مدلی ارزان‌تر که مدعی است در وظایف تجاری از کلود و جی‌پی‌تی هم جلو زده است.

چکیده. شرکت گوگل روز پنج‌شنبه، سیزدهم اوت ۲۰۲۶، مدل جمنای ۳.۷ فلش را معرفی کرد؛ مدلی که برای کدنویسی، تحلیل اسناد و اجرای ایجنت‌های خودکار بهینه شده و تا پایان امسال با ۵۰ درصد تخفیف عرضه می‌شود. گوگل با استناد به آزمون تجاری AutomationBench مدعی شده این مدل از کلود Sonnet 5 و جی‌پی‌تی ۵.۶ ترا پیشی گرفته، هرچند در آزمون‌های استدلال پیچیده و کار با رابط گرافیکی همچنان عقب‌تر است. در ادامه، تمام جزئیات فنی، قیمت‌گذاری، بنچمارک‌ها و پیامدهای این عرضه را بررسی می‌کنیم.

پوستر خبری معرفی مدل هوش مصنوعی جمنای ۳.۷ فلش گوگل

۱. جمنای ۳.۷ فلش چیست و چرا این‌قدر زود عرضه شد؟

تیم جمنای در گوگل دیپ‌مایند طی یک سال گذشته سرعت انتشار مدل‌های رده‌ی فلش را به‌شدت بالا برده است. جمنای ۳.۷ فلش دقیقاً سه هفته پس از جمنای ۳.۶ فلش منتشر شده، در حالی که مدل سنگین‌تر و پیشرفته‌تر خانواده یعنی جمنای ۳.۵ پرو همچنان تاخیر دارد و تاریخ دقیقی برای عرضه‌اش اعلام نشده است.

به گفته‌ی گوگل، این مدل تازه نه یک آموزش کاملاً از صفر، بلکه پالایش و بهینه‌سازی الگوریتمی همان جمنای ۳.۶ فلش است. همین رویکرد باعث شده گوگل بتواند در بازه‌ی زمانی کوتاه، بهبودهای محسوسی در کدنویسی و تحلیل اسناد ارائه دهد بدون آنکه هزینه‌ی آموزش یک مدل کاملاً جدید را متحمل شود.

برای آشنایی بیشتر با اینکه اصلاً هوش مصنوعی و مدل‌های زبانی چطور کار می‌کنند و چه محدودیت‌هایی دارند، می‌توانید این مقاله درباره‌ی توانایی‌ها و محدودیت‌های واقعی هوش مصنوعی را بخوانید.

۲. مشخصات فنی؛ پنجره‌ی زمینه‌ی یک میلیون توکنی

جمنای ۳.۷ فلش با پنجره‌ی زمینه‌ی یک میلیون توکن عرضه شده و می‌تواند تا شصت‌وچهار هزار توکن خروجی تولید کند. این مدل چندوجهی است و متن، تصویر، صدا و ویدیو را همزمان می‌پذیرد؛ ویژگی‌ای که آن را برای ساخت ایجنت‌های چندمنظوره جذاب می‌کند.

تاریخ دانش این مدل تا مارس ۲۰۲۶ به‌روز است. در آزمون بازیابی اطلاعات از متن‌های طولانی، جمنای ۳.۷ فلش در بازه‌ی صد و بیست‌وهشت هزار توکنی به دقت نود‌وهفت درصد رسیده که نشان می‌دهد در کار با اسناد حجیم عملکرد قابل‌اعتمادی دارد.

اگر می‌خواهید بدانید چطور می‌شود از چنین مدل‌هایی با پرامپت‌های حرفه‌ای و دقیق بهترین خروجی را گرفت، سری به آموزش نوشتن پرامپت برای مبتدیان بزنید.

پشتیبانی از ایجنت‌های خودکار و طولانی‌مدت

یکی از هدف‌های اصلی گوگل از این عرضه، تقویت زیرساخت ایجنت‌های خودکاری بوده که باید ساعت‌ها بدون دخالت انسان کار کنند. به همین دلیل، بخش بزرگی از بهبودها روی پایداری مدل در وظایف چندمرحله‌ای و زنجیره‌های طولانی تصمیم‌گیری متمرکز شده است.

مقایسه قیمت مدل جمنای ۳.۷ فلش گوگل با کلود و جی‌پی‌تی

۳. قیمت‌گذاری تهاجمی؛ نصف‌بها تا پایان سال ۲۰۲۶

شاید مهم‌ترین بخش این اعلامیه، سیاست قیمت‌گذاری گوگل باشد. تا پایان دسامبر ۲۰۲۶، هر یک میلیون توکن ورودی تنها ۰.۷۵ دلار و هر یک میلیون توکن خروجی ۳.۷۵ دلار هزینه دارد. این یعنی دقیقاً نصف قیمت استانداردی که از اول ژانویه‌ی ۲۰۲۷ اعمال خواهد شد و به ۱.۵ دلار برای ورودی و ۷.۵ دلار برای خروجی می‌رسد.

با احتساب نسبت معمول هشتاد به بیست بین توکن‌های ورودی و خروجی، هزینه‌ی ترکیبی استفاده از این مدل حدود ۱.۳۵ دلار به ازای هر یک میلیون توکن برآورد می‌شود؛ رقمی که آن را به یکی از مقرون‌به‌صرفه‌ترین گزینه‌ها در رده‌ی مدل‌های سریع تبدیل کرده است.

چنین قیمت‌گذاری تهاجمی‌ای معمولاً پیام روشنی برای رقبا دارد: گوگل می‌خواهد سهم بیشتری از بازار استقرار انبوه ایجنت‌های سازمانی را در اختیار بگیرد، جایی که هزینه‌ی هر درخواست برای شرکت‌ها اهمیت مستقیم دارد. برای درک بهتر اینکه چرا هوش مصنوعی برای کسب‌وکارها این‌قدر مهم شده، می‌توانید این تحلیل درباره‌ی اهمیت هوش مصنوعی در کسب‌وکار را دنبال کنید.

۴. ادعای برتری بر کلود در آزمون تجاری AutomationBench

گوگل برای اثبات کارایی مدل تازه‌اش، نتایج آزمونی به نام AutomationBench را منتشر کرده؛ آزمونی که توسط شرکت زاپیر و برای سنجش عملکرد مدل‌ها در گردش‌کارهای واقعی کسب‌وکار طراحی شده است. طبق این آزمون، جمنای ۳.۷ فلش با نمره‌ی ۳۰.۴ درصد، از کلود Sonnet 5 شرکت انتروپیک با نمره‌ی تنها ۱۰.۷ درصد و همچنین جی‌پی‌تی ۵.۶ ترای اوپن‌ای‌آی با نمره‌ی ۲۳.۶ درصد پیشی گرفته است.

نکته‌ی قابل‌توجه اینجاست که این نمره نسبت به نسخه‌ی قبلی، یعنی جمنای ۳.۶ فلش که تنها هفده درصد در همین آزمون کسب کرده بود، جهشی چشمگیر محسوب می‌شود. با این حال باید به یاد داشت که AutomationBench را خود زاپیر طراحی کرده و این شرکت منافع تجاری مستقیمی در ترویج اتوماسیون گردش‌کار دارد؛ موضوعی که برخی تحلیلگران را نسبت به بی‌طرفی کامل این آزمون محتاط کرده است.

برای مقایسه‌ی دقیق‌تر روش‌های سنجش مدل‌های مختلف هوش مصنوعی و نحوه‌ی رقابت آن‌ها در آزمون‌های تخصصی، پیشنهاد می‌کنیم نگاهی به مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک در نبرد شطرنج بیندازید.

۵. نقاط ضعف؛ جایی که کلود و جی‌پی‌تی هنوز جلوترند

داستان این عرضه یک‌طرفه نیست. در آزمونی به نام Agent’s Last Exam که استدلال پیچیده و چندمرحله‌ای را می‌سنجد، کلود Sonnet 5 با نمره‌ی ۳۳.۳ درصد همچنان از جمنای ۳.۷ فلش با نمره‌ی ۲۶.۳ درصد جلوتر است. این تفاوت نشان می‌دهد که در وظایف نیازمند تفکر عمیق و چندلایه، مدل انتروپیک هنوز برتری دارد.

در آزمون OSWorld-2.0 که توانایی مدل در کار با رابط گرافیکی کامپیوتر را می‌سنجد، جی‌پی‌تی ۵.۶ ترا با نمره‌ی ۵۰.۲ درصد به‌وضوح از جمنای ۳.۷ فلش با نمره‌ی ۳۸.۱ درصد بهتر عمل کرده است. به بیان دیگر، گوگل در وظایف مبتنی بر گردش‌کار متنی و کدنویسی قوی ظاهر شده، اما در کنترل مستقیم رابط کاربری هنوز جای پیشرفت دارد.

این الگو، یعنی برتری در یک دسته از آزمون‌ها و عقب‌ماندگی در دسته‌ای دیگر، این روزها در میان مدل‌های پیشرو بسیار رایج شده و نشان می‌دهد هیچ مدلی به‌طور کامل بر رقبا برتری ندارد.

۶. مقایسه با جمنای ۳.۶ فلش؛ رشد محسوس در کدنویسی

وقتی نمرات جمنای ۳.۷ فلش را با نسخه‌ی قبلی مقایسه می‌کنیم، رشد قابل‌توجهی دیده می‌شود. در آزمون کدنویسی FrontierCode 1.1، نمره از ۳۴.۴ درصد به ۴۳.۶ درصد رسیده است. در آزمون مهندسی نرم‌افزار DeepSWE هم امتیاز به ۶۵.۳ درصد افزایش یافته است.

در تحلیل اسناد پیچیده با آزمون GDP.pdf، نمره از بیست‌ودو درصد به سی‌وچهار درصد رسیده و در رتبه‌بندی WebDev Arena نیز این مدل امتیاز ۱۵۸۸ الو را ثبت کرده است. شاخص کلی هوش مصنوعی آرتیفیشیال آنالیسیس هم برای این مدل به عدد پنجاه‌وشش رسیده که نسبت به پنجاه‌ودو در نسخه‌ی قبلی، رشدی ثابت اما نه انقلابی را نشان می‌دهد.

کسانی که به شکل حرفه‌ای با ابزارهای هوش مصنوعی کار می‌کنند خوب می‌دانند که تفاوت بین یک توسعه‌دهنده‌ی واقعی و کسی که صرفاً از خروجی مدل استفاده می‌کند کجاست؛ موضوعی که در این مطلب درباره‌ی توهم هوش مصنوعی در برابر مهندسی واقعی به‌خوبی باز شده است.

۷. کاربرد عملی در ایجنت‌های خودکار و توسعه‌ی نرم‌افزار

گوگل جمنای ۳.۷ فلش را مشخصاً برای تیم‌های توسعه‌ای که به دنبال ساخت ایجنت‌های کدنویس، دستیارهای خودکار پشتیبانی و ابزارهای پردازش انبوه اسناد هستند بازاریابی می‌کند. ترکیب قیمت پایین، پنجره‌ی زمینه‌ی بزرگ و بهبود در کدنویسی، این مدل را برای استقرار در مقیاس وسیع جذاب کرده است.

شرکت‌هایی که پیش‌تر به دلیل هزینه‌ی بالای مدل‌های پیشرفته از خودکارسازی گسترده صرف‌نظر می‌کردند، حالا می‌توانند با هزینه‌ای بسیار کمتر، همان سطح از قابلیت‌ها را در دسترس داشته باشند. برای دیدن نمونه‌های عملی و آموزش‌های کاربردی درباره‌ی استفاده از ابزارهای هوش مصنوعی در کارهای روزمره، بخش آموزش‌های چت‌جی‌پی‌تی در سایت ما منبع خوبی است.

۸. تأثیر این عرضه بر رقابت بازار هوش مصنوعی

عرضه‌ی جمنای ۳.۷ فلش را می‌توان نشانه‌ای از آغاز یک دور تازه از جنگ قیمتی میان غول‌های هوش مصنوعی دانست. گوگل، اوپن‌ای‌آی و انتروپیک هرکدام در چند ماه اخیر تلاش کرده‌اند با ترکیبی از کاهش قیمت و بهبود عملکرد، سهم بیشتری از بازار سازمانی به دست بیاورند.

این رقابت برای کاربران نهایی و توسعه‌دهندگان خبر خوبی است، چون هزینه‌ی ساخت محصولات مبتنی بر هوش مصنوعی روزبه‌روز پایین‌تر می‌آید. برای پیگیری کامل و به‌روز اخبار مربوط به شرکت‌های بزرگ هوش مصنوعی از جمله گوگل، اوپن‌ای‌آی و انتروپیک، صفحه‌ی اخبار هوش مصنوعی سایت ما را دنبال کنید و برای آشنایی بیشتر با شرکت پشت چت‌جی‌پی‌تی هم می‌توانید این معرفی کامل از اوپن‌ای‌آی را بخوانید.

واکنش نخستین توسعه‌دهندگان و شرکت‌های فناوری به این عرضه هم عمدتاً مثبت بوده است؛ بسیاری از تیم‌های محصول اعلام کرده‌اند که ترکیب قیمت پایین با پنجره‌ی زمینه‌ی بزرگ، آن‌ها را ترغیب می‌کند تا آزمایش‌های خودکارسازی گسترده‌تری را در محیط تولید اجرا کنند. البته برخی تحلیلگران هشدار داده‌اند که تکیه‌ی صرف به بنچمارک‌های اختصاصی مثل AutomationBench می‌تواند تصویری یک‌سویه از توانایی واقعی مدل ارائه دهد و توصیه می‌کنند تیم‌های فنی پیش از تصمیم‌گیری نهایی، آزمون‌های داخلی خودشان را هم اجرا کنند.

از منظر کسب‌وکار کوچک و متوسط هم این روند اهمیت دارد؛ کاهش هزینه‌ی هر درخواست یعنی امکان اجرای ایجنت‌های پشتیبانی، تحلیل داده و اتوماسیون ایمیل بدون نگرانی از صورت‌حساب سنگین ماهانه. به همین دلیل، انتظار می‌رود در هفته‌های آینده شاهد رشد چشمگیر استفاده از این مدل در ابزارهای سازمانی کوچک باشیم.

۹. سوالات متداول

جمنای ۳.۷ فلش دقیقاً چه زمانی عرضه شد؟
گوگل این مدل را در سیزدهم اوت ۲۰۲۶، یعنی تنها سه هفته پس از جمنای ۳.۶ فلش، رسماً معرفی کرد.

قیمت جمنای ۳.۷ فلش چقدر است؟
تا پایان سال ۲۰۲۶، هر یک میلیون توکن ورودی ۰.۷۵ دلار و هر یک میلیون توکن خروجی ۳.۷۵ دلار هزینه دارد؛ از سال ۲۰۲۷ این قیمت‌ها دو برابر خواهد شد.

آیا جمنای ۳.۷ فلش واقعاً از کلود بهتر است؟
در آزمون تجاری AutomationBench بله، اما در آزمون‌های استدلال پیچیده و کار با رابط گرافیکی، کلود و جی‌پی‌تی همچنان عملکرد بهتری دارند؛ برتری کاملاً به نوع وظیفه بستگی دارد.

پنجره‌ی زمینه‌ی این مدل چقدر است؟
جمنای ۳.۷ فلش تا یک میلیون توکن زمینه و شصت‌وچهار هزار توکن خروجی را پشتیبانی می‌کند.

جمع‌بندی. جمنای ۳.۷ فلش نشان می‌دهد گوگل در مسیر تصاحب بازار مدل‌های اقتصادی و کارآمد جدی است؛ مدلی ارزان‌تر که در وظایف تجاری قوی ظاهر شده، هرچند هنوز در استدلال پیچیده و کنترل رابط گرافیکی جای رشد دارد. رقابت میان گوگل، اوپن‌ای‌آی و انتروپیک هر روز داغ‌تر می‌شود و این یعنی خبر خوب برای کاربران و توسعه‌دهندگان. برای دنبال‌کردن هر خبر تازه در همین لحظه، به کانال @MrChatGPT_IR بپیوندید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *