گوگل با عرضهی جمنای ۳.۷ فلش، تنها سه هفته پس از نسخهی قبلی، بار دیگر معادلات بازار مدلهای زبانی را به هم زد؛ مدلی ارزانتر که مدعی است در وظایف تجاری از کلود و جیپیتی هم جلو زده است.

لیست مطالب
۱. جمنای ۳.۷ فلش چیست و چرا اینقدر زود عرضه شد؟
تیم جمنای در گوگل دیپمایند طی یک سال گذشته سرعت انتشار مدلهای ردهی فلش را بهشدت بالا برده است. جمنای ۳.۷ فلش دقیقاً سه هفته پس از جمنای ۳.۶ فلش منتشر شده، در حالی که مدل سنگینتر و پیشرفتهتر خانواده یعنی جمنای ۳.۵ پرو همچنان تاخیر دارد و تاریخ دقیقی برای عرضهاش اعلام نشده است.
به گفتهی گوگل، این مدل تازه نه یک آموزش کاملاً از صفر، بلکه پالایش و بهینهسازی الگوریتمی همان جمنای ۳.۶ فلش است. همین رویکرد باعث شده گوگل بتواند در بازهی زمانی کوتاه، بهبودهای محسوسی در کدنویسی و تحلیل اسناد ارائه دهد بدون آنکه هزینهی آموزش یک مدل کاملاً جدید را متحمل شود.
برای آشنایی بیشتر با اینکه اصلاً هوش مصنوعی و مدلهای زبانی چطور کار میکنند و چه محدودیتهایی دارند، میتوانید این مقاله دربارهی تواناییها و محدودیتهای واقعی هوش مصنوعی را بخوانید.
۲. مشخصات فنی؛ پنجرهی زمینهی یک میلیون توکنی
جمنای ۳.۷ فلش با پنجرهی زمینهی یک میلیون توکن عرضه شده و میتواند تا شصتوچهار هزار توکن خروجی تولید کند. این مدل چندوجهی است و متن، تصویر، صدا و ویدیو را همزمان میپذیرد؛ ویژگیای که آن را برای ساخت ایجنتهای چندمنظوره جذاب میکند.
تاریخ دانش این مدل تا مارس ۲۰۲۶ بهروز است. در آزمون بازیابی اطلاعات از متنهای طولانی، جمنای ۳.۷ فلش در بازهی صد و بیستوهشت هزار توکنی به دقت نودوهفت درصد رسیده که نشان میدهد در کار با اسناد حجیم عملکرد قابلاعتمادی دارد.
اگر میخواهید بدانید چطور میشود از چنین مدلهایی با پرامپتهای حرفهای و دقیق بهترین خروجی را گرفت، سری به آموزش نوشتن پرامپت برای مبتدیان بزنید.
پشتیبانی از ایجنتهای خودکار و طولانیمدت
یکی از هدفهای اصلی گوگل از این عرضه، تقویت زیرساخت ایجنتهای خودکاری بوده که باید ساعتها بدون دخالت انسان کار کنند. به همین دلیل، بخش بزرگی از بهبودها روی پایداری مدل در وظایف چندمرحلهای و زنجیرههای طولانی تصمیمگیری متمرکز شده است.

۳. قیمتگذاری تهاجمی؛ نصفبها تا پایان سال ۲۰۲۶
شاید مهمترین بخش این اعلامیه، سیاست قیمتگذاری گوگل باشد. تا پایان دسامبر ۲۰۲۶، هر یک میلیون توکن ورودی تنها ۰.۷۵ دلار و هر یک میلیون توکن خروجی ۳.۷۵ دلار هزینه دارد. این یعنی دقیقاً نصف قیمت استانداردی که از اول ژانویهی ۲۰۲۷ اعمال خواهد شد و به ۱.۵ دلار برای ورودی و ۷.۵ دلار برای خروجی میرسد.
با احتساب نسبت معمول هشتاد به بیست بین توکنهای ورودی و خروجی، هزینهی ترکیبی استفاده از این مدل حدود ۱.۳۵ دلار به ازای هر یک میلیون توکن برآورد میشود؛ رقمی که آن را به یکی از مقرونبهصرفهترین گزینهها در ردهی مدلهای سریع تبدیل کرده است.
چنین قیمتگذاری تهاجمیای معمولاً پیام روشنی برای رقبا دارد: گوگل میخواهد سهم بیشتری از بازار استقرار انبوه ایجنتهای سازمانی را در اختیار بگیرد، جایی که هزینهی هر درخواست برای شرکتها اهمیت مستقیم دارد. برای درک بهتر اینکه چرا هوش مصنوعی برای کسبوکارها اینقدر مهم شده، میتوانید این تحلیل دربارهی اهمیت هوش مصنوعی در کسبوکار را دنبال کنید.
۴. ادعای برتری بر کلود در آزمون تجاری AutomationBench
گوگل برای اثبات کارایی مدل تازهاش، نتایج آزمونی به نام AutomationBench را منتشر کرده؛ آزمونی که توسط شرکت زاپیر و برای سنجش عملکرد مدلها در گردشکارهای واقعی کسبوکار طراحی شده است. طبق این آزمون، جمنای ۳.۷ فلش با نمرهی ۳۰.۴ درصد، از کلود Sonnet 5 شرکت انتروپیک با نمرهی تنها ۱۰.۷ درصد و همچنین جیپیتی ۵.۶ ترای اوپنایآی با نمرهی ۲۳.۶ درصد پیشی گرفته است.
نکتهی قابلتوجه اینجاست که این نمره نسبت به نسخهی قبلی، یعنی جمنای ۳.۶ فلش که تنها هفده درصد در همین آزمون کسب کرده بود، جهشی چشمگیر محسوب میشود. با این حال باید به یاد داشت که AutomationBench را خود زاپیر طراحی کرده و این شرکت منافع تجاری مستقیمی در ترویج اتوماسیون گردشکار دارد؛ موضوعی که برخی تحلیلگران را نسبت به بیطرفی کامل این آزمون محتاط کرده است.
برای مقایسهی دقیقتر روشهای سنجش مدلهای مختلف هوش مصنوعی و نحوهی رقابت آنها در آزمونهای تخصصی، پیشنهاد میکنیم نگاهی به مقایسهی چتجیپیتی و دیپسیک در نبرد شطرنج بیندازید.
۵. نقاط ضعف؛ جایی که کلود و جیپیتی هنوز جلوترند
داستان این عرضه یکطرفه نیست. در آزمونی به نام Agent’s Last Exam که استدلال پیچیده و چندمرحلهای را میسنجد، کلود Sonnet 5 با نمرهی ۳۳.۳ درصد همچنان از جمنای ۳.۷ فلش با نمرهی ۲۶.۳ درصد جلوتر است. این تفاوت نشان میدهد که در وظایف نیازمند تفکر عمیق و چندلایه، مدل انتروپیک هنوز برتری دارد.
در آزمون OSWorld-2.0 که توانایی مدل در کار با رابط گرافیکی کامپیوتر را میسنجد، جیپیتی ۵.۶ ترا با نمرهی ۵۰.۲ درصد بهوضوح از جمنای ۳.۷ فلش با نمرهی ۳۸.۱ درصد بهتر عمل کرده است. به بیان دیگر، گوگل در وظایف مبتنی بر گردشکار متنی و کدنویسی قوی ظاهر شده، اما در کنترل مستقیم رابط کاربری هنوز جای پیشرفت دارد.
این الگو، یعنی برتری در یک دسته از آزمونها و عقبماندگی در دستهای دیگر، این روزها در میان مدلهای پیشرو بسیار رایج شده و نشان میدهد هیچ مدلی بهطور کامل بر رقبا برتری ندارد.
۶. مقایسه با جمنای ۳.۶ فلش؛ رشد محسوس در کدنویسی
وقتی نمرات جمنای ۳.۷ فلش را با نسخهی قبلی مقایسه میکنیم، رشد قابلتوجهی دیده میشود. در آزمون کدنویسی FrontierCode 1.1، نمره از ۳۴.۴ درصد به ۴۳.۶ درصد رسیده است. در آزمون مهندسی نرمافزار DeepSWE هم امتیاز به ۶۵.۳ درصد افزایش یافته است.
در تحلیل اسناد پیچیده با آزمون GDP.pdf، نمره از بیستودو درصد به سیوچهار درصد رسیده و در رتبهبندی WebDev Arena نیز این مدل امتیاز ۱۵۸۸ الو را ثبت کرده است. شاخص کلی هوش مصنوعی آرتیفیشیال آنالیسیس هم برای این مدل به عدد پنجاهوشش رسیده که نسبت به پنجاهودو در نسخهی قبلی، رشدی ثابت اما نه انقلابی را نشان میدهد.
کسانی که به شکل حرفهای با ابزارهای هوش مصنوعی کار میکنند خوب میدانند که تفاوت بین یک توسعهدهندهی واقعی و کسی که صرفاً از خروجی مدل استفاده میکند کجاست؛ موضوعی که در این مطلب دربارهی توهم هوش مصنوعی در برابر مهندسی واقعی بهخوبی باز شده است.
۷. کاربرد عملی در ایجنتهای خودکار و توسعهی نرمافزار
گوگل جمنای ۳.۷ فلش را مشخصاً برای تیمهای توسعهای که به دنبال ساخت ایجنتهای کدنویس، دستیارهای خودکار پشتیبانی و ابزارهای پردازش انبوه اسناد هستند بازاریابی میکند. ترکیب قیمت پایین، پنجرهی زمینهی بزرگ و بهبود در کدنویسی، این مدل را برای استقرار در مقیاس وسیع جذاب کرده است.
شرکتهایی که پیشتر به دلیل هزینهی بالای مدلهای پیشرفته از خودکارسازی گسترده صرفنظر میکردند، حالا میتوانند با هزینهای بسیار کمتر، همان سطح از قابلیتها را در دسترس داشته باشند. برای دیدن نمونههای عملی و آموزشهای کاربردی دربارهی استفاده از ابزارهای هوش مصنوعی در کارهای روزمره، بخش آموزشهای چتجیپیتی در سایت ما منبع خوبی است.
۸. تأثیر این عرضه بر رقابت بازار هوش مصنوعی
عرضهی جمنای ۳.۷ فلش را میتوان نشانهای از آغاز یک دور تازه از جنگ قیمتی میان غولهای هوش مصنوعی دانست. گوگل، اوپنایآی و انتروپیک هرکدام در چند ماه اخیر تلاش کردهاند با ترکیبی از کاهش قیمت و بهبود عملکرد، سهم بیشتری از بازار سازمانی به دست بیاورند.
این رقابت برای کاربران نهایی و توسعهدهندگان خبر خوبی است، چون هزینهی ساخت محصولات مبتنی بر هوش مصنوعی روزبهروز پایینتر میآید. برای پیگیری کامل و بهروز اخبار مربوط به شرکتهای بزرگ هوش مصنوعی از جمله گوگل، اوپنایآی و انتروپیک، صفحهی اخبار هوش مصنوعی سایت ما را دنبال کنید و برای آشنایی بیشتر با شرکت پشت چتجیپیتی هم میتوانید این معرفی کامل از اوپنایآی را بخوانید.
واکنش نخستین توسعهدهندگان و شرکتهای فناوری به این عرضه هم عمدتاً مثبت بوده است؛ بسیاری از تیمهای محصول اعلام کردهاند که ترکیب قیمت پایین با پنجرهی زمینهی بزرگ، آنها را ترغیب میکند تا آزمایشهای خودکارسازی گستردهتری را در محیط تولید اجرا کنند. البته برخی تحلیلگران هشدار دادهاند که تکیهی صرف به بنچمارکهای اختصاصی مثل AutomationBench میتواند تصویری یکسویه از توانایی واقعی مدل ارائه دهد و توصیه میکنند تیمهای فنی پیش از تصمیمگیری نهایی، آزمونهای داخلی خودشان را هم اجرا کنند.
از منظر کسبوکار کوچک و متوسط هم این روند اهمیت دارد؛ کاهش هزینهی هر درخواست یعنی امکان اجرای ایجنتهای پشتیبانی، تحلیل داده و اتوماسیون ایمیل بدون نگرانی از صورتحساب سنگین ماهانه. به همین دلیل، انتظار میرود در هفتههای آینده شاهد رشد چشمگیر استفاده از این مدل در ابزارهای سازمانی کوچک باشیم.
۹. سوالات متداول
جمنای ۳.۷ فلش دقیقاً چه زمانی عرضه شد؟
گوگل این مدل را در سیزدهم اوت ۲۰۲۶، یعنی تنها سه هفته پس از جمنای ۳.۶ فلش، رسماً معرفی کرد.
قیمت جمنای ۳.۷ فلش چقدر است؟
تا پایان سال ۲۰۲۶، هر یک میلیون توکن ورودی ۰.۷۵ دلار و هر یک میلیون توکن خروجی ۳.۷۵ دلار هزینه دارد؛ از سال ۲۰۲۷ این قیمتها دو برابر خواهد شد.
آیا جمنای ۳.۷ فلش واقعاً از کلود بهتر است؟
در آزمون تجاری AutomationBench بله، اما در آزمونهای استدلال پیچیده و کار با رابط گرافیکی، کلود و جیپیتی همچنان عملکرد بهتری دارند؛ برتری کاملاً به نوع وظیفه بستگی دارد.
پنجرهی زمینهی این مدل چقدر است؟
جمنای ۳.۷ فلش تا یک میلیون توکن زمینه و شصتوچهار هزار توکن خروجی را پشتیبانی میکند.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
