گوگل مدل تازهاش، جمینای ۴ آرگون، را با جدولی از رکوردهای بنچمارک رونمایی کرد؛ اما همین روزها گزارشی از درون شرکت میگوید تجربهی واقعی کارمندان با آن ارقام درخشان همخوانی ندارد.

لیست مطالب
۱. رونمایی از آرگون؛ تازهترین سلاح گوگل در جنگ مدلهای بزرگ
شرکت گوگل این هفته از جمینای ۴ آرگون رونمایی کرد؛ مدلی که به گفتهی خود شرکت برای کارهای سازمانی سنگین مثل برنامهنویسی، تحلیل حقوقی و عملیات امنیت سایبری طراحی شده است. آرگون در میان مدلهای بزرگ این روزها از جهتی چشمگیر است: ظرفیت خروجی آن به یک میلیون توکن رسیده، در برابر محدودیت ۶۴ هزار توکنی نسل قبلی. این یعنی مدل میتواند در یک پاسخ، حجم بسیار بیشتری از کد یا متن تولید کند بدون آنکه میان راه قطع شود.
برای کسانی که اخبار رقابت مدلهای هوش مصنوعی را دنبال میکنند، این رونمایی ادامهی همان مسابقهای است که در نبرد میان ابزارهای هوش مصنوعی بار و بار دیدهایم؛ هر شرکت یک جدول بنچمارک رونمایی میکند و خودش را برندهی دور تازه میخواند. بخش اخبار روز هوش مصنوعی سایت ما هم پر از همین رقابتهای پیدرپی است.
۲. چه رکوردهایی آرگون ادعا میکند؟
طبق جدول رسمی منتشرشده، جمینای ۴ آرگون در ۱۳ از ۱۸ بنچمارک افشاشده، صدرنشین یا همرتبهی صدر است. در بنچمارک تحلیل حقوقی شرکت هاروی، نمرهی آرگون ۱۹.۶ درصد است در برابر بازهی ۳.۸ تا ۵.۴ درصدی رقبا؛ یعنی فاصلهای قابلتوجه. در اتوماسیون کسبوکار به ۵۱.۳ درصد رسیده، در استدلال با متنهای طولانی به ۸۴.۲ درصد، در حوزهی مالی به ۶۵.۴ درصد و در مهندسی نرمافزار به ۷۷.۹ درصد. مثالهای داخلی گوگل هم شامل بهینهسازی وظایف محاسبات کوانتومی و شناسایی بیش از ۳۰۰ ترابایت صرفهجویی حافظه در یک پروژهی مهاجرت کد به زبان راست بوده است.
چنین ارقامی طبیعتاً سروصدا به پا میکند، چون مستقیماً با وعدههای تجاری گره خوردهاند. کسبوکارهایی که دنبال توجیه هزینهی هوش مصنوعی هستند، دقیقاً همین نوع آمار را میخوانند تا تصمیم بگیرند؛ موضوعی که در یادداشت ما دربارهی اهمیت هوش مصنوعی برای کسبوکارها هم به آن پرداختهایم.
۳. اما یک گزارش ماجرا را پیچیده کرد
همین چند روز پس از رونمایی، بلومبرگ گزارشی منتشر کرد که میگفت چند کارمند گوگل، بهصورت ناشناس، از عملکرد واقعی آرگون در کارهای روزمره گله کردهاند. به نقل از این افراد، مدل روی بنچمارکهای رسمی خوب عمل میکند اما وقتی کارمندان آن را برای وظایف واقعی کدنویسی به کار میبرند، نتیجه «به همان اندازه دلچسب نیست». یکی از ایرادهای تکرارشده، ضعف آرگون در طراحی فرانتاند بوده است؛ یعنی دقیقاً همان کاری که خیلی از توسعهدهندگان هر روز با کمک هوش مصنوعی انجام میدهند.
بخشی از منتقدان داخلی حتی واژهی «بنچمارکسازی» را به کار بردهاند؛ اصطلاحی که این روزها در صنعت هوش مصنوعی باب شده و به معنای بهینهسازی یک مدل صرفاً برای درخشیدن در آزمونهای استاندارد است، نه برای کارایی واقعی در دنیای بیرون. نگرانی دیگر هم به اندازهی مدل برمیگردد؛ به گفتهی منابع بلومبرگ، آرگون مدلی «بسیار بزرگ» است و همین موضوع میتواند هزینهی سروکارداشتن با آن را بالا ببرد.

۴. بنچمارکسازی دقیقاً چیست و چرا باید نگرانش بود؟
فاصلهی میان نمرهی بنچمارک و تجربهی واقعی کاربر، موضوع تازهای در دنیای هوش مصنوعی نیست. مدلی میتواند روی مجموعهدادههای استاندارد عالی عمل کند، اما همان مهارت وقتی با شرایط واقعی، دادههای کثیف و نیازهای غیرقابلپیشبینی کاربر روبهرو میشود، رنگ ببازد. در یادداشت مفصلتری که دربارهی تواناییها و محدودیتهای واقعی هوش مصنوعی نوشتهایم، دقیقاً به همین شکاف میان وعده و عملکرد پرداختهایم.
این بحث حتی ریشهای فلسفیتر هم دارد؛ تفاوت میان یک ابزار که بهظاهر همهکاره است و یک همکار واقعی که میتواند روی پروژهای پیچیده قابلاعتماد باشد. در تحلیلی که پیشتر منتشر کرده بودیم، همین مرز میان توسعهدهندهی تنها با کمک هوش مصنوعی و مهندس واقعی را بررسی کرده بودیم؛ و حالا همان بحث، اینبار دربارهی خودِ سازندهی مدل، یعنی گوگل، مطرح شده است.
۵. پاسخ گوگل به انتقادها
شرکت گوگل این توصیف از ضعف آرگون را «نادرست» خوانده است. کورای کاووکجواوغلو، یکی از مدیران ارشد فنی گوگل دیپمایند، گفته از عملکرد مدل «دلگرمکننده» است. یک کارمند ناشناس گوگل هم به بلومبرگ گفته درون شرکت «توافق گستردهای» وجود دارد که آرگون در خط مقدم فناوری قرار دارد و ادعای ضعف در کدنویسی واقعی را رد کرده است.
اما نکتهی جالب اینجاست که جدول رسمی خودِ گوگل هم تصویر یکدستی به دست نمیدهد. در بنچمارک FrontierSWE v2، آرگون نمرهی ۵۵.۰ درصد گرفته، در حالی که مدل جدید شرکت OpenAI یعنی جیپیتی-۶ Astra به ۶۵.۵ درصد رسیده؛ فاصلهای نزدیک به ۱۰.۵ واحد درصد. در آزمون Terminal-Bench هم آرگون با ۵۷.۶ تا ۵۷.۴ درصد، از Claude Opus 5.5 ساخت آنتروپیک که به ۶۶.۴ تا ۶۸.۱ درصد رسیده، عقبتر است. به بیان دیگر، همان دادههایی که گوگل منتشر کرده، تا حدی حرف منتقدان را هم تأیید میکند.
برتری در کجا و ضعف در کجا؟
جمعبندی ساده این است: آرگون در حوزههایی مثل تحلیل حقوقی، اتوماسیون کسبوکار، استدلال بر متن طولانی و امور مالی بهوضوح جلوتر است. اما در دو میدان مشخص، یعنی کدنویسی پیشرفتهی نرمافزاری و کارهای ترمینالی تخصصی، رقبایی مثل جیپیتی-۶ Astra و Claude Opus 5.5 همچنان دست بالا را دارند. در امنیت سایبری هم در آزمون CWE-bench با جیپیتی-۶ Astra همامتیاز شده، نه جلوتر.

۶. چرا فعلاً فقط چند نفر به آرگون دسترسی دارند؟
آرگون هنوز بهصورت عمومی منتشر نشده است. گوگل در گام نخست، دسترسی را از طریق برنامهای به نام Fairwind در اختیار «مدافعان امنیت سایبری» قرار داده و همزمان در برنامهی داوطلبانهی دولت آمریکا برای دسترسی پیش از انتشار هم شرکت کرده است. طبق اعلام گوگل، دسترسی گستردهتر برای مشتریان پولی رابط برنامهنویسی و مشترکان Google AI Ultra «بهزودی» فراهم میشود، بدون اعلام تاریخ دقیق.
همین محدودیت دسترسی، بخشی از دلیل داغشدن بحث بنچمارکسازی است؛ وقتی اکثر کاربران و حتی بسیاری از توسعهدهندگان هنوز نتوانستهاند مدل را روی پروژههای واقعی خودشان امتحان کنند، تنها منبع قضاوت همان جدول رسمی و همان چند روایت ضدونقیض داخلی باقی میماند.
۷. قیمتگذاری؛ شاید برگ برندهی واقعی گوگل
فارغ از بحث بنچمارک، قیمت آرگون واقعاً چشمگیر است. در دورهی معرفی، هر یک میلیون توکن ورودی ۲ دلار و هر یک میلیون توکن خروجی ۱۰ دلار قیمت دارد؛ پس از پایان دورهی تشویقی هم به ۴ و ۲۰ دلار میرسد. این رقم تقریباً یکپنجم قیمت جیپیتی-۶ Astra (۱۰ و ۵۰ دلار) و نیمی از Claude Opus 5.5 (۴ و ۲۰ دلار) است. برای شرکتهایی که حجم بالایی از درخواستها را پردازش میکنند، همین اختلاف قیمت میتواند مهمتر از چند واحد درصد تفاوت در یک بنچمارک علمی باشد.
اگر میخواهید وقتی دسترسی عمومی باز شد، بیشترین بازده را از چنین مدلهایی بگیرید، آشنایی با اصول نوشتن پرامپت خوب همچنان مهمترین مهارت است؛ موضوعی که در آموزش نوشتن پرامپت برای مبتدیان بهصورت کامل توضیح دادهایم.
۸. این ماجرا برای کاربران عادی و کسبوکارها چه معنایی دارد؟
برای کاربر عادی، این داستان یک درس ساده دارد: جدول بنچمارک هیچوقت نباید تنها معیار انتخاب یک مدل هوش مصنوعی باشد. برای کسبوکارهایی که میخواهند روی آرگون سرمایهگذاری کنند، منطقیترین راه، صبر برای دسترسی عمومی و تست مستقیم روی همان وظیفهای است که قرار است مدل انجامش دهد؛ نه تکیهکردن صرف بر جدول رسمی یک شرکت یا حتی گزارش منتقدانهی رسانهها. اگر تازه با مفهوم هوش مصنوعی مولد و بازیگران اصلی این بازار آشنا نیستید، دورهی مقدماتی ما دربارهی اوپنایآی و جایگاهش در این بازار نقطهی شروع خوبی است، چون بخشی از همین مقایسههای بنچمارکی را هم روشن میکند.
در کانال ما هم هر بار که مدل تازهای، از هر شرکتی، رونمایی میشود، همان لحظه خلاصهی خبر و تحلیلش را منتشر میکنیم؛ برای همین دنبالکردن آموزشهای عملی چتجیپیتی و ابزارهای مشابه در کنار اخبار، کمک میکند تصمیم بهتری بگیرید.
۹. جمعبندی ماجرای آرگون
جمینای ۴ آرگون مدلی است با آمار و ارقام واقعاً قوی در چند حوزهی کلیدی، قیمتی رقابتی و ظرفیت خروجی بیسابقه. اما همین هفتهی اول عمرش، با انتقادی جدی از درون خودِ گوگل همراه شده؛ انتقادی که حتی جدول رسمی شرکت هم بخشی از آن را تأیید میکند. روایت نهایی را فقط زمان و استفادهی گستردهی عمومی روشن خواهد کرد، نه اعلامیههای رسمی و نه حتی گزارشهای نشریات.
سوالات متداول
جمینای ۴ آرگون چیست؟ مدل تازهی هوش مصنوعی شرکت گوگل است که برای کارهای سازمانی سنگین مثل برنامهنویسی، تحلیل حقوقی و امنیت سایبری طراحی شده و ظرفیت خروجی یک میلیون توکنی دارد.
آیا الان میتوان از آرگون استفاده کرد؟ نه برای همه؛ دسترسی فعلی محدود به شرکای برنامهی Fairwind و برنامهی پیشانتشار دولت آمریکا است. دسترسی عمومیتر «بهزودی» برای مشتریان پولی و مشترکان Google AI Ultra باز میشود.
بنچمارکسازی یعنی چه؟ یعنی بهینهکردن یک مدل برای کسب نمرهی بالا در آزمونهای استاندارد صنعت، بدون آنکه این برتری لزوماً در کارهای واقعی و روزمره هم دیده شود.
آرگون نسبت به جیپیتی-۶ Astra و Claude Opus 5.5 چه موقعیتی دارد؟ در تحلیل حقوقی، اتوماسیون کسبوکار، استدلال بر متن طولانی و امور مالی جلوتر است، اما در برخی آزمونهای کدنویسی پیشرفته و کارهای ترمینالی تخصصی، از این دو رقیب عقبتر است.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
