شک به جمینای ۴ آرگون؛ ماجرای بنچمارک‌سازی گوگل چیست؟

اخبار · هوش مصنوعی

گوگل مدل تازه‌اش، جمینای ۴ آرگون، را با جدولی از رکوردهای بنچمارک رونمایی کرد؛ اما همین روزها گزارشی از درون شرکت می‌گوید تجربه‌ی واقعی کارمندان با آن ارقام درخشان همخوانی ندارد.

چکیده. شرکت گوگل مدل جمینای ۴ آرگون را با ادعای صدرنشینی در ۱۳ از ۱۸ بنچمارک معتبر صنعت معرفی کرده، اما گزارش بلومبرگ از زبان چند کارمند داخلی حکایت از ضعف محسوس در کارهای واقعی کدنویسی و طراحی رابط کاربری دارد. شرکت گوگل این انتقاد را رد کرده، هرچند جدول رسمی خودش هم در چند آزمون کدنویسی، آرگون را پایین‌تر از رقبا نشان می‌دهد. دسترسی به مدل هنوز محدود و منحصر به شرکای امنیتی طرح Fairwind است.
جمینای ۴ آرگون گوگل زیر ذره‌بین انتقادهای داخلی قرار گرفته است

۱. رونمایی از آرگون؛ تازه‌ترین سلاح گوگل در جنگ مدل‌های بزرگ

شرکت گوگل این هفته از جمینای ۴ آرگون رونمایی کرد؛ مدلی که به گفته‌ی خود شرکت برای کارهای سازمانی سنگین مثل برنامه‌نویسی، تحلیل حقوقی و عملیات امنیت سایبری طراحی شده است. آرگون در میان مدل‌های بزرگ این روزها از جهتی چشم‌گیر است: ظرفیت خروجی آن به یک میلیون توکن رسیده، در برابر محدودیت ۶۴ هزار توکنی نسل قبلی. این یعنی مدل می‌تواند در یک پاسخ، حجم بسیار بیشتری از کد یا متن تولید کند بدون آن‌که میان راه قطع شود.

برای کسانی که اخبار رقابت مدل‌های هوش مصنوعی را دنبال می‌کنند، این رونمایی ادامه‌ی همان مسابقه‌ای است که در نبرد میان ابزارهای هوش مصنوعی بار و بار دیده‌ایم؛ هر شرکت یک جدول بنچمارک رونمایی می‌کند و خودش را برنده‌ی دور تازه می‌خواند. بخش اخبار روز هوش مصنوعی سایت ما هم پر از همین رقابت‌های پی‌درپی است.

۲. چه رکوردهایی آرگون ادعا می‌کند؟

طبق جدول رسمی منتشرشده، جمینای ۴ آرگون در ۱۳ از ۱۸ بنچمارک افشاشده، صدرنشین یا هم‌رتبه‌ی صدر است. در بنچمارک تحلیل حقوقی شرکت هاروی، نمره‌ی آرگون ۱۹.۶ درصد است در برابر بازه‌ی ۳.۸ تا ۵.۴ درصدی رقبا؛ یعنی فاصله‌ای قابل‌توجه. در اتوماسیون کسب‌وکار به ۵۱.۳ درصد رسیده، در استدلال با متن‌های طولانی به ۸۴.۲ درصد، در حوزه‌ی مالی به ۶۵.۴ درصد و در مهندسی نرم‌افزار به ۷۷.۹ درصد. مثال‌های داخلی گوگل هم شامل بهینه‌سازی وظایف محاسبات کوانتومی و شناسایی بیش از ۳۰۰ ترابایت صرفه‌جویی حافظه در یک پروژه‌ی مهاجرت کد به زبان راست بوده است.

چنین ارقامی طبیعتاً سروصدا به پا می‌کند، چون مستقیماً با وعده‌های تجاری گره خورده‌اند. کسب‌وکارهایی که دنبال توجیه هزینه‌ی هوش مصنوعی هستند، دقیقاً همین نوع آمار را می‌خوانند تا تصمیم بگیرند؛ موضوعی که در یادداشت ما درباره‌ی اهمیت هوش مصنوعی برای کسب‌وکارها هم به آن پرداخته‌ایم.

۳. اما یک گزارش ماجرا را پیچیده کرد

همین چند روز پس از رونمایی، بلومبرگ گزارشی منتشر کرد که می‌گفت چند کارمند گوگل، به‌صورت ناشناس، از عملکرد واقعی آرگون در کارهای روزمره گله کرده‌اند. به نقل از این افراد، مدل روی بنچمارک‌های رسمی خوب عمل می‌کند اما وقتی کارمندان آن را برای وظایف واقعی کدنویسی به کار می‌برند، نتیجه «به همان اندازه دلچسب نیست». یکی از ایرادهای تکرارشده، ضعف آرگون در طراحی فرانت‌اند بوده است؛ یعنی دقیقاً همان کاری که خیلی از توسعه‌دهندگان هر روز با کمک هوش مصنوعی انجام می‌دهند.

بخشی از منتقدان داخلی حتی واژه‌ی «بنچمارک‌سازی» را به کار برده‌اند؛ اصطلاحی که این روزها در صنعت هوش مصنوعی باب شده و به معنای بهینه‌سازی یک مدل صرفاً برای درخشیدن در آزمون‌های استاندارد است، نه برای کارایی واقعی در دنیای بیرون. نگرانی دیگر هم به اندازه‌ی مدل برمی‌گردد؛ به گفته‌ی منابع بلومبرگ، آرگون مدلی «بسیار بزرگ» است و همین موضوع می‌تواند هزینه‌ی سروکارداشتن با آن را بالا ببرد.

مقایسه نمرات بنچمارک جمینای ۴ آرگون با جی‌پی‌تی-۶ و کلود اوپوس

۴. بنچمارک‌سازی دقیقاً چیست و چرا باید نگرانش بود؟

فاصله‌ی میان نمره‌ی بنچمارک و تجربه‌ی واقعی کاربر، موضوع تازه‌ای در دنیای هوش مصنوعی نیست. مدلی می‌تواند روی مجموعه‌داده‌های استاندارد عالی عمل کند، اما همان مهارت وقتی با شرایط واقعی، داده‌های کثیف و نیازهای غیرقابل‌پیش‌بینی کاربر روبه‌رو می‌شود، رنگ ببازد. در یادداشت مفصل‌تری که درباره‌ی توانایی‌ها و محدودیت‌های واقعی هوش مصنوعی نوشته‌ایم، دقیقاً به همین شکاف میان وعده و عملکرد پرداخته‌ایم.

این بحث حتی ریشه‌ای فلسفی‌تر هم دارد؛ تفاوت میان یک ابزار که به‌ظاهر همه‌کاره است و یک همکار واقعی که می‌تواند روی پروژه‌ای پیچیده قابل‌اعتماد باشد. در تحلیلی که پیش‌تر منتشر کرده بودیم، همین مرز میان توسعه‌دهنده‌ی تنها با کمک هوش مصنوعی و مهندس واقعی را بررسی کرده بودیم؛ و حالا همان بحث، این‌بار درباره‌ی خودِ سازنده‌ی مدل، یعنی گوگل، مطرح شده است.

۵. پاسخ گوگل به انتقادها

شرکت گوگل این توصیف از ضعف آرگون را «نادرست» خوانده است. کورای کاووکجواوغلو، یکی از مدیران ارشد فنی گوگل دیپ‌مایند، گفته از عملکرد مدل «دلگرم‌کننده» است. یک کارمند ناشناس گوگل هم به بلومبرگ گفته درون شرکت «توافق گسترده‌ای» وجود دارد که آرگون در خط مقدم فناوری قرار دارد و ادعای ضعف در کدنویسی واقعی را رد کرده است.

اما نکته‌ی جالب اینجاست که جدول رسمی خودِ گوگل هم تصویر یکدستی به دست نمی‌دهد. در بنچمارک FrontierSWE v2، آرگون نمره‌ی ۵۵.۰ درصد گرفته، در حالی که مدل جدید شرکت OpenAI یعنی جی‌پی‌تی-۶ Astra به ۶۵.۵ درصد رسیده؛ فاصله‌ای نزدیک به ۱۰.۵ واحد درصد. در آزمون Terminal-Bench هم آرگون با ۵۷.۶ تا ۵۷.۴ درصد، از Claude Opus 5.5 ساخت آنتروپیک که به ۶۶.۴ تا ۶۸.۱ درصد رسیده، عقب‌تر است. به بیان دیگر، همان داده‌هایی که گوگل منتشر کرده، تا حدی حرف منتقدان را هم تأیید می‌کند.

برتری در کجا و ضعف در کجا؟

جمع‌بندی ساده این است: آرگون در حوزه‌هایی مثل تحلیل حقوقی، اتوماسیون کسب‌وکار، استدلال بر متن طولانی و امور مالی به‌وضوح جلوتر است. اما در دو میدان مشخص، یعنی کدنویسی پیشرفته‌ی نرم‌افزاری و کارهای ترمینالی تخصصی، رقبایی مثل جی‌پی‌تی-۶ Astra و Claude Opus 5.5 همچنان دست بالا را دارند. در امنیت سایبری هم در آزمون CWE-bench با جی‌پی‌تی-۶ Astra هم‌امتیاز شده، نه جلوتر.

دسترسی محدود به مدل جمینای ۴ آرگون از طریق برنامه Fairwind گوگل

۶. چرا فعلاً فقط چند نفر به آرگون دسترسی دارند؟

آرگون هنوز به‌صورت عمومی منتشر نشده است. گوگل در گام نخست، دسترسی را از طریق برنامه‌ای به نام Fairwind در اختیار «مدافعان امنیت سایبری» قرار داده و همزمان در برنامه‌ی داوطلبانه‌ی دولت آمریکا برای دسترسی پیش از انتشار هم شرکت کرده است. طبق اعلام گوگل، دسترسی گسترده‌تر برای مشتریان پولی رابط برنامه‌نویسی و مشترکان Google AI Ultra «به‌زودی» فراهم می‌شود، بدون اعلام تاریخ دقیق.

همین محدودیت دسترسی، بخشی از دلیل داغ‌شدن بحث بنچمارک‌سازی است؛ وقتی اکثر کاربران و حتی بسیاری از توسعه‌دهندگان هنوز نتوانسته‌اند مدل را روی پروژه‌های واقعی خودشان امتحان کنند، تنها منبع قضاوت همان جدول رسمی و همان چند روایت ضدونقیض داخلی باقی می‌ماند.

۷. قیمت‌گذاری؛ شاید برگ برنده‌ی واقعی گوگل

فارغ از بحث بنچمارک، قیمت آرگون واقعاً چشمگیر است. در دوره‌ی معرفی، هر یک میلیون توکن ورودی ۲ دلار و هر یک میلیون توکن خروجی ۱۰ دلار قیمت دارد؛ پس از پایان دوره‌ی تشویقی هم به ۴ و ۲۰ دلار می‌رسد. این رقم تقریباً یک‌پنجم قیمت جی‌پی‌تی-۶ Astra (۱۰ و ۵۰ دلار) و نیمی از Claude Opus 5.5 (۴ و ۲۰ دلار) است. برای شرکت‌هایی که حجم بالایی از درخواست‌ها را پردازش می‌کنند، همین اختلاف قیمت می‌تواند مهم‌تر از چند واحد درصد تفاوت در یک بنچمارک علمی باشد.

اگر می‌خواهید وقتی دسترسی عمومی باز شد، بیشترین بازده را از چنین مدل‌هایی بگیرید، آشنایی با اصول نوشتن پرامپت خوب همچنان مهم‌ترین مهارت است؛ موضوعی که در آموزش نوشتن پرامپت برای مبتدیان به‌صورت کامل توضیح داده‌ایم.

۸. این ماجرا برای کاربران عادی و کسب‌وکارها چه معنایی دارد؟

برای کاربر عادی، این داستان یک درس ساده دارد: جدول بنچمارک هیچ‌وقت نباید تنها معیار انتخاب یک مدل هوش مصنوعی باشد. برای کسب‌وکارهایی که می‌خواهند روی آرگون سرمایه‌گذاری کنند، منطقی‌ترین راه، صبر برای دسترسی عمومی و تست مستقیم روی همان وظیفه‌ای است که قرار است مدل انجامش دهد؛ نه تکیه‌کردن صرف بر جدول رسمی یک شرکت یا حتی گزارش منتقدانه‌ی رسانه‌ها. اگر تازه با مفهوم هوش مصنوعی مولد و بازیگران اصلی این بازار آشنا نیستید، دوره‌ی مقدماتی ما درباره‌ی اوپن‌ای‌آی و جایگاهش در این بازار نقطه‌ی شروع خوبی است، چون بخشی از همین مقایسه‌های بنچمارکی را هم روشن می‌کند.

در کانال ما هم هر بار که مدل تازه‌ای، از هر شرکتی، رونمایی می‌شود، همان لحظه خلاصه‌ی خبر و تحلیلش را منتشر می‌کنیم؛ برای همین دنبال‌کردن آموزش‌های عملی چت‌جی‌پی‌تی و ابزارهای مشابه در کنار اخبار، کمک می‌کند تصمیم بهتری بگیرید.

۹. جمع‌بندی ماجرای آرگون

جمینای ۴ آرگون مدلی است با آمار و ارقام واقعاً قوی در چند حوزه‌ی کلیدی، قیمتی رقابتی و ظرفیت خروجی بی‌سابقه. اما همین هفته‌ی اول عمرش، با انتقادی جدی از درون خودِ گوگل همراه شده؛ انتقادی که حتی جدول رسمی شرکت هم بخشی از آن را تأیید می‌کند. روایت نهایی را فقط زمان و استفاده‌ی گسترده‌ی عمومی روشن خواهد کرد، نه اعلامیه‌های رسمی و نه حتی گزارش‌های نشریات.

سوالات متداول

جمینای ۴ آرگون چیست؟ مدل تازه‌ی هوش مصنوعی شرکت گوگل است که برای کارهای سازمانی سنگین مثل برنامه‌نویسی، تحلیل حقوقی و امنیت سایبری طراحی شده و ظرفیت خروجی یک میلیون توکنی دارد.

آیا الان می‌توان از آرگون استفاده کرد؟ نه برای همه؛ دسترسی فعلی محدود به شرکای برنامه‌ی Fairwind و برنامه‌ی پیش‌انتشار دولت آمریکا است. دسترسی عمومی‌تر «به‌زودی» برای مشتریان پولی و مشترکان Google AI Ultra باز می‌شود.

بنچمارک‌سازی یعنی چه؟ یعنی بهینه‌کردن یک مدل برای کسب نمره‌ی بالا در آزمون‌های استاندارد صنعت، بدون آن‌که این برتری لزوماً در کارهای واقعی و روزمره هم دیده شود.

آرگون نسبت به جی‌پی‌تی-۶ Astra و Claude Opus 5.5 چه موقعیتی دارد؟ در تحلیل حقوقی، اتوماسیون کسب‌وکار، استدلال بر متن طولانی و امور مالی جلوتر است، اما در برخی آزمون‌های کدنویسی پیشرفته و کارهای ترمینالی تخصصی، از این دو رقیب عقب‌تر است.

در یک جمله: گوگل با آرگون یک قدم بزرگ در بنچمارک‌ها برداشته، اما هنوز باید ثابت کند این برتری در دنیای واقعی هم پایدار است. ما در کانال @MrChatGPT_IR همین لحظه که خبر تازه‌ای از دنیای هوش مصنوعی منتشر شود، آن را برایتان خلاصه می‌کنیم؛ همراه ما بمانید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *