ادعای اوپن‌ای‌آی درباره برتری GPT-5.6 در بنچمارک ARC-AGI-3

جنجال بنچمارک ARC-AGI-3: آیا GPT-5.6 واقعاً از کلود اوپوس ۵ جلو زد؟

اخبار · هوش مصنوعی

اوپن‌ای‌آی مدعی شد مدل تازه‌اش GPT-5.6 Sol در سخت‌ترین بنچمارک استدلالی دنیا، ARC-AGI-3، از کلود اوپوس ۵ آنتروپیک جلو زده است؛ اما وقتی جزئیات روش تست فاش شد، خودِ سازمان‌دهندگان این آزمون گفتند مقایسه اصلاً منصفانه نبوده.

چکیده. اوپن‌ای‌آی با فعال کردن دو تنظیم فنی به نام‌های «Retained Reasoning» و «Compaction» در API خودش، نمره‌ی GPT-5.6 Sol در بنچمارک ARC-AGI-3 را از ۷.۸ درصد به ۳۸.۳ درصد رساند و آن را بالاتر از نمره‌ی رسمی کلود اوپوس ۵ (۳۰.۲ درصد) اعلام کرد. مسئولان ARC Prize این مقایسه را غیرمنصفانه خواندند، چون دو مدل با شرایط یکسان آزمایش نشده بودند. این ماجرا بار دیگر نشان داد که اعداد بنچمارک به‌تنهایی نمی‌توانند معیار قابل‌اعتمادی برای انتخاب یک ابزار هوش مصنوعی باشند.
ادعای اوپن‌ای‌آی درباره برتری GPT-5.6 در بنچمارک ARC-AGI-3

۱. ماجرا از کجا شروع شد؟

همه‌چیز با یک پست فنی از تیم اوپن‌ای‌آی آغاز شد. این شرکت در یادداشتی توضیح داد که با «فعال کردن دو تنظیم»، توانسته امتیاز مدل GPT-5.6 Sol را در بنچمارک ARC-AGI-3 تقریباً پنج برابر کند. عنوان این پست به‌گونه‌ای انتخاب شده بود که به‌سرعت در شبکه‌های اجتماعی و رسانه‌های فناوری دست‌به‌دست شد، چون به‌طور ضمنی به معنای برتری GPT-5.6 بر رقیب اصلی‌اش یعنی کلود اوپوس ۵ ساخت آنتروپیک بود. برای آشنایی بیشتر با پیشینه‌ی این شرکت و مسیر توسعه‌ی محصولاتش، می‌توانید این مطلب درباره اوپن‌ای‌آی را هم بخوانید.

در چند روز گذشته، رقابت بین این دو آزمایشگاه بدون وقفه ادامه داشته؛ از انتشار GPT-5.6 با تمرکز بر بهبود نسبت قیمت به عملکرد گرفته تا معرفی کلود اوپوس ۵ به‌عنوان پرچم‌دار جدید آنتروپیک. در چنین فضایی، هر ادعای تازه درباره‌ی برتری در یک بنچمارک معتبر، بلافاصله بازتاب رسانه‌ای گسترده‌ای پیدا می‌کند؛ چه آن ادعا کاملاً دقیق باشد و چه نیازمند توضیحات بیشتر.

۲. بنچمارک ARC-AGI-3 دقیقاً چیست؟

ARC-AGI-3 نسخه‌ی جدیدتر و سخت‌تر مجموعه‌آزمون‌های ARC است که برای سنجش توانایی «استدلال انتزاعی» مدل‌های هوش مصنوعی طراحی شده؛ یعنی توانایی حل مسئله‌هایی که مدل قبلاً دقیقاً شبیه آن‌ها را ندیده و باید با منطق و الگویابی، نه صرفاً حفظیات، پاسخ درست را پیدا کند. این بنچمارک به‌خاطر سخت‌گیری زیادش، به یکی از معتبرترین معیارهای سنجش «هوش واقعی» مدل‌های زبانی بزرگ تبدیل شده و نتایج آن معمولاً تیتر یک بسیاری از رسانه‌های فناوری می‌شود.

برخلاف بنچمارک‌های قدیمی‌تر که مدل‌ها به‌مرور با دیدن میلیون‌ها نمونه‌ی مشابه در داده‌های آموزشی، در آن‌ها «حفظی» قوی می‌شدند، طراحان ARC عمداً معماهایی می‌سازند که تازه و بی‌سابقه باشند. همین ویژگی باعث شده این آزمون به یکی از معیارهای مرجع صنعت برای مقایسه‌ی نسل جدید مدل‌های استدلالی، از جمله خانواده‌ی GPT و کلود، تبدیل شود و هر ادعای تازه درباره‌ی نمره‌ی بالا در آن، بلافاصله توجه رسانه‌ها و توسعه‌دهندگان را جلب کند.

۳. دو تنظیم مرموز: Retained Reasoning و Compaction

طبق توضیح اوپن‌ای‌آی، دو ویژگی فنی در API این شرکت نقش اصلی را در جهش نمره‌ی GPT-5.6 Sol بازی کرده‌اند:

Retained Reasoning: به‌جای اینکه مدل بعد از هر مرحله زنجیره‌ی استدلال (Chain of Thought) خودش را دور بریزد، این زنجیره بین مراحل مختلف یک وظیفه حفظ می‌شود. نتیجه این‌که مدل «حافظه‌ی فکری» خودش را از دست نمی‌دهد و می‌تواند روی تحلیل قبلی‌اش بنا کند.

Compaction: در وظایف طولانی، به‌جای حذف بخش‌هایی از تاریخچه‌ی گفت‌وگو برای جا شدن در محدودیت حافظه‌ی مدل، محتوا خلاصه‌سازی می‌شود تا اطلاعات کلیدی از بین نرود. این کار باعث می‌شود مدل در وظایف چندمرحله‌ای، تداوم و انسجام بیشتری داشته باشد.

جالب اینجاست که این دو تکنیک، در عمل شباهت زیادی به تکنیک‌های حرفه‌ای پرامپت‌نویسی دارند که کاربران عادی هم می‌توانند از آن‌ها استفاده کنند؛ مثل نگه‌داشتن زنجیره‌ی استدلال در طول یک گفت‌وگوی طولانی. اگر می‌خواهید یاد بگیرید چطور از این ایده‌ها در پرامپت‌های روزمره‌ی خودتان استفاده کنید، راهنمای نوشتن پرامپت برای مبتدی‌ها نقطه‌ی شروع خوبی است.

نمره رسمی کلود اوپوس ۵ آنتروپیک در بنچمارک ARC-AGI-3

۴. اعداد دقیق: چه کسی واقعاً جلوتر است؟

حالا برسیم به بخش جنجالی ماجرا: اعداد. طبق گزارش‌های منتشرشده،

• GPT-5.6 Sol با تنظیمات ویژه‌ی اوپن‌ای‌آی: ۳۸.۳ درصد
• کلود اوپوس ۵ با روش تست رسمی و استاندارد: ۳۰.۲ درصد
• GPT-5.6 Sol با همان روش تست رسمی و استاندارد: تنها ۷.۸ درصد

یعنی وقتی هر دو مدل با یک روش یکسان آزمایش شدند، کلود اوپوس ۵ به‌وضوح جلوتر بود. تفاوت فاحش بین ۷.۸ درصد و ۳۸.۳ درصد برای یک مدل واحد، به‌خوبی نشان می‌دهد که تنظیمات فنی و زیرساخت آزمایش، تأثیر مستقیم و بسیار بزرگی روی خروجی نهایی مدل‌های هوش مصنوعی دارند؛ نکته‌ای که خیلی وقت‌ها در تیترهای خبری نادیده گرفته می‌شود.

نکته‌ی مهم‌تر این است که هیچ‌کدام از این اعداد به‌تنهایی «دروغ» نیستند؛ هر سه رقم واقعی‌اند و از آزمایش‌های واقعی به‌دست آمده‌اند. مشکل اصلی در نحوه‌ی روایت و کنار هم چیدن این اعداد است: وقتی در یک پست بازاریابی فقط بالاترین عدد (۳۸.۳ درصد) کنار نمره‌ی رسمی رقیب (۳۰.۲ درصد) گذاشته می‌شود، بدون ذکر اینکه این دو عدد از دو روش تست کاملاً متفاوت آمده‌اند، خواننده‌ی عادی به‌راحتی می‌تواند نتیجه‌ی نادرستی بگیرد. این دقیقاً همان چیزی است که منتقدان این ادعا را «گمراه‌کننده» خوانده‌اند، نه «دروغ».

۵. واکنش داوران مستقل بنچمارک

مسئولان ARC Prize، سازمانی که بنچمارک ARC-AGI-3 را طراحی و اداره می‌کند، در واکنش به این ادعا موضع روشنی گرفتند. به گفته‌ی آن‌ها، «بنچمارک‌ها هیچ‌وقت فقط مدل را نمی‌سنجند؛ آن‌ها زیرساخت فنی پشت مدل را هم می‌سنجند.» به بیان ساده‌تر، وقتی یک مدل با تنظیمات اختصاصی و غیرقابل دسترس برای عموم آزمایش می‌شود و مدل رقیب با روش استاندارد، نتیجه دیگر یک مقایسه‌ی منصفانه نیست. آن‌ها همچنین این احتمال را مطرح کردند که ممکن است در این مقایسه از نسخه‌ای قدیمی از API استفاده شده باشد که باز هم به ضرر دقت نتیجه تمام می‌شود.

۶. چرا این جنجال فقط یک بحث فنی نیست

این اولین باری نیست که رقابت بین آزمایشگاه‌های بزرگ هوش مصنوعی به جنگ اعداد و بنچمارک‌ها کشیده می‌شود. رقابت بین شرکت‌های بزرگ گاهی شبیه رقابت‌های شناخته‌شده‌تری است که پیش‌تر هم دیده‌ایم؛ برای نمونه می‌توانید نگاهی به مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک در بازی شطرنج بیندازید تا ببینید این نوع رقابت‌های عمومی بین مدل‌ها چقدر می‌تواند بحث‌برانگیز باشد. مشکل اینجاست که خیلی از کاربران و حتی کسب‌وکارها، تصمیم خرید یا انتخاب سرویس هوش مصنوعی‌شان را صرفاً بر اساس یک عدد بنچمارک در یک پست بازاریابی می‌گیرند، بدون اینکه بدانند آن عدد در چه شرایطی به دست آمده است.

بحث شفافیت و اعتماد به بنچمارک‌های هوش مصنوعی در صنعت

۷. تفاوت بین بازاریابی و مهندسی واقعی

این ماجرا نمونه‌ی خوبی است از فاصله‌ای که گاهی بین «روایت بازاریابی» یک محصول و «واقعیت مهندسی» پشت آن وجود دارد. وقتی یک عدد چشم‌گیر در یک پست رسمی منتشر می‌شود، خیلی از مخاطبان بدون بررسی جزئیات فنی، آن را باور می‌کنند. برای درک بهتر این فاصله بین ظاهر فریبنده و کار واقعی مهندسی در دنیای هوش مصنوعی، خواندن این مطلب درباره توهم توسعه‌دهنده‌ی تنها در برابر مهندس واقعی خالی از لطف نیست.

۸. این جنجال چه ربطی به کسب‌وکار و کاربران عادی دارد؟

شاید فکر کنید این فقط یک دعوای فنی بین دو غول فناوری است، اما نتیجه‌ی آن مستقیماً روی تصمیم‌های واقعی تأثیر می‌گذارد. بسیاری از کسب‌وکارها هنگام انتخاب ابزار هوش مصنوعی برای اتوماسیون، خدمات مشتری یا تحلیل داده، به همین اعداد بنچمارک تکیه می‌کنند. اگر می‌خواهید بدانید چرا انتخاب درست ابزار هوش مصنوعی برای کسب‌وکار امروز این‌قدر اهمیت دارد، این راهنما درباره اهمیت هوش مصنوعی در کسب‌وکار را از دست ندهید. همچنین برای دیدی واقع‌بینانه‌تر از توانایی‌ها و محدودیت‌های واقعی این فناوری، پیشنهاد می‌کنیم این مقاله درباره پتانسیل و محدودیت‌های واقعی هوش مصنوعی را هم بخوانید.

۹. چطور خودمان بنچمارک‌های هوش مصنوعی را بهتر بخوانیم؟

از این ماجرا یک درس عملی می‌شود گرفت: هر وقت عددی از یک بنچمارک هوش مصنوعی دیدید، حداقل این سه سؤال را از خودتان بپرسید: آیا هر دو مدل با روش تست یکسانی آزمایش شده‌اند؟ آیا تنظیمات استفاده‌شده برای همه‌ی کاربران عادی هم در دسترس است؟ و آیا نهاد مستقلی این نتیجه را تأیید کرده یا فقط خودِ سازنده‌ی مدل آن را اعلام کرده است؟ اگر به دنبال یادگیری عملی و گام‌به‌گام کار با ابزارهای هوش مصنوعی هستید، سری آموزش‌های چت‌جی‌پی‌تی در سایت ما می‌تواند نقطه‌ی شروع خوبی باشد. برای دنبال کردن آخرین اخبار این حوزه هم می‌توانید سری به بخش اخبار سایت بزنید.

پرسش‌های متداول

آیا GPT-5.6 واقعاً از کلود اوپوس ۵ بهتر است؟

بر اساس روش تست استاندارد و رسمی بنچمارک ARC-AGI-3، خیر؛ کلود اوپوس ۵ با نمره‌ی ۳۰.۲ درصد در برابر ۷.۸ درصد GPT-5.6 Sol در همان شرایط، به‌وضوح جلوتر بوده است. برتری اعلام‌شده‌ی اوپن‌ای‌آی فقط زمانی دیده می‌شود که تنظیمات فنی اختصاصی و غیراستاندارد فعال باشند.

Retained Reasoning و Compaction چه فایده‌ای برای کاربران عادی دارند؟

این دو تکنیک عمدتاً برای توسعه‌دهندگانی است که از طریق API با مدل‌ها کار می‌کنند، اما ایده‌ی پشت آن‌ها (حفظ زنجیره‌ی استدلال و خلاصه‌سازی هوشمند تاریخچه) در پرامپت‌نویسی روزمره هم قابل استفاده است.

چرا بنچمارک‌های هوش مصنوعی گاهی گمراه‌کننده‌اند؟

چون شرایط آزمایش (تنظیمات، نسخه‌ی API، دسترسی به ابزارهای کمکی) می‌تواند به‌شدت روی نتیجه‌ی نهایی تأثیر بگذارد؛ در نتیجه یک عدد به‌تنهایی، بدون دانستن شرایط دقیق آزمایش، اطلاعات کاملی به ما نمی‌دهد.

آیا آنتروپیک هم به این ادعا واکنش نشان داده است؟

در زمان انتشار این مطلب، واکنش رسمی آنتروپیک به این ادعای مشخص گزارش نشده بود، اما داوران مستقل بنچمارک ARC Prize به‌طور علنی نسبت به روش مقایسه‌ی اوپن‌ای‌آی ابراز تردید کردند و خواستار شفافیت بیشتر در گزارش این نوع نتایج شدند.

جمع‌بندی. جنجال بنچمارک ARC-AGI-3 بار دیگر یادآوری کرد که پشت هر تیتر پرزرق‌وبرق هوش مصنوعی، باید به دنبال جزئیات فنی واقعی گشت. برای دنبال کردن این‌جور تحلیل‌های شفاف و به‌روز از دنیای هوش مصنوعی، کانال تلگرام @MrChatGPT_IR را دنبال کنید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *