نمودار جهش امتیاز کلود اوپوس ۵ از سی به صد درصد در بنچمارک ARC-AGI-3 با کمک معماری AVO ساخت شرکت انویدیا

کلود اوپوس ۵ با موتور AVO انویدیا در بنچمارک ARC-AGI-3 صد از صد گرفت

اخبار · هوش مصنوعی

کلود اوپوس ۵ به‌تنهایی فقط ۳۰ درصد یک بنچمارک سخت را حل کرد؛ اما وقتی مهندسان انویدیا همین مدل را داخل یک لایه‌ی هوشمند به نام AVO گذاشتند، نمره به صد از صد رسید. این اتفاق دارد تعریف ما از «مدل قوی» را عوض می‌کند.

چکیده. شرکت Nvidia روز جمعه ۲۱ آگوست ۲۰۲۶ گزارشی منتشر کرد که نشان می‌داد سامانه‌ی عامل‌محور آن به نام AVO یا Agentic Variation Operators توانسته با استفاده از کلود اوپوس ۵ به‌عنوان مغز اصلی، نمره‌ی کامل ۱۰۰ از ۱۰۰ را در تمام ۱۸۳ مرحله‌ی نسخه‌ی عمومی بنچمارک ARC-AGI-3 کسب کند؛ در حالی که همین مدل به‌تنهایی تنها ۳۰.۲ درصد را درست حل کرده بود. این نتیجه نشان می‌دهد که در نسل بعدی هوش مصنوعی، طراحی سیستم اطراف مدل می‌تواند به‌اندازه‌ی خود مدل زبانی اهمیت داشته باشد.

نمودار جهش امتیاز کلود اوپوس ۵ از سی به صد درصد در بنچمارک ARC-AGI-3 با کمک معماری AVO ساخت شرکت انویدیا

۱. بنچمارک ARC-AGI-3 چیست و چرا شکستنش این‌قدر سخت است؟

برخلاف آزمون‌های رایج زبانی که مدل فقط باید یک پاسخ متنی درست تولید کند، ARC-AGI-3 یک محیط تعاملی است. مدل باید وارد یک بازی ناشناخته شود، بدون هیچ راهنمای از پیش نوشته‌شده قوانین آن را حدس بزند، اقدامی انجام دهد، نتیجه را ببیند و بر اساس آن فرضیه‌اش را اصلاح کند. این چرخه‌ی «فرضیه، عمل، مشاهده، اصلاح» دقیقاً همان چیزی است که یک انسان هنگام یادگیری یک بازی جدید انجام می‌دهد، اما برای مدل‌های زبانی بسیار دشوارتر است. نسخه‌ی عمومی این بنچمارک شامل ۲۵ محیط و در مجموع ۱۸۳ مرحله است و امتیاز نهایی با معیاری به نام RHAE یا Relative Human Action Efficiency سنجیده می‌شود؛ یعنی مدل باید نه‌تنها مسئله را حل کند، بلکه با کارآمدی نزدیک به یک انسان هم این کار را انجام دهد.

همین ویژگی باعث شده این آزمون به یکی از معتبرترین معیارها برای سنجش استدلال بلندمدت و خودمختاری واقعی در میان پژوهشگران هوش مصنوعی تبدیل شود. برای آشنایی بیشتر با تفاوت میان توانایی خام یک مدل و کاربرد عملی آن، می‌توانید مطلب قابلیت‌های واقعی و محدودیت‌های هوش مصنوعی را در سایت ما بخوانید.

۲. عدد ۳۰ درصد چه چیزی درباره‌ی کلود اوپوس ۵ می‌گوید؟

وقتی کلود اوپوس ۵ بدون هیچ کمک بیرونی و فقط با اتکا به توانایی داخلی خودش وارد این آزمون شد، توانست ۳۰.۲ درصد از مراحل را درست حل کند. این عدد اصلاً ضعیف نیست؛ کلود اوپوس ۵ یکی از قوی‌ترین مدل‌های زبانی روز دنیاست و این نمره نشان‌دهنده‌ی توانایی استدلالی بالای آن است. اما فاصله‌ی زیاد این عدد تا نمره‌ی کامل، دقیقاً همان چیزی است که پژوهشگران انویدیا روی آن دست گذاشتند: مدل به‌تنهایی حافظه‌ای برای نگه‌داشتن آزمایش‌های قبلی‌اش ندارد و وقتی در یک مسیر اشتباه گیر می‌کند، لزوماً راهی برای اصلاح خودکار آن پیدا نمی‌کند.

۳. موتور AVO انویدیا از کجا آمد؟

Agentic Variation Operators یا به‌اختصار AVO، برای اولین‌بار در اواخر مارس ۲۰۲۶ معرفی شد؛ زمانی که هدف اصلی آن بهینه‌سازی خودکار کدهای پردازشی روی تراشه‌های گرافیکی بود، نه بازی کردن. تیم انویدیا سپس همین معماری را بدون هیچ تغییر بنیادینی به یک حوزه‌ی کاملاً متفاوت یعنی استدلال تعاملی منتقل کرد تا ببیند آیا یک «چارچوب عمومی» می‌تواند مستقل از حوزه‌ی کاربرد، عملکرد را بهبود دهد یا نه. نتیجه‌ی این آزمایش انتقال، دقیقاً همان چیزی بود که اکنون سر زبان‌ها افتاده است.

۴. معماری AVO دقیقاً چطور کار می‌کند؟

در قلب AVO یک چرخه‌ی چهارمرحله‌ای وجود دارد: بررسی زمینه با کمک حافظه و ابزارهای در دسترس، برنامه‌ریزی برای گام بعدی بر اساس شواهد جمع‌شده، اجرای واقعی آن اقدام، و در نهایت ارزیابی نتیجه از طریق اجرا و بازخورد. این چرخه بارها و بارها تکرار می‌شود، اما دو مکانیزم هستند که تفاوت واقعی را ایجاد می‌کنند.

حافظه‌ی پایدار

برخلاف یک گفت‌وگوی معمولی که با هر پیام تازه بخشی از زمینه فراموش می‌شود، AVO تمام پیاده‌سازی‌ها، خروجی‌های اجرا و استدلال‌های پیشین را نگه می‌دارد. این یعنی مدل هر بار مجبور نیست از صفر جست‌وجو را شروع کند؛ می‌تواند دقیقاً از همان جایی که مانده بود ادامه دهد.

ناظر برنامه‌ریزی‌شده

یک لایه‌ی نظارتی جداگانه، مسیر کلی جست‌وجو را زیر نظر دارد. وقتی پیشرفت متوقف می‌شود یا مدل در یک حلقه‌ی اشتباه گیر می‌کند، همین ناظر مسیر را اصلاح می‌کند و مدل را به سمت فرضیه‌های تازه هدایت می‌کند. به‌گفته‌ی تیم انویدیا، «توانایی مدل اهمیت زیادی دارد، اما این سیستم اطراف آن است که تعیین می‌کند این توانایی چگونه به پیشرفت پایدار و خودکار تبدیل شود.»

مقایسه عملکرد کلود اوپوس پنج و جی‌پی‌تی پنج و شش سول در آزمون استدلال تعاملی ARC-AGI-3

۵. مسیر جهش: از ۳۰ درصد تا صد از صد

وقتی همین مدل کلود اوپوس ۵ داخل چارچوب AVO قرار گرفت، نتیجه‌ی نهایی نمره‌ی کامل ۱۰۰ از ۱۰۰ در هر ۲۵ محیط نسخه‌ی عمومی بود؛ یعنی تمام ۱۸۳ مرحله بدون استثنا حل شد. جالب‌تر اینکه این کار تنها با ۶٬۶۲۴ اقدام در محیط انجام شد؛ حدود ۱۲ درصد کمتر از سامانه‌ی رقیب قبلی به نام VISTA که با همان مدل کلود اوپوس ۵ به ۷٬۵۴۲ اقدام نیاز داشت. این یعنی AVO نه‌تنها دقیق‌تر عمل کرد، بلکه کارآمدتر هم بود؛ دو ویژگی که معمولاً به‌سختی هم‌زمان به‌دست می‌آیند.

۶. مقایسه با GPT-5.6 Sol و رقبا

پژوهشگران برای اطمینان از اینکه این جهش فقط مخصوص یک مدل خاص نیست، همین معماری را روی بخشی از سخت‌ترین بازی‌های این بنچمارک با مدل GPT-5.6 Sol شرکت OpenAI هم آزمایش کردند. نتایج نشان داد چارچوب AVO می‌تواند مستقل از مدل زبانی زیربنایی عمل کند، هرچند گزارش رسمی جزئیات کامل امتیاز GPT-5.6 Sol در کنار AVO را منتشر نکرده است. این موضوع دقیقاً همان بحثی است که در تحلیل ما درباره‌ی رقابت مدل‌های زبانی بزرگ در وظایف استدلالی هم به آن پرداخته‌ایم؛ اینکه مقایسه‌ی مدل‌ها دیگر فقط بر سر «کدام مدل بزرگ‌تر است» نیست، بلکه بر سر «کدام سیستم بهتر طراحی شده است» می‌چرخد.

۷. AVO فراتر از بازی: بهینه‌سازی تراشه‌های گرافیکی

نکته‌ای که این خبر را واقعاً متفاوت می‌کند این است که AVO اصلاً برای بازی طراحی نشده بود. در همان کاربرد اصلی خودش یعنی بهینه‌سازی هسته‌های پردازشی GPU روی سیستم‌های Nvidia DGX B200، این معماری توانست تا ۱۰.۵ درصد از FlashAttention-4 که یکی از سریع‌ترین کتابخانه‌های پردازشی حال حاضر است، بهتر عمل کند. انتقال موفق همین معماری از دنیای مهندسی نرم‌افزار به دنیای استدلال تعاملی، نشانه‌ی روشنی است که این چارچوب واقعاً «عمومی» است، نه یک ترفند مخصوص یک مسئله‌ی خاص.

۸. چرا «طراحی سیستم» دارد مهم‌تر از «اندازه‌ی مدل» می‌شود؟

تا همین چند سال پیش، مسیر اصلی پیشرفت هوش مصنوعی افزایش اندازه‌ی مدل و حجم داده‌ی آموزشی بود. اما نتیجه‌ی AVO یک پیام روشن‌تر دارد: وقتی به مدل، حافظه‌ی پایدار و یک لایه‌ی نظارتی هوشمند اضافه می‌شود، همان مدل می‌تواند کاری را انجام دهد که به‌تنهایی از پس آن برنمی‌آمد. به بیان دیگر، آینده‌ی عامل‌های هوشمند احتمالاً کمتر به «مدل بزرگ‌تر» و بیشتر به «سیستم بهتر طراحی‌شده» وابسته خواهد بود. اگر می‌خواهید بدانید این تغییر رویکرد چه معنایی برای کسب‌وکارهایی دارد که می‌خواهند از هوش مصنوعی استفاده کنند، مطلب چرا هوش مصنوعی برای کسب‌وکارها اهمیت دارد را از دست ندهید.

مفهوم معماری هوش مصنوعی عامل‌محور و رقابت مدل‌های زبانی بزرگ در بنچمارک‌های استدلال بلندمدت

آیا این عدد ۱۰۰ از ۱۰۰ قابل اعتماد است؟

هر وقت خبر یک نمره‌ی کامل و بی‌نقص منتشر می‌شود، طبیعی است که پژوهشگران دیگر با احتیاط به آن نگاه کنند. نکته‌ی مهم این است که این نتیجه فقط روی نسخه‌ی عمومی بنچمارک اندازه‌گیری شده؛ یعنی همان مجموعه‌ای که از قبل برای آموزش و آزمایش سیستم‌ها در دسترس بوده است. سازندگان ARC-AGI-3 معمولاً یک مجموعه‌ی خصوصی و پنهان هم نگه می‌دارند تا از احتمال «حفظ‌کردن الگوی سؤال‌ها» به‌جای «فهمیدن واقعی مسئله» جلوگیری کنند. تا زمانی که نتیجه‌ی این معماری روی مجموعه‌ی خصوصی هم منتشر نشود، بهتر است این دستاورد را یک جهش بزرگ و واقعی، اما هنوز نیازمند تأیید مستقل‌تر، در نظر بگیریم. با این حال، حتی منتقدان محتاط‌ترین این حوزه هم می‌پذیرند که فاصله‌ی ۳۰ تا ۱۰۰ درصد آن‌قدر بزرگ است که به‌سختی می‌توان آن را با شانس یا اشتباه در اندازه‌گیری توضیح داد.

۹. این یافته برای کاربران عادی و کسب‌وکارهای ایرانی چه معنایی دارد؟

خبر خوب این است که این نوع پیشرفت‌ها معمولاً دیر یا زود به ابزارهای روزمره راه پیدا می‌کنند. اگر امروز از دستیارهای هوش مصنوعی برای کارهای ساده مثل نوشتن متن استفاده می‌کنید، فردا احتمالاً همین ابزارها بتوانند وظایف چندمرحله‌ای پیچیده‌تر مثل تحقیق، برنامه‌نویسی کامل یا مدیریت پروژه را هم به‌طور خودکار و بدون نظارت مداوم شما انجام دهند. برای کسانی که تازه می‌خواهند از این ابزارها استفاده کنند، پیشنهاد می‌کنیم نگاهی به راهنمای نوشتن پرامپت برای مبتدیان در سایت ما بیندازید تا با اصول اولیه‌ی گفت‌وگوی مؤثر با این مدل‌ها آشنا شوید. همچنین اگر کنجکاوید بدانید شرکتی مثل OpenAI اصلاً چگونه شکل گرفت و چه تفاوتی با انویدیا و انتروپیک دارد، مطلب اوپن‌ای‌آی چیست را بخوانید.

نکته‌ی مهم دیگر این است که پیشرفت واقعی در این حوزه همیشه محصول کار تیم‌های بزرگ مهندسی و پژوهشی است، نه یک فرد یا یک ابزار جادویی. برای درک بهتر این تفاوت، مطلب توهم توسعه‌دهنده‌ی تنها در برابر مهندس واقعی در سایت ما دیدگاه خوبی ارائه می‌دهد.

پرسش‌های متداول

AVO دقیقاً چیست؟

AVO یا Agentic Variation Operators یک چارچوب عمومی ساخته‌ی شرکت Nvidia است که یک مدل زبانی موجود مثل کلود اوپوس ۵ را با حافظه‌ی پایدار و یک لایه‌ی نظارتی ترکیب می‌کند تا در وظایف طولانی و پیچیده عملکرد بهتری داشته باشد.

آیا وزن‌های مدل کلود اوپوس ۵ تغییر کرده است؟

خیر. طبق گزارش انویدیا، مدل زیربنایی بدون هیچ آموزش یا تغییر اضافه‌ای استفاده شده و تمام بهبود از لایه‌ی مدیریتی و معماری اطراف مدل آمده است.

چرا این خبر برای آینده‌ی هوش مصنوعی مهم است؟

چون نشان می‌دهد شکاف بین یک مدل زبانی خوب و یک عامل هوشمند واقعاً کاربردی، لزوماً با مدل بزرگ‌تر پر نمی‌شود؛ بلکه با طراحی هوشمندانه‌ی سیستم اطراف آن مدل پر می‌شود.

آیا این معماری فقط برای بازی و آزمون کار می‌کند؟

نه. همان‌طور که در بخش‌های بالا اشاره شد، AVO ابتدا برای بهینه‌سازی کدهای پردازشی GPU طراحی شده بود و در آن حوزه هم نتایج بهتری نسبت به ابزارهای رقیب گرفته است.

جمع‌بندی. جهش کلود اوپوس ۵ از ۳۰ درصد به صد از صد در بنچمارک ARC-AGI-3 با کمک موتور AVO انویدیا، یکی از روشن‌ترین نشانه‌های این هفته است که مسیر بعدی پیشرفت هوش مصنوعی از «سیستم‌های بهتر» می‌گذرد، نه فقط «مدل‌های بزرگ‌تر». برای دنبال‌کردن این‌گونه اخبار به محض انتشار و پیش از همه، کانال تلگرام @MrChatGPT_IR را دنبال کنید و سری هم به بخش اخبار هوش مصنوعی و آموزش‌های ChatGPT در سایت ما بزنید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *