جهش عجیب GPT-6 Astra در خطایابی مونتاژ ایکیا؛ از ۲۸ به ۸۰ درصد

اخبار · هوش مصنوعی

مدل تازهٔ OpenAI، یعنی GPT-6 Astra، در یک آزمون عجیب و کاربردی از دل مبلمان ایکیا سربلند بیرون آمد؛ آزمونی که نشان می‌دهد بینایی هوش مصنوعی چقدر به دنیای واقعی نزدیک شده است.

چکیده. آزمایشگاه مستقل Epoch AI بنچمارکی به‌نام FAB (Furniture Assembly Benchmark) طراحی کرده که در آن مدل‌های هوش مصنوعی باید از روی عکس مبلمان نیمه‌ساز ایکیا، خطای مونتاژ را پیدا کنند. مدل GPT-6 Astra از OpenAI با دقت ۸۰ درصد در صدر ایستاد، مدل‌های Claude Fable 5.1 و Claude Opus 5 به ترتیب به ۷۰ و ۶۱ درصد رسیدند، و همهٔ این‌ها در حالی است که تا ده ماه پیش، بهترین نمرهٔ ثبت‌شده تنها ۲۸ درصد بود.
نمودار مقایسه دقت مدل‌های هوش مصنوعی OpenAI و Claude در بنچمارک FAB برای تشخیص خطای مونتاژ مبلمان ایکیا

۱. ماجرا از کجا شروع شد؟

همهٔ ما یک بار تجربهٔ سرهم‌کردن مبلمان ایکیا را داشته‌ایم: پیچ‌های اضافه، صفحه‌ای که برعکس نصب شده، یا لولایی که جای اشتباه رفته است. معمولاً در چنین لحظه‌ای یا دوباره دفترچهٔ راهنما را ورق می‌زنیم، یا از یک دوست باتجربه کمک می‌خواهیم. حالا OpenAI مدعی است مدل تازه‌اش، GPT-6 Astra، می‌تواند نقش همان دوست باتجربه را بازی کند؛ فقط از روی یک عکس، سریع‌تر و در بسیاری موارد دقیق‌تر از خیلی از آدم‌ها.

نکتهٔ مهم این‌جاست که این ادعا را خود OpenAI مطرح نکرده، بلکه یک آزمون مستقل و سخت‌گیرانه از سوی یک نهاد پژوهشی بی‌طرف آن را تأیید کرده است؛ نه یک ویدئوی تبلیغاتی، نه یک دمو از پیش آماده‌شده. همین موضوع باعث شده رسانه‌های فناوری این خبر را جدی‌تر از بسیاری اعلامیه‌های معمول شرکت‌های هوش مصنوعی تلقی کنند.

برای آشنایی بیشتر با این‌که OpenAI اساساً چه شرکتی است و چه مسیری را طی کرده تا به این نقطه برسد، می‌توانید این مطلب دربارهٔ OpenAI را در مرچت‌جی‌پی‌تی بخوانید.

۲. بنچمارک FAB دقیقاً چیست؟

گروه پژوهشی Epoch AI، که معمولاً بنچمارک‌های سخت‌گیرانه‌ای برای سنجش توانایی واقعی مدل‌های هوش مصنوعی طراحی می‌کند، این بار سراغ یک چالش بسیار عملی رفته است. آزمون FAB یا Furniture Assembly Benchmark شامل ۶۰ عکس از قطعات مختلف مبلمان ایکیا در حال مونتاژ است که در هرکدام، به‌صورت عمدی یک یا چند خطا کاشته شده است.

هدف این نیست که مدل فقط بگوید «یک جای کار اشتباه است»؛ مدل باید دقیقاً توضیح دهد کدام قطعه، در کدام مرحله، چطور اشتباه نصب شده است. این دقیقاً همان چیزی است که یک انسان باتجربه هنگام کمک به دوستش برای مونتاژ مبلمان انجام می‌دهد: نگاه می‌کند، با دفترچه مقایسه می‌کند، و می‌گوید «این پایه را برعکس بسته‌ای، باید بازش کنی».

چرا اصلاً ایکیا؟ چون قطعات این برند به‌خاطر سادگی ظاهری و در عین حال ریزه‌کاری‌های فراوان، الگوی خوبی برای سنجش استدلال فضایی هستند. هر اشتباه در مونتاژ ایکیا، مجموعه‌ای از دلایل بصری ظریف دارد: جهت یک پیچ، فاصلهٔ دو سوراخ، یا ترتیب نصب دو صفحه؛ دقیقاً همان نوع جزئیاتی که تا همین چند سال پیش، مدل‌های هوش مصنوعی به‌سادگی از کنارش رد می‌شدند.

روش آزمون چگونه بود؟

به هر مدل یک عکس، یک فایل PDF از دفترچهٔ راهنما، ابزار بزرگ‌نمایی تصویر و حتی دسترسی به یک مفسر پایتون داده شده تا در صورت نیاز، تحلیل تصویری انجام دهد. مدل‌ها اجازه داشتند تا ۸۰ گام در یک محیط ایزوله و عامل‌محور پیش بروند؛ یعنی می‌توانستند چند بار تصویر را بزرگ کنند، بخشی از آن را برش بزنند یا با کد مقایسهٔ پیکسلی انجام دهند تا به نتیجهٔ نهایی برسند.

در پایان، یک داور هوشمند دیگر به‌نام GPT-5.6 Sol تشخیص می‌داد که آیا توضیح مدل دربارهٔ خطا، درست و قابل‌قبول بوده یا نه؛ با معیارهای نسبتاً منعطف، اما همچنان سخت‌گیرانه‌تر از خیلی از آزمون‌های رایج بینایی ماشین. استفاده از یک مدل هوش مصنوعی دیگر به‌عنوان داور، خودش نشانه‌ای است از این‌که چقدر ارزیابی خودکار کیفیت پاسخ‌های متنی و تصویری پیچیده شده است.

۳. نتایج: چه کسی برنده شد؟

نتیجهٔ نهایی این آزمون یک جدول کوتاه اما پرمعنا بود:

مدل GPT-6 Astra از OpenAI با دقت ۸۰ درصد رتبهٔ اول را گرفت. مدل Claude Fable 5.1 از Anthropic با ۷۰ درصد در رتبهٔ دوم ایستاد. مدل Claude Opus 5 هم با ۶۱ درصد رتبهٔ سوم را از آن خود کرد. برای مقایسه، تا نوامبر ۲۰۲۵ یعنی تنها ده ماه پیش، بهترین نمرهٔ ثبت‌شده در این آزمون متعلق به Claude Opus 4.5 و تنها ۲۸ درصد بود.

یعنی در کمتر از یک سال، دقت مدل‌های برتر در این کار خاص، ۵۲ واحد درصد رشد کرده است؛ رقمی که در دنیای بنچمارک‌های هوش مصنوعی به‌ندرت دیده می‌شود. اگر دوست دارید ببینید مدل‌های مختلف چطور در آزمون‌های سرراست‌تر هم با هم رقابت می‌کنند، مقایسهٔ چت‌جی‌پی‌تی و دیپ‌سیک در شطرنج را هم بخوانید.

مقایسه دقت مدل‌های Claude Fable 5.1 و Claude Opus 5 در آزمون تشخیص خطای مونتاژ مبلمان ایکیا

۴. راز سرعت GPT-6 Astra

نکتهٔ جالب‌تر ماجرا فقط دقت نبود، سرعت هم بود. مدل GPT-6 Astra به‌طور میانگین هر عکس را در حدود سه دقیقه تحلیل می‌کرد؛ یعنی دو تا ده برابر سریع‌تر از رقبایش. این ترکیب دقت بالا و سرعت مناسب، نشان می‌دهد OpenAI روی بهینه‌سازی مدل برای کاربردهای عملی و نه فقط نمایشی، سرمایه‌گذاری کرده است.

البته این سرعت هنوز برای راهنمایی زندهٔ لحظه‌به‌لحظه در حین مونتاژ کافی نیست، اما به گفتهٔ پژوهشگران Epoch AI، فاصله دارد سریع بسته می‌شود.

۵. چرا برخی مدل‌ها بدتر عمل کردند؟

نتایج FAB فقط دربارهٔ برنده‌ها نبود؛ روی خطاهای رایج هم نور تاباند. مدل‌هایی مثل Gemini در برخی موارد بیش از حد محتاط عمل کردند و خطاهایی گزارش دادند که اصلاً وجود نداشت. در طرف مقابل، نسخه‌های قدیمی‌تر مدل‌های OpenAI و Claude بیشتر دچار مشکل عکس آن بودند: خیلی از اشتباهات واقعی را اصلاً تشخیص نمی‌دادند.

پژوهشگران همچنین دریافتند که پیچیدگی رسمی قطعه (بر اساس شاخص پیچیدگی ایکیا) لزوماً تعیین‌کنندهٔ سختی کار برای هوش مصنوعی نیست؛ بلکه ظرافت خطا و زاویهٔ دوربین، تأثیر بیشتری روی نتیجه داشتند. نکتهٔ دیگر این‌که در میان مدل‌های متن‌باز، Kimi K3 از چین بهترین عملکرد را داشت، اما همچنان حدود هفت ماه از مدل‌های پیشرو عقب‌تر بود؛ فاصله‌ای که نشان می‌دهد در حوزهٔ بینایی و استدلال فضایی، مدل‌های بسته همچنان جلوترند، هرچند این فاصله در حال کم‌شدن است.

۶. چرا این آزمون مهم است؟

بیشتر بنچمارک‌های رایج بینایی هوش مصنوعی روی توصیف تصویر یا پاسخ به سؤال دربارهٔ یک عکس تمرکز دارند؛ کارهایی که به استدلال فضایی عمیق نیاز ندارند. اما FAB یک خلأ واقعی را پر می‌کند: سنجش توانایی مدل در بازرسی دقیق و مقایسهٔ چندمرحله‌ای، شبیه به کاری که در تعمیر خودرو، سرویس لوازم خانگی یا حتی بازرسی صنعتی انجام می‌شود.

اگر می‌خواهید بدانید هوش مصنوعی در دنیای واقعی چقدر پیشرفته است و کجا هنوز محدودیت دارد، این مطلب دربارهٔ توان واقعی و محدودیت‌های هوش مصنوعی تحلیل خوبی به دست می‌دهد.

۷. این خبر برای کسب‌وکارها چه معنایی دارد؟

پیشرفت در استدلال فضایی فقط به کار خانگی محدود نمی‌شود. کسب‌وکارهایی که با بازرسی محصول، کنترل کیفیت، یا پشتیبانی فنی از راه دور سروکار دارند، می‌توانند از همین نوع مدل‌ها برای خودکارسازی بخشی از فرایندهای بازرسی بصری استفاده کنند. تصور کنید یک کارگاه تعمیر لوازم خانگی که مشتری فقط یک عکس از دستگاه خراب می‌فرستد و هوش مصنوعی در چند ثانیه احتمال علت خرابی را تشخیص می‌دهد؛ یا یک خط تولید که هر قطعه را پیش از بسته‌بندی با یک مدل بینایی بررسی می‌کند تا خطای انسانی کاهش یابد.

برای دیدن تصویر بزرگ‌تر این‌که چرا هوش مصنوعی این‌قدر برای کسب‌وکارها مهم شده و چه فرصت‌های دیگری پیش روی صاحبان کسب‌وکار قرار دارد، این راهنما دربارهٔ اهمیت هوش مصنوعی در کسب‌وکار را از دست ندهید.

نکتهٔ مهم دیگر این است که کیفیت دستورالعملی که به مدل داده می‌شود، مستقیماً روی دقت نتیجه اثر دارد؛ درست مثل نوشتن یک پرامپت خوب برای چت‌جی‌پی‌تی. در آزمون FAB هم، مدل‌هایی که بهتر توانستند دفترچهٔ راهنما را «بخوانند» و با عکس تطبیق دهند، نتیجهٔ بهتری گرفتند. اگر تازه‌کار هستید و می‌خواهید یاد بگیرید چطور از ابزارهای هوش مصنوعی درخواست‌های دقیق‌تری بسازید، آموزش نوشتن پرامپت برای مبتدی‌ها نقطهٔ شروع خوبی است.

۸. مسیر بعدی چیست؟

تیم Epoch AI اعلام کرده قصد دارد نسخهٔ سخت‌تری از این بنچمارک را با قطعات پیچیده‌تر و زوایای دوربین دشوارتر منتشر کند تا فاصلهٔ باقی‌ماندهٔ مدل‌های برتر با دقت کامل روشن‌تر شود. از سوی دیگر، شرکت‌هایی مثل OpenAI و Anthropic هم به‌احتمال زیاد این نوع آزمون‌های عملی را به بخشی جدی از فرایند توسعهٔ نسل بعدی مدل‌های خود تبدیل خواهند کرد؛ چون برخلاف بسیاری بنچمارک‌های آکادمیک، نتیجهٔ آن مستقیماً قابل لمس برای کاربر روزمره است.

روند رقابتی میان OpenAI، Anthropic، Google و بازیگران متن‌باز نشان می‌دهد این حوزه به‌این‌زودی‌ها آرام نخواهد گرفت؛ هر هفته یک رکورد جدید می‌شکند و رکورد بعدی هم چندان دور نیست.

کاربرد آیندهٔ بینایی هوش مصنوعی در بازرسی و تعمیر وسایل واقعی مانند خودرو و لوازم خانگی

۹. آیا باید هیجان‌زده شویم یا محتاط؟

خبرهای این‌چنینی گاهی با اغراق همراه می‌شوند و باید بین هیاهوی بازاریابی و پیشرفت واقعی مهندسی تفاوت گذاشت. دقت ۸۰ درصد یعنی هنوز یک از هر پنج مورد اشتباه تشخیص داده می‌شود یا اصلاً دیده نمی‌شود؛ برای کاربرد صنعتی جدی، این رقم باید بالاتر برود. برای نگاهی واقع‌بینانه‌تر به فاصلهٔ میان تبلیغات هوش مصنوعی و کار مهندسی واقعی پشت آن، این مطلب دربارهٔ توهم هوش مصنوعی در برابر مهندسی واقعی خواندنی است.

سؤالات متداول

بنچمارک FAB چیست؟
آزمونی طراحی‌شده توسط Epoch AI است که در آن مدل‌های هوش مصنوعی باید از روی عکس مبلمان نیمه‌ساز ایکیا، خطاهای مونتاژ عمدی را پیدا کنند.

GPT-6 Astra چه دقتی در این آزمون داشت؟
این مدل از OpenAI با دقت ۸۰ درصد در صدر جدول ایستاد و هر عکس را در حدود سه دقیقه تحلیل کرد.

مدل‌های Claude چه رتبه‌ای گرفتند؟
Claude Fable 5.1 با ۷۰ درصد دوم شد و Claude Opus 5 با ۶۱ درصد سوم شد؛ هر دو محصول Anthropic هستند.

آیا این یعنی هوش مصنوعی می‌تواند به‌جای انسان مبلمان مونتاژ کند؟
نه هنوز. مدل فعلاً فقط می‌تواند از روی عکس خطا را تشخیص دهد، نه این‌که فیزیکی مبلمان را بسازد یا تعمیر کند.

جمع‌بندی. جهش از ۲۸ به ۸۰ درصد در کمتر از یک سال نشان می‌دهد بینایی هوش مصنوعی در حال نزدیک‌شدن به سطحی از استدلال فضایی است که کاربردهای واقعی و روزمره را ممکن می‌کند؛ از سرهم‌کردن مبلمان ساده تا بازرسی‌های فنی پیچیده‌تر. برای دنبال‌کردن ادامهٔ این مسابقهٔ نفس‌گیر بین OpenAI و Anthropic و بقیهٔ بازیگران این حوزه، اخبار روزانهٔ هوش مصنوعی در مرچت‌جی‌پی‌تی را دنبال کنید یا به کانال تلگرام @MrChatGPT_IR بپیوندید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *