مدل تازهٔ OpenAI، یعنی GPT-6 Astra، در یک آزمون عجیب و کاربردی از دل مبلمان ایکیا سربلند بیرون آمد؛ آزمونی که نشان میدهد بینایی هوش مصنوعی چقدر به دنیای واقعی نزدیک شده است.

لیست مطالب
۱. ماجرا از کجا شروع شد؟
همهٔ ما یک بار تجربهٔ سرهمکردن مبلمان ایکیا را داشتهایم: پیچهای اضافه، صفحهای که برعکس نصب شده، یا لولایی که جای اشتباه رفته است. معمولاً در چنین لحظهای یا دوباره دفترچهٔ راهنما را ورق میزنیم، یا از یک دوست باتجربه کمک میخواهیم. حالا OpenAI مدعی است مدل تازهاش، GPT-6 Astra، میتواند نقش همان دوست باتجربه را بازی کند؛ فقط از روی یک عکس، سریعتر و در بسیاری موارد دقیقتر از خیلی از آدمها.
نکتهٔ مهم اینجاست که این ادعا را خود OpenAI مطرح نکرده، بلکه یک آزمون مستقل و سختگیرانه از سوی یک نهاد پژوهشی بیطرف آن را تأیید کرده است؛ نه یک ویدئوی تبلیغاتی، نه یک دمو از پیش آمادهشده. همین موضوع باعث شده رسانههای فناوری این خبر را جدیتر از بسیاری اعلامیههای معمول شرکتهای هوش مصنوعی تلقی کنند.
برای آشنایی بیشتر با اینکه OpenAI اساساً چه شرکتی است و چه مسیری را طی کرده تا به این نقطه برسد، میتوانید این مطلب دربارهٔ OpenAI را در مرچتجیپیتی بخوانید.
۲. بنچمارک FAB دقیقاً چیست؟
گروه پژوهشی Epoch AI، که معمولاً بنچمارکهای سختگیرانهای برای سنجش توانایی واقعی مدلهای هوش مصنوعی طراحی میکند، این بار سراغ یک چالش بسیار عملی رفته است. آزمون FAB یا Furniture Assembly Benchmark شامل ۶۰ عکس از قطعات مختلف مبلمان ایکیا در حال مونتاژ است که در هرکدام، بهصورت عمدی یک یا چند خطا کاشته شده است.
هدف این نیست که مدل فقط بگوید «یک جای کار اشتباه است»؛ مدل باید دقیقاً توضیح دهد کدام قطعه، در کدام مرحله، چطور اشتباه نصب شده است. این دقیقاً همان چیزی است که یک انسان باتجربه هنگام کمک به دوستش برای مونتاژ مبلمان انجام میدهد: نگاه میکند، با دفترچه مقایسه میکند، و میگوید «این پایه را برعکس بستهای، باید بازش کنی».
چرا اصلاً ایکیا؟ چون قطعات این برند بهخاطر سادگی ظاهری و در عین حال ریزهکاریهای فراوان، الگوی خوبی برای سنجش استدلال فضایی هستند. هر اشتباه در مونتاژ ایکیا، مجموعهای از دلایل بصری ظریف دارد: جهت یک پیچ، فاصلهٔ دو سوراخ، یا ترتیب نصب دو صفحه؛ دقیقاً همان نوع جزئیاتی که تا همین چند سال پیش، مدلهای هوش مصنوعی بهسادگی از کنارش رد میشدند.
روش آزمون چگونه بود؟
به هر مدل یک عکس، یک فایل PDF از دفترچهٔ راهنما، ابزار بزرگنمایی تصویر و حتی دسترسی به یک مفسر پایتون داده شده تا در صورت نیاز، تحلیل تصویری انجام دهد. مدلها اجازه داشتند تا ۸۰ گام در یک محیط ایزوله و عاملمحور پیش بروند؛ یعنی میتوانستند چند بار تصویر را بزرگ کنند، بخشی از آن را برش بزنند یا با کد مقایسهٔ پیکسلی انجام دهند تا به نتیجهٔ نهایی برسند.
در پایان، یک داور هوشمند دیگر بهنام GPT-5.6 Sol تشخیص میداد که آیا توضیح مدل دربارهٔ خطا، درست و قابلقبول بوده یا نه؛ با معیارهای نسبتاً منعطف، اما همچنان سختگیرانهتر از خیلی از آزمونهای رایج بینایی ماشین. استفاده از یک مدل هوش مصنوعی دیگر بهعنوان داور، خودش نشانهای است از اینکه چقدر ارزیابی خودکار کیفیت پاسخهای متنی و تصویری پیچیده شده است.
۳. نتایج: چه کسی برنده شد؟
نتیجهٔ نهایی این آزمون یک جدول کوتاه اما پرمعنا بود:
مدل GPT-6 Astra از OpenAI با دقت ۸۰ درصد رتبهٔ اول را گرفت. مدل Claude Fable 5.1 از Anthropic با ۷۰ درصد در رتبهٔ دوم ایستاد. مدل Claude Opus 5 هم با ۶۱ درصد رتبهٔ سوم را از آن خود کرد. برای مقایسه، تا نوامبر ۲۰۲۵ یعنی تنها ده ماه پیش، بهترین نمرهٔ ثبتشده در این آزمون متعلق به Claude Opus 4.5 و تنها ۲۸ درصد بود.
یعنی در کمتر از یک سال، دقت مدلهای برتر در این کار خاص، ۵۲ واحد درصد رشد کرده است؛ رقمی که در دنیای بنچمارکهای هوش مصنوعی بهندرت دیده میشود. اگر دوست دارید ببینید مدلهای مختلف چطور در آزمونهای سرراستتر هم با هم رقابت میکنند، مقایسهٔ چتجیپیتی و دیپسیک در شطرنج را هم بخوانید.

۴. راز سرعت GPT-6 Astra
نکتهٔ جالبتر ماجرا فقط دقت نبود، سرعت هم بود. مدل GPT-6 Astra بهطور میانگین هر عکس را در حدود سه دقیقه تحلیل میکرد؛ یعنی دو تا ده برابر سریعتر از رقبایش. این ترکیب دقت بالا و سرعت مناسب، نشان میدهد OpenAI روی بهینهسازی مدل برای کاربردهای عملی و نه فقط نمایشی، سرمایهگذاری کرده است.
البته این سرعت هنوز برای راهنمایی زندهٔ لحظهبهلحظه در حین مونتاژ کافی نیست، اما به گفتهٔ پژوهشگران Epoch AI، فاصله دارد سریع بسته میشود.
۵. چرا برخی مدلها بدتر عمل کردند؟
نتایج FAB فقط دربارهٔ برندهها نبود؛ روی خطاهای رایج هم نور تاباند. مدلهایی مثل Gemini در برخی موارد بیش از حد محتاط عمل کردند و خطاهایی گزارش دادند که اصلاً وجود نداشت. در طرف مقابل، نسخههای قدیمیتر مدلهای OpenAI و Claude بیشتر دچار مشکل عکس آن بودند: خیلی از اشتباهات واقعی را اصلاً تشخیص نمیدادند.
پژوهشگران همچنین دریافتند که پیچیدگی رسمی قطعه (بر اساس شاخص پیچیدگی ایکیا) لزوماً تعیینکنندهٔ سختی کار برای هوش مصنوعی نیست؛ بلکه ظرافت خطا و زاویهٔ دوربین، تأثیر بیشتری روی نتیجه داشتند. نکتهٔ دیگر اینکه در میان مدلهای متنباز، Kimi K3 از چین بهترین عملکرد را داشت، اما همچنان حدود هفت ماه از مدلهای پیشرو عقبتر بود؛ فاصلهای که نشان میدهد در حوزهٔ بینایی و استدلال فضایی، مدلهای بسته همچنان جلوترند، هرچند این فاصله در حال کمشدن است.
۶. چرا این آزمون مهم است؟
بیشتر بنچمارکهای رایج بینایی هوش مصنوعی روی توصیف تصویر یا پاسخ به سؤال دربارهٔ یک عکس تمرکز دارند؛ کارهایی که به استدلال فضایی عمیق نیاز ندارند. اما FAB یک خلأ واقعی را پر میکند: سنجش توانایی مدل در بازرسی دقیق و مقایسهٔ چندمرحلهای، شبیه به کاری که در تعمیر خودرو، سرویس لوازم خانگی یا حتی بازرسی صنعتی انجام میشود.
اگر میخواهید بدانید هوش مصنوعی در دنیای واقعی چقدر پیشرفته است و کجا هنوز محدودیت دارد، این مطلب دربارهٔ توان واقعی و محدودیتهای هوش مصنوعی تحلیل خوبی به دست میدهد.
۷. این خبر برای کسبوکارها چه معنایی دارد؟
پیشرفت در استدلال فضایی فقط به کار خانگی محدود نمیشود. کسبوکارهایی که با بازرسی محصول، کنترل کیفیت، یا پشتیبانی فنی از راه دور سروکار دارند، میتوانند از همین نوع مدلها برای خودکارسازی بخشی از فرایندهای بازرسی بصری استفاده کنند. تصور کنید یک کارگاه تعمیر لوازم خانگی که مشتری فقط یک عکس از دستگاه خراب میفرستد و هوش مصنوعی در چند ثانیه احتمال علت خرابی را تشخیص میدهد؛ یا یک خط تولید که هر قطعه را پیش از بستهبندی با یک مدل بینایی بررسی میکند تا خطای انسانی کاهش یابد.
برای دیدن تصویر بزرگتر اینکه چرا هوش مصنوعی اینقدر برای کسبوکارها مهم شده و چه فرصتهای دیگری پیش روی صاحبان کسبوکار قرار دارد، این راهنما دربارهٔ اهمیت هوش مصنوعی در کسبوکار را از دست ندهید.
نکتهٔ مهم دیگر این است که کیفیت دستورالعملی که به مدل داده میشود، مستقیماً روی دقت نتیجه اثر دارد؛ درست مثل نوشتن یک پرامپت خوب برای چتجیپیتی. در آزمون FAB هم، مدلهایی که بهتر توانستند دفترچهٔ راهنما را «بخوانند» و با عکس تطبیق دهند، نتیجهٔ بهتری گرفتند. اگر تازهکار هستید و میخواهید یاد بگیرید چطور از ابزارهای هوش مصنوعی درخواستهای دقیقتری بسازید، آموزش نوشتن پرامپت برای مبتدیها نقطهٔ شروع خوبی است.
۸. مسیر بعدی چیست؟
تیم Epoch AI اعلام کرده قصد دارد نسخهٔ سختتری از این بنچمارک را با قطعات پیچیدهتر و زوایای دوربین دشوارتر منتشر کند تا فاصلهٔ باقیماندهٔ مدلهای برتر با دقت کامل روشنتر شود. از سوی دیگر، شرکتهایی مثل OpenAI و Anthropic هم بهاحتمال زیاد این نوع آزمونهای عملی را به بخشی جدی از فرایند توسعهٔ نسل بعدی مدلهای خود تبدیل خواهند کرد؛ چون برخلاف بسیاری بنچمارکهای آکادمیک، نتیجهٔ آن مستقیماً قابل لمس برای کاربر روزمره است.
روند رقابتی میان OpenAI، Anthropic، Google و بازیگران متنباز نشان میدهد این حوزه بهاینزودیها آرام نخواهد گرفت؛ هر هفته یک رکورد جدید میشکند و رکورد بعدی هم چندان دور نیست.

۹. آیا باید هیجانزده شویم یا محتاط؟
خبرهای اینچنینی گاهی با اغراق همراه میشوند و باید بین هیاهوی بازاریابی و پیشرفت واقعی مهندسی تفاوت گذاشت. دقت ۸۰ درصد یعنی هنوز یک از هر پنج مورد اشتباه تشخیص داده میشود یا اصلاً دیده نمیشود؛ برای کاربرد صنعتی جدی، این رقم باید بالاتر برود. برای نگاهی واقعبینانهتر به فاصلهٔ میان تبلیغات هوش مصنوعی و کار مهندسی واقعی پشت آن، این مطلب دربارهٔ توهم هوش مصنوعی در برابر مهندسی واقعی خواندنی است.
سؤالات متداول
بنچمارک FAB چیست؟
آزمونی طراحیشده توسط Epoch AI است که در آن مدلهای هوش مصنوعی باید از روی عکس مبلمان نیمهساز ایکیا، خطاهای مونتاژ عمدی را پیدا کنند.
GPT-6 Astra چه دقتی در این آزمون داشت؟
این مدل از OpenAI با دقت ۸۰ درصد در صدر جدول ایستاد و هر عکس را در حدود سه دقیقه تحلیل کرد.
مدلهای Claude چه رتبهای گرفتند؟
Claude Fable 5.1 با ۷۰ درصد دوم شد و Claude Opus 5 با ۶۱ درصد سوم شد؛ هر دو محصول Anthropic هستند.
آیا این یعنی هوش مصنوعی میتواند بهجای انسان مبلمان مونتاژ کند؟
نه هنوز. مدل فعلاً فقط میتواند از روی عکس خطا را تشخیص دهد، نه اینکه فیزیکی مبلمان را بسازد یا تعمیر کند.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
