کلود اوپوس ۵ در حال ساخت صحنه سه‌بعدی ارباب حلقه‌ها با Three.js

کلود اوپوس ۵ با ۱۰ دلار یک دنیای سه‌بعدی از ارباب حلقه‌ها ساخت؛ پایان عصر تست پلیکان

هوش مصنوعی · اخبار

آندری کارپثی با ۱۰ دلار بودجه از کلود اوپوس ۵ خواست پاراگراف اول رمان «ارباب حلقه‌ها» را به یک صحنه‌ی سه‌بعدی زنده تبدیل کند؛ نتیجه، بحثی داغ درباره‌ی پایان عصر تست‌های ساده‌ی هوش مصنوعی بود.

چکیده. در تاریخ دوم اوت ۲۰۲۶، آندری کارپثی، از بنیان‌گذاران OpenAI، آزمایشی با کلود اوپوس ۵ (Claude Opus 5) ساخته‌ی Anthropic منتشر کرد: با تنها یک میلیون توکن بودجه (حدود ۱۰ دلار)، مدل نزدیک به دو ساعت کار کرد و ۵۵۰۰ خط کد Three.js نوشت تا صحنه‌ی آغازین ارباب حلقه‌ها را به‌صورت سه‌بعدی و رویه‌ای بازسازی کند. کارپثی این آزمایش را نشانه‌ی گذار از تست‌های ساده مثل «پلیکان روی دوچرخه» به محک‌های پیوسته و عامل‌محور دانست، اما یک ضعف کلیدی هم آشکار شد: ناتوانی مدل در دیدن مؤثر خروجی بصری خودش.

کلود اوپوس ۵ در حال ساخت صحنه سه‌بعدی ارباب حلقه‌ها با Three.js

۱. چه اتفاقی افتاد؟ ماجرای توییت کارپثی

روز یکشنبه، دوم اوت ۲۰۲۶، آندری کارپثی در پلتفرم ایکس رشته‌توییتی منتشر کرد که به‌سرعت در میان مهندسان نرم‌افزار و پژوهشگران هوش مصنوعی دست‌به‌دست شد. او نوشت که صنعت هوش مصنوعی «دارد قلمرو تست‌هایی مثل ترسیم svg یک پلیکان سوار بر دوچرخه را پشت سر می‌گذارد». به‌جای این آزمون‌های کوچک و تک‌مرحله‌ای که سال‌ها ابزار محبوب سنجش مدل‌های زبانی بودند، کارپثی چالشی متفاوت طراحی کرد: به کلود اوپوس ۵، تنها پاراگراف نخست رمان کلاسیک ارباب حلقه‌ها اثر جی. آر. آر. تالکین را داد و از آن خواست این متن ادبی را به یک صحنه‌ی سه‌بعدی و تعاملی با کتابخانه‌ی جاوااسکریپت Three.js تبدیل کند.

او در این آزمایش یک محدودیت مشخص هم تعیین کرد: بودجه‌ای برابر با یک میلیون توکن، معادل حدود ۱۰ دلار هزینه‌ی واقعی محاسباتی. این قید بودجه دقیقاً همان چیزی بود که آزمایش را از یک دموی ساده‌ی «هوش مصنوعی می‌تواند کد بنویسد» به یک پرسش اقتصادی و عملی تبدیل کرد: با هزینه‌ای ناچیز، یک مدل زبانی چقدر می‌تواند بسازد؟

۲. کلود اوپوس ۵ دقیقاً چه کاری کرد؟

کلود اوپوس ۵ نزدیک به دو ساعت به‌صورت کاملاً مستقل روی این تکلیف کار کرد. در پایان، مدل ۵۵۰۰ خط کد جاوااسکریپت تولید کرده بود که به‌شکل رویه‌ای (procedural) ده‌ها شیء چندضلعی را در مختصات سه‌بعدی (x، y، z) چیده، برایشان بافت و نور تعریف کرده و سپس با کد انیمیشن، حرکت و روایت صحنه را زنده کرده بود. خروجی نهایی یک دنیای کوچک اما قابل‌کاوش بود که تلاش می‌کرد فضای آغازین حماسه‌ی تالکین — دشت‌ها، نور کم‌رنگ غروب و حس آغاز یک سفر بزرگ — را در قالب گرافیک سه‌بعدی مرورگر بازتاب دهد.

خود کارپثی نتیجه را «کمی ناشیانه، اما جذاب» توصیف کرد. به گفته‌ی او، نکته‌ی درخور توجه این نبود که خروجی بی‌نقص باشد، بلکه این بود که مدل باید «اشیای چندضلعی را در مختصات سه‌بعدی بچیند و کدی بنویسد که همه‌ی آن‌ها را متحرک کند» — کاری که پیش از این تصور می‌شد نیازمند ساعت‌ها کار مستقیم یک برنامه‌نویس یا طراح گرافیک سه‌بعدی است. اگر می‌خواهید با نحوه‌ی نوشتن دستورهای دقیق برای چنین کارهایی آشنا شوید، راهنمای نوشتن پرامپت برای مبتدیان نقطه‌ی شروع خوبی است.

۳. اقتصاد جدید هوش مصنوعی مولد: یک دنیای سه‌بعدی با ۱۰ دلار

شاید مهم‌ترین بخش این ماجرا، بُعد اقتصادی آن باشد. تا همین چند سال پیش، ساخت یک صحنه‌ی سه‌بعدی تعاملی — حتی در ساده‌ترین شکل — نیازمند تیمی از طراحان، برنامه‌نویسان گرافیک و ساعت‌ها زمان بود. حالا، طبق آزمایش کارپثی، همین کار را می‌توان با هزینه‌ای در حد یک وعده غذای ساده و در عرض چند ساعت به یک مدل زبانی سپرد. این تغییر مقیاس هزینه دقیقاً همان چیزی است که تحلیل‌گران آن را عامل اصلی گسترش سریع کاربردهای هوش مصنوعی در کسب‌وکارها می‌دانند؛ موضوعی که در مقاله‌ی چرا هوش مصنوعی برای کسب‌وکارها مهم است با جزئیات بیشتری بررسی شده.

وقتی هزینه‌ی تولید محتوای پیچیده این‌قدر پایین می‌آید، مرز میان «ایده» و «محصول آماده» هم کم‌رنگ‌تر می‌شود. کارپثی در توییت‌های خود تأکید کرد که مدل‌های امروزی «استقامت و صبر» انجام پروژه‌هایی را دارند که انسان‌ها معمولاً به‌دلیل زمان و انرژی موردنیاز از انجامشان صرف‌نظر می‌کنند — نکته‌ای که پیامدهای بلندمدتی برای صنعت نرم‌افزار و طراحی دیجیتال دارد.

هزینه یک میلیون توکن هوش مصنوعی برای تولید کد سه‌بعدی

۴. پایان عصر «پلیکان روی دوچرخه»؛ محک جدید چیست؟

تست «یک svg از پلیکان روی دوچرخه بکش» یکی از سرگرم‌کننده‌ترین و در عین حال معروف‌ترین روش‌های غیررسمی برای سنجش توان مدل‌های زبانی در سال‌های گذشته بود؛ چون هم ساده بود و هم به‌خوبی نقاط ضعف مدل‌ها را در استدلال هندسی نشان می‌داد. اما به گفته‌ی کارپثی، این نسل از تست‌ها دیگر برای مدل‌های پیشرفته‌ای مثل کلود اوپوس ۵ کافی نیست؛ چون این مدل‌ها می‌توانند در یک پاسخ تک‌مرحله‌ای، به‌سادگی چنین کارهایی را انجام دهند.

محک نسل تازه، به گفته‌ی او، باید حول سه محور بچرخد: کارهای پیوسته و طولانی‌مدت (نه یک پاسخ آنی)، استقلال عامل‌محور (agentic) در تصمیم‌گیری، و محدودیت منابع مشخص مثل بودجه‌ی توکن یا زمان. به بیان دیگر، پرسش کلیدی دیگر این نیست که «آیا مدل یک کار کوچک را درست انجام می‌دهد؟» بلکه این است که «با چند ساعت زمان و بودجه‌ای معین، مدل چقدر می‌تواند بسازد؟». این چارچوب تازه‌ی ارزیابی، شباهت زیادی به روشی دارد که در مقاله‌ی توان و محدودیت‌های واقعی هوش مصنوعی درباره‌ی سنجش عملکرد واقعی مدل‌ها در دنیای واقعی مطرح شده است.

کلود اوپوس ۵ در برابر جمینای، گراک و کوپایلوت

این آزمایش هم‌زمان با رقابت فشرده‌ی چند غول فناوری بر سر برتری در تولید کد منتشر شد. گوگل با جمینای، xAI با گراک، مایکروسافت با کوپایلوت و OpenAI با چت‌جی‌پی‌تی همگی روی توانایی عامل‌های خودکار در انجام وظایف پیچیده‌ی برنامه‌نویسی سرمایه‌گذاری سنگینی کرده‌اند. آزمایش کارپثی، اگرچه به‌طور خاص روی کلود اوپوس ۵ متمرکز بود، اما به‌طور ضمنی معیار تازه‌ای برای مقایسه‌ی همه‌ی این مدل‌ها در آینده تعیین می‌کند: نه صرفاً دقت در یک تسک کوچک، بلکه کیفیت و پایداری در پروژه‌های چندساعته.

۵. ضعف پنهان: هوش مصنوعی که نمی‌تواند خروجی بصری خودش را ببیند

باوجود همه‌ی این پیشرفت، آزمایش یک محدودیت اساسی را هم آشکار کرد. کلود اوپوس ۵، علی‌رغم توانایی نوشتن کد پیچیده‌ی سه‌بعدی، هنوز نمی‌تواند خروجی بصری کار خودش را به‌طور بومی و مؤثر «ببیند» یا ارزیابی کند. برای بررسی نتیجه، مدل مجبور بود به‌طور مکرر از صحنه اسکرین‌شات بگیرد، آن را تحلیل کند و سپس کد را اصلاح کند — فرایندی کند، غیرمستقیم و پر از آزمون‌وخطا که بخش زیادی از «ناشیانه» بودن رندر نهایی را توضیح می‌دهد.

به گفته‌ی تحلیل‌گران این حوزه، عامل‌های هوش مصنوعی امروز هنوز نمی‌توانند ویدیو را به‌شکل بومی و پیوسته درک کنند یا در یک محیط تعاملی مثل یک بازی رایانه‌ای، به‌صورت زنده و لحظه‌به‌لحظه «بازی» کنند. پر کردن همین شکاف — یعنی دادن «چشم» واقعی و فوری به مدل‌های زبانی برای دیدن خروجی خودشان — به احتمال زیاد یکی از مهم‌ترین جبهه‌های رقابت نسل بعدی مدل‌های هوش مصنوعی مولد خواهد بود.

پایان دوران تست پلیکان روی دوچرخه در ارزیابی مدل‌های هوش مصنوعی

۶. این خبر برای آینده‌ی کدنویسی با هوش مصنوعی چه معنایی دارد؟

این آزمایش در بستری بزرگ‌تر و بسیار عملی‌تر هم معنا پیدا می‌کند. طبق گزارش‌های منتشرشده، ابزارهای کدنویسی مبتنی بر هوش مصنوعی هم‌اکنون در شرکت‌هایی مانند Airbnb مسئول تولید ۶۰ تا ۸۰ درصد از کدهای جدید هستند. مدیرعامل Anthropic نیز پیش‌بینی کرده که در بازه‌ی سه تا شش ماه آینده، تا ۹۰ درصد از فرایند توسعه‌ی نرم‌افزار می‌تواند به هوش مصنوعی سپرده شود. اگر این پیش‌بینی درست از آب دربیاید، نقش برنامه‌نویسان انسانی به‌سرعت از «نویسنده‌ی کد» به «هدایت‌گر و ویراستار» عامل‌های هوش مصنوعی تغییر خواهد کرد؛ روندی که در مقاله‌ی توهم برنامه‌نویس تنها در برابر مهندس واقعی از زاویه‌ای دیگر بررسی شده است.

نکته‌ی مهم‌تر این‌که این توانایی دیگر به «نوشتن کد» محدود نمی‌ماند. آزمایش کارپثی نشان داد مدل‌هایی مانند کلود اوپوس ۵ به‌تدریج توان ساخت دنیاهای دیجیتال کاملاً سفارشی، از صحنه‌های بازی گرفته تا شبیه‌سازی‌های آموزشی، را هم به دست می‌آورند؛ کاری که پیش از این تنها با تیم‌های تخصصی طراحی و انیمیشن ممکن بود.

۷. چرا این آزمایش برای کاربران فارسی‌زبان هوش مصنوعی مهم است؟

برای کاربران ایرانی که با ابزارهایی مثل چت‌جی‌پی‌تی، کلود یا جمینای کار می‌کنند، این خبر یک پیام عملی هم دارد: هرچه پرامپت‌ها دقیق‌تر و ساختاریافته‌تر باشند، مدل می‌تواند در پروژه‌های بلندمدت‌تر و پیچیده‌تر عملکرد بهتری داشته باشد. آزمایش کارپثی در واقع یک پرامپت خلاقانه‌ی بلندمدت بود که به مدل اجازه داد به‌جای پاسخ سریع، مسیر خودش را برای رسیدن به هدف پیدا کند. علاقه‌مندان می‌توانند برای آشنایی بیشتر با این تکنیک‌ها به آموزش‌های چت‌جی‌پی‌تی در سایت مراجعه کنند، یا در بخش اخبار هوش مصنوعی روند این رقابت فناوری را دنبال کنند.

از سوی دیگر، رقابت میان مدل‌های بزرگ زبانی برای بهترین عملکرد در کدنویسی و خلاقیت بصری، به‌طور غیرمستقیم روی کیفیت ابزارهایی که کاربران روزمره استفاده می‌کنند هم اثر می‌گذارد. برای مقایسه‌ی دقیق‌تر رویکردهای متفاوت شرکت‌های بزرگ در طراحی مدل‌های هوش مصنوعی، مقاله‌ی مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک و همچنین OpenAI چیست و چگونه کار می‌کند منابع خوبی برای درک بهتر این اکوسیستم هستند.

۸. سوالات متداول

کلود اوپوس ۵ دقیقاً چه کاری انجام داد؟
مدل با دریافت پاراگراف اول رمان ارباب حلقه‌ها و بودجه‌ای معادل یک میلیون توکن (حدود ۱۰ دلار)، طی نزدیک به دو ساعت، ۵۵۰۰ خط کد Three.js نوشت که یک صحنه‌ی سه‌بعدی و متحرک از آن روایت را می‌ساخت.

چرا این آزمایش این‌قدر مهم تلقی شد؟
چون به‌جای یک تست کوچک و تک‌مرحله‌ای مثل «پلیکان روی دوچرخه»، توانایی مدل در کار مستقل، طولانی‌مدت و محدود به بودجه را می‌سنجید؛ چیزی نزدیک‌تر به سناریوهای واقعی استفاده از هوش مصنوعی در پروژه‌های واقعی.

مهم‌ترین ضعفی که در این آزمایش دیده شد چه بود؟
ناتوانی مدل در دیدن مؤثر و بومی خروجی بصری خودش؛ کلود اوپوس ۵ برای بررسی نتیجه‌ی کارش مجبور به تکیه بر اسکرین‌شات و آزمون‌وخطا بود.

آیا مدل‌های دیگر مثل جمینای یا گراک هم می‌توانند کار مشابهی انجام دهند؟
شرکت‌هایی مثل گوگل، xAI و مایکروسافت هم روی توانایی عامل‌های خودشان در کارهای پیچیده و طولانی‌مدت سرمایه‌گذاری می‌کنند، اما این آزمایش خاص تنها روی کلود اوپوس ۵ انجام شد.

این آزمایش ساده‌ی آندری کارپثی نشان داد که مسیر ارزیابی هوش مصنوعی از تست‌های کوچک و سریع به سمت پروژه‌های پیوسته، مستقل و محدود به بودجه در حال حرکت است — و کلود اوپوس ۵ یکی از نخستین مدل‌هایی است که این مسیر تازه را به‌روشنی نشان داد. برای دنبال کردن جدیدترین اخبار و تحلیل‌های هوش مصنوعی، ما را در کانال @MrChatGPT_IR دنبال کنید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *