آندری کارپثی با ۱۰ دلار بودجه از کلود اوپوس ۵ خواست پاراگراف اول رمان «ارباب حلقهها» را به یک صحنهی سهبعدی زنده تبدیل کند؛ نتیجه، بحثی داغ دربارهی پایان عصر تستهای سادهی هوش مصنوعی بود.

لیست مطالب
۱. چه اتفاقی افتاد؟ ماجرای توییت کارپثی
روز یکشنبه، دوم اوت ۲۰۲۶، آندری کارپثی در پلتفرم ایکس رشتهتوییتی منتشر کرد که بهسرعت در میان مهندسان نرمافزار و پژوهشگران هوش مصنوعی دستبهدست شد. او نوشت که صنعت هوش مصنوعی «دارد قلمرو تستهایی مثل ترسیم svg یک پلیکان سوار بر دوچرخه را پشت سر میگذارد». بهجای این آزمونهای کوچک و تکمرحلهای که سالها ابزار محبوب سنجش مدلهای زبانی بودند، کارپثی چالشی متفاوت طراحی کرد: به کلود اوپوس ۵، تنها پاراگراف نخست رمان کلاسیک ارباب حلقهها اثر جی. آر. آر. تالکین را داد و از آن خواست این متن ادبی را به یک صحنهی سهبعدی و تعاملی با کتابخانهی جاوااسکریپت Three.js تبدیل کند.
او در این آزمایش یک محدودیت مشخص هم تعیین کرد: بودجهای برابر با یک میلیون توکن، معادل حدود ۱۰ دلار هزینهی واقعی محاسباتی. این قید بودجه دقیقاً همان چیزی بود که آزمایش را از یک دموی سادهی «هوش مصنوعی میتواند کد بنویسد» به یک پرسش اقتصادی و عملی تبدیل کرد: با هزینهای ناچیز، یک مدل زبانی چقدر میتواند بسازد؟
۲. کلود اوپوس ۵ دقیقاً چه کاری کرد؟
کلود اوپوس ۵ نزدیک به دو ساعت بهصورت کاملاً مستقل روی این تکلیف کار کرد. در پایان، مدل ۵۵۰۰ خط کد جاوااسکریپت تولید کرده بود که بهشکل رویهای (procedural) دهها شیء چندضلعی را در مختصات سهبعدی (x، y، z) چیده، برایشان بافت و نور تعریف کرده و سپس با کد انیمیشن، حرکت و روایت صحنه را زنده کرده بود. خروجی نهایی یک دنیای کوچک اما قابلکاوش بود که تلاش میکرد فضای آغازین حماسهی تالکین — دشتها، نور کمرنگ غروب و حس آغاز یک سفر بزرگ — را در قالب گرافیک سهبعدی مرورگر بازتاب دهد.
خود کارپثی نتیجه را «کمی ناشیانه، اما جذاب» توصیف کرد. به گفتهی او، نکتهی درخور توجه این نبود که خروجی بینقص باشد، بلکه این بود که مدل باید «اشیای چندضلعی را در مختصات سهبعدی بچیند و کدی بنویسد که همهی آنها را متحرک کند» — کاری که پیش از این تصور میشد نیازمند ساعتها کار مستقیم یک برنامهنویس یا طراح گرافیک سهبعدی است. اگر میخواهید با نحوهی نوشتن دستورهای دقیق برای چنین کارهایی آشنا شوید، راهنمای نوشتن پرامپت برای مبتدیان نقطهی شروع خوبی است.
۳. اقتصاد جدید هوش مصنوعی مولد: یک دنیای سهبعدی با ۱۰ دلار
شاید مهمترین بخش این ماجرا، بُعد اقتصادی آن باشد. تا همین چند سال پیش، ساخت یک صحنهی سهبعدی تعاملی — حتی در سادهترین شکل — نیازمند تیمی از طراحان، برنامهنویسان گرافیک و ساعتها زمان بود. حالا، طبق آزمایش کارپثی، همین کار را میتوان با هزینهای در حد یک وعده غذای ساده و در عرض چند ساعت به یک مدل زبانی سپرد. این تغییر مقیاس هزینه دقیقاً همان چیزی است که تحلیلگران آن را عامل اصلی گسترش سریع کاربردهای هوش مصنوعی در کسبوکارها میدانند؛ موضوعی که در مقالهی چرا هوش مصنوعی برای کسبوکارها مهم است با جزئیات بیشتری بررسی شده.
وقتی هزینهی تولید محتوای پیچیده اینقدر پایین میآید، مرز میان «ایده» و «محصول آماده» هم کمرنگتر میشود. کارپثی در توییتهای خود تأکید کرد که مدلهای امروزی «استقامت و صبر» انجام پروژههایی را دارند که انسانها معمولاً بهدلیل زمان و انرژی موردنیاز از انجامشان صرفنظر میکنند — نکتهای که پیامدهای بلندمدتی برای صنعت نرمافزار و طراحی دیجیتال دارد.

۴. پایان عصر «پلیکان روی دوچرخه»؛ محک جدید چیست؟
تست «یک svg از پلیکان روی دوچرخه بکش» یکی از سرگرمکنندهترین و در عین حال معروفترین روشهای غیررسمی برای سنجش توان مدلهای زبانی در سالهای گذشته بود؛ چون هم ساده بود و هم بهخوبی نقاط ضعف مدلها را در استدلال هندسی نشان میداد. اما به گفتهی کارپثی، این نسل از تستها دیگر برای مدلهای پیشرفتهای مثل کلود اوپوس ۵ کافی نیست؛ چون این مدلها میتوانند در یک پاسخ تکمرحلهای، بهسادگی چنین کارهایی را انجام دهند.
محک نسل تازه، به گفتهی او، باید حول سه محور بچرخد: کارهای پیوسته و طولانیمدت (نه یک پاسخ آنی)، استقلال عاملمحور (agentic) در تصمیمگیری، و محدودیت منابع مشخص مثل بودجهی توکن یا زمان. به بیان دیگر، پرسش کلیدی دیگر این نیست که «آیا مدل یک کار کوچک را درست انجام میدهد؟» بلکه این است که «با چند ساعت زمان و بودجهای معین، مدل چقدر میتواند بسازد؟». این چارچوب تازهی ارزیابی، شباهت زیادی به روشی دارد که در مقالهی توان و محدودیتهای واقعی هوش مصنوعی دربارهی سنجش عملکرد واقعی مدلها در دنیای واقعی مطرح شده است.
کلود اوپوس ۵ در برابر جمینای، گراک و کوپایلوت
این آزمایش همزمان با رقابت فشردهی چند غول فناوری بر سر برتری در تولید کد منتشر شد. گوگل با جمینای، xAI با گراک، مایکروسافت با کوپایلوت و OpenAI با چتجیپیتی همگی روی توانایی عاملهای خودکار در انجام وظایف پیچیدهی برنامهنویسی سرمایهگذاری سنگینی کردهاند. آزمایش کارپثی، اگرچه بهطور خاص روی کلود اوپوس ۵ متمرکز بود، اما بهطور ضمنی معیار تازهای برای مقایسهی همهی این مدلها در آینده تعیین میکند: نه صرفاً دقت در یک تسک کوچک، بلکه کیفیت و پایداری در پروژههای چندساعته.
۵. ضعف پنهان: هوش مصنوعی که نمیتواند خروجی بصری خودش را ببیند
باوجود همهی این پیشرفت، آزمایش یک محدودیت اساسی را هم آشکار کرد. کلود اوپوس ۵، علیرغم توانایی نوشتن کد پیچیدهی سهبعدی، هنوز نمیتواند خروجی بصری کار خودش را بهطور بومی و مؤثر «ببیند» یا ارزیابی کند. برای بررسی نتیجه، مدل مجبور بود بهطور مکرر از صحنه اسکرینشات بگیرد، آن را تحلیل کند و سپس کد را اصلاح کند — فرایندی کند، غیرمستقیم و پر از آزمونوخطا که بخش زیادی از «ناشیانه» بودن رندر نهایی را توضیح میدهد.
به گفتهی تحلیلگران این حوزه، عاملهای هوش مصنوعی امروز هنوز نمیتوانند ویدیو را بهشکل بومی و پیوسته درک کنند یا در یک محیط تعاملی مثل یک بازی رایانهای، بهصورت زنده و لحظهبهلحظه «بازی» کنند. پر کردن همین شکاف — یعنی دادن «چشم» واقعی و فوری به مدلهای زبانی برای دیدن خروجی خودشان — به احتمال زیاد یکی از مهمترین جبهههای رقابت نسل بعدی مدلهای هوش مصنوعی مولد خواهد بود.

۶. این خبر برای آیندهی کدنویسی با هوش مصنوعی چه معنایی دارد؟
این آزمایش در بستری بزرگتر و بسیار عملیتر هم معنا پیدا میکند. طبق گزارشهای منتشرشده، ابزارهای کدنویسی مبتنی بر هوش مصنوعی هماکنون در شرکتهایی مانند Airbnb مسئول تولید ۶۰ تا ۸۰ درصد از کدهای جدید هستند. مدیرعامل Anthropic نیز پیشبینی کرده که در بازهی سه تا شش ماه آینده، تا ۹۰ درصد از فرایند توسعهی نرمافزار میتواند به هوش مصنوعی سپرده شود. اگر این پیشبینی درست از آب دربیاید، نقش برنامهنویسان انسانی بهسرعت از «نویسندهی کد» به «هدایتگر و ویراستار» عاملهای هوش مصنوعی تغییر خواهد کرد؛ روندی که در مقالهی توهم برنامهنویس تنها در برابر مهندس واقعی از زاویهای دیگر بررسی شده است.
نکتهی مهمتر اینکه این توانایی دیگر به «نوشتن کد» محدود نمیماند. آزمایش کارپثی نشان داد مدلهایی مانند کلود اوپوس ۵ بهتدریج توان ساخت دنیاهای دیجیتال کاملاً سفارشی، از صحنههای بازی گرفته تا شبیهسازیهای آموزشی، را هم به دست میآورند؛ کاری که پیش از این تنها با تیمهای تخصصی طراحی و انیمیشن ممکن بود.
۷. چرا این آزمایش برای کاربران فارسیزبان هوش مصنوعی مهم است؟
برای کاربران ایرانی که با ابزارهایی مثل چتجیپیتی، کلود یا جمینای کار میکنند، این خبر یک پیام عملی هم دارد: هرچه پرامپتها دقیقتر و ساختاریافتهتر باشند، مدل میتواند در پروژههای بلندمدتتر و پیچیدهتر عملکرد بهتری داشته باشد. آزمایش کارپثی در واقع یک پرامپت خلاقانهی بلندمدت بود که به مدل اجازه داد بهجای پاسخ سریع، مسیر خودش را برای رسیدن به هدف پیدا کند. علاقهمندان میتوانند برای آشنایی بیشتر با این تکنیکها به آموزشهای چتجیپیتی در سایت مراجعه کنند، یا در بخش اخبار هوش مصنوعی روند این رقابت فناوری را دنبال کنند.
از سوی دیگر، رقابت میان مدلهای بزرگ زبانی برای بهترین عملکرد در کدنویسی و خلاقیت بصری، بهطور غیرمستقیم روی کیفیت ابزارهایی که کاربران روزمره استفاده میکنند هم اثر میگذارد. برای مقایسهی دقیقتر رویکردهای متفاوت شرکتهای بزرگ در طراحی مدلهای هوش مصنوعی، مقالهی مقایسهی چتجیپیتی و دیپسیک و همچنین OpenAI چیست و چگونه کار میکند منابع خوبی برای درک بهتر این اکوسیستم هستند.
۸. سوالات متداول
کلود اوپوس ۵ دقیقاً چه کاری انجام داد؟
مدل با دریافت پاراگراف اول رمان ارباب حلقهها و بودجهای معادل یک میلیون توکن (حدود ۱۰ دلار)، طی نزدیک به دو ساعت، ۵۵۰۰ خط کد Three.js نوشت که یک صحنهی سهبعدی و متحرک از آن روایت را میساخت.
چرا این آزمایش اینقدر مهم تلقی شد؟
چون بهجای یک تست کوچک و تکمرحلهای مثل «پلیکان روی دوچرخه»، توانایی مدل در کار مستقل، طولانیمدت و محدود به بودجه را میسنجید؛ چیزی نزدیکتر به سناریوهای واقعی استفاده از هوش مصنوعی در پروژههای واقعی.
مهمترین ضعفی که در این آزمایش دیده شد چه بود؟
ناتوانی مدل در دیدن مؤثر و بومی خروجی بصری خودش؛ کلود اوپوس ۵ برای بررسی نتیجهی کارش مجبور به تکیه بر اسکرینشات و آزمونوخطا بود.
آیا مدلهای دیگر مثل جمینای یا گراک هم میتوانند کار مشابهی انجام دهند؟
شرکتهایی مثل گوگل، xAI و مایکروسافت هم روی توانایی عاملهای خودشان در کارهای پیچیده و طولانیمدت سرمایهگذاری میکنند، اما این آزمایش خاص تنها روی کلود اوپوس ۵ انجام شد.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
