هوش مصنوعی Ataraxos قهرمان جهان در بازی استراتگو را شکست داد

هوش مصنوعی Ataraxos قهرمان جهان در استراتگو را شکست داد؛ ۱۵ بر ۱ با هزینه‌ای ناچیز

اخبار · هوش مصنوعی

پژوهشگران MIT، کارنگی ملون، NYU و استنفورد مدلی به نام Ataraxos ساخته‌اند که قهرمان چهار دوره‌ی جهان در بازی استراتگو را ۱۵ بر ۱ و با ۴ تساوی شکست داد؛ آن هم با بخش کوچکی از هزینه‌ی مدل‌های پیشین.

چکیده. مقاله‌ای که در تاریخ ۳۰ سپتامبر ۲۰۲۶ در نشریه‌ی Nature منتشر شد، از نخستین نمایش «بازی فراانسانی» در استراتگو خبر می‌دهد. این بازی به‌خاطر اطلاعات پنهان از شطرنج و گو سخت‌تر است. مدل Ataraxos با ترکیب یادگیری تقویتی از راه بازی با خودش و برنامه‌ریزی در لحظه‌ی تصمیم‌گیری، با حدود یک‌پانصدم محاسبه‌ی DeepNash به این سطح رسید و کد و وزن‌هایش متن‌باز است.
هوش مصنوعی Ataraxos قهرمان جهان در بازی استراتگو را شکست داد

۱. چه اتفاقی افتاد؟

در پایان سپتامبر ۲۰۲۶ تیمی مشترک از چند دانشگاه برجسته‌ی آمریکا نتیجه‌ی کارشان را در نشریه‌ی Nature منتشر کرد. مدل آن‌ها با نام Ataraxos در یک مسابقه‌ی بیست‌بازی با پیم نیمایر، قهرمان چهار دوره‌ی جهان استراتگو، روبه‌رو شد و ۱۵ بازی را برد، یک بازی را باخت و چهار بازی به تساوی رسید.

پژوهشگران این نتیجه را «نخستین نمایش بازی فراانسانی در استراتگو» توصیف می‌کنند. بر اساس گزارش دانشگاه MIT، این مدل علیه چند بازیکن برتر مسابقات قهرمانی هم رکورد ۳۹ برد و ۲ باخت ثبت کرده است. اگر دنبال خبرهای مشابه هستید، بخش اخبار هوش مصنوعی مستر چت‌جی‌پی‌تی را دنبال کنید.

۲. استراتگو چیست و چرا برای هوش مصنوعی سخت است؟

استراتگو یک بازی رومیزی دونفره است. هر بازیکن چهل مهره دارد و هویت مهره‌های خودش را از حریف پنهان نگه می‌دارد. بازیکن فقط وقتی می‌فهمد مهره‌ی حریف چیست که با آن درگیر شود. پس هر تصمیم بر پایه‌ی حدس، فریب و بلوف گرفته می‌شود.

در شطرنج و گو، هر دو بازیکن همه‌ی صفحه را می‌بینند. به این بازی‌ها «اطلاعات کامل» می‌گویند و جست‌وجوی درختی در آن‌ها بسیار موفق عمل می‌کند. اما در استراتگو تعداد حالت‌های ممکن برای چیدمان مهره‌ها از ۱۰ به توان ۶۶ بیشتر است و جست‌وجوی ساده‌ی درختی عملاً ناممکن می‌شود. به همین دلیل پژوهشگران آن را یکی از آخرین پناهگاه‌های انسان در بازی‌های فکری می‌دانستند.

تفاوت اطلاعات کامل و اطلاعات ناقص

در بازی‌های اطلاعات ناقص مثل پوکر یا استراتگو، بهترین حرکت به باور شما درباره‌ی وضعیت پنهان حریف بستگی دارد. اگر مدل این باور را اشتباه بسازد، حتی یک جست‌وجوی عمیق هم او را به نتیجه‌ی بد می‌رساند. همین موضوع نشان می‌دهد چرا موفقیت Ataraxos فقط یک خبر سرگرمی نیست.

روش کار هوش مصنوعی Ataraxos با خودبازی و برنامه‌ریزی در لحظه‌ی تصمیم‌گیری

۳. Ataraxos چگونه کار می‌کند؟

مدل از دو بخش اصلی ساخته شده است. بخش اول مرحله‌ی آموزش است. مدل با یادگیری تقویتی و بازی کردن علیه خودش، حدود ۱۶۳ میلیون بازی انجام داد تا یک استراتژی پایه بسازد. پژوهشگران برای جلوگیری از چرخه‌های ناپایدار یادگیری، نرخ به‌روزرسانی را اصلاح کردند.

بخش دوم هنگام بازی فعال می‌شود. یک شبکه‌ی عصبی مولد، احتمال هویت هر مهره‌ی حریف را تخمین می‌زند و بر اساس آن محتمل‌ترین وضعیت صفحه را می‌سازد. سپس مدل پیش از انجام حرکت، چند ادامه‌ی ممکن را بررسی می‌کند. گابریل فارینا، نویسنده‌ی ارشد مقاله، می‌گوید به‌جای حدس کورکورانه از برنامه‌ریزی در لحظه‌ی تصمیم‌گیری برای یافتن باورپذیرترین وضعیت صفحه استفاده می‌کنند.

این ترکیب شبیه کاری است که یک بازیکن حرفه‌ای انجام می‌دهد. او اول الگوهای کلی را از تجربه یاد می‌گیرد و بعد در هر نوبت با توجه به رفتار حریف باورهایش را به‌روز می‌کند. برای آشنایی با مفاهیم پایه‌ی این حوزه می‌توانید مطلب اوپن‌ای‌آی چیست را هم بخوانید.

۴. هزینه‌ی آموزش؛ بخش حیرت‌انگیز ماجرا

شاید جالب‌ترین بخش خبر، نه برد بلکه ارزانی آن باشد. بر اساس گزارش‌ها، آموزش اصلی با ۱۶ کارت گرافیک انویدیا H100 به مدت یک هفته و آموزش تکمیلی با چهار کارت H100 در چهار روز انجام شده است. این حجم محاسبه حدود یک‌پانصدم مصرف DeepNash، سیستم پیشین دیپ‌مایند، است.

به گفته‌ی فارینا، Ataraxos از DeepNash قوی‌تر است و کمتر از یک‌صدم نمونه‌های آموزشی آن را مصرف کرده است. مقایسه‌ی تعداد بازی‌های خودبازی هم نشان می‌دهد این مدل حدود یک‌سی‌ام بازی‌های رویکرد قبلی را لازم داشته است. برخی منابع هزینه‌ی کل را کمتر از هشت هزار دلار برآورد کرده‌اند، یعنی رقمی که یک تیم دانشگاهی کوچک هم می‌تواند خرجش کند.

چرا این موضوع مهم است؟

سال‌ها فرض بر این بود که پیشرفت‌های بزرگ هوش مصنوعی فقط با خوشه‌های گران‌قیمت و بودجه‌ی شرکت‌های غول‌پیکر ممکن است. این پژوهش نشان می‌دهد الگوریتم بهتر می‌تواند جای سخت‌افزار بیشتر را بگیرد. این نکته برای کشورها و تیم‌هایی که منابع محدود دارند، پیام امیدوارکننده‌ای است. درباره‌ی ظرفیت‌ها و محدودیت‌های واقعی این فناوری، نوشته‌ی پتانسیل و محدودیت‌های هوش مصنوعی در دنیای واقعی را ببینید.

۵. تیم سازنده و منابع مالی

نویسنده‌ی اصلی مقاله ساموئل سوکوتا، دانشجوی دکتری دانشگاه کارنگی ملون است و گابریل فارینا از دپارتمان مهندسی برق و علوم کامپیوتر MIT نویسنده‌ی ارشد آن است. اوژن وینیتسکی از NYU، زیکو کولتر از کارنگی ملون، هنگ‌یوان هو از استنفورد و ژیوان فن از MIT هم در پروژه مشارکت داشته‌اند.

بودجه‌ی پژوهش را میان نهادهای دیگر، دفتر پژوهش‌های نیروی دریایی آمریکا و بنیاد ملی علوم تأمین کرده‌اند. حضور نهاد نظامی در میان حامیان نشان می‌دهد چرا تصمیم‌گیری در شرایط اطلاعات ناقص برای ارتش‌ها اهمیت دارد.

هزینه‌ی کم آموزش مدل Ataraxos با کارت گرافیک H100 و انتشار متن‌باز

۶. فراتر از استراتگو؛ بازی‌های دیگر

پژوهشگران می‌گویند همان روش را روی چند بازی دیگر هم آزموده‌اند. در Barrage Stratego که نسخه‌ی سریع‌تر و تهاجمی‌تر استراتگو است، در هاناب که بازی همکاری با اطلاعات ناقص است و در دودیژو که بازی ورق محبوب چینی است، مدل نتایج قوی گرفته است.

این تنوع اهمیت دارد، چون نشان می‌دهد راه‌حل فقط برای یک بازی خاص طراحی نشده است. ترکیب خودبازی و برنامه‌ریزی در لحظه‌ی تصمیم‌گیری می‌تواند چارچوبی عمومی برای مسائل با اطلاعات پنهان باشد؛ چه رقابتی مثل استراتگو و چه همکاری‌محور مثل هاناب.

۷. کاربردهای واقعی و هشدار پژوهشگران

تیم پژوهشی از کاربردهای احتمالی در عملیات نظامی، مذاکرات تجاری، امنیت سایبری و هر حوزه‌ای که تصمیم‌ها بر پایه‌ی اطلاعات ناقص گرفته می‌شود یاد می‌کند. برای نمونه یک سیستم می‌تواند در تحلیل رفتار مهاجم سایبری، که نیت و ابزارش پنهان است، به تحلیلگر کمک کند.

اما خود پژوهشگران محتاط‌اند. مذاکره‌ی واقعی قوانین متغیر، مدل‌های ناقص و پیامدهایی دارد که به برد و باخت ساده خلاصه نمی‌شود. به نوشته‌ی آن‌ها، پیش از استفاده‌ی عملی باید نظارت انسانی حفظ شود. این هشدار با نگاه واقع‌بینانه به هوش مصنوعی در کسب‌وکار هم هم‌خوان است؛ جزئیات بیشتر را در اهمیت هوش مصنوعی در کسب‌وکار مطالعه کنید.

۸. تاریخچه‌ی غلبه‌ی هوش مصنوعی بر بازی‌ها

ماجرای بازی‌ها و هوش مصنوعی داستان درازی دارد. در سال ۱۹۹۷ دیپ‌بلو گری کاسپاروف را در شطرنج شکست داد. در سال ۲۰۱۶ آلفاگو لی سدول را در گو مغلوب کرد. پس از آن نوبت پوکر و بازی‌های ورق رسید و هر بار گمان می‌شد مرز بعدی بسیار دورتر است.

استراتگو یکی از آخرین نمونه‌های شناخته‌شده در این مسیر بود. مسابقه‌ی شطرنج هوش‌های مصنوعی هم نمونه‌ی جالب دیگری از رقابت مدل‌هاست؛ مقاله‌ی نبرد شطرنج‌باز چت‌جی‌پی‌تی و دیپ‌سیک را از دست ندهید. تفاوت اصلی این بار در آن است که مدل برنده با منابع اندک و کدی باز به قله رسیده است.

۹. این پیشرفت برای کاربران و کسب‌وکارها چه معنایی دارد؟

اگرچه Ataraxos یک مدل بازی است، منطق پشت آن به مسائل روزمره نزدیک است. هر جا تصمیم‌گیرنده باید بدون دانستن همه‌ی حقایق عمل کند، همین ساختار کاربرد دارد. مثال‌هایش قیمت‌گذاری در برابر رقیب، مدیریت موجودی با تقاضای نامعلوم و تشخیص کلاهبرداری است.

تیم‌های کوچک ایرانی و فارسی‌زبان هم می‌توانند از این روند درس بگیرند. وقتی مدل و کد باز منتشر می‌شود، هزینه‌ی آزمایش کاهش می‌یابد و پژوهشگران مستقل می‌توانند روی آن بسازند. این یعنی رقابت فقط در انحصار چند شرکت بزرگ نمی‌ماند.

در عین حال باید محتاط بود. برد در یک بازی با قوانین ثابت ضمانت نمی‌دهد که همان مدل در محیط واقعی با داده‌های نامنظم، حریف‌های غیرقابل پیش‌بینی و پیامدهای اخلاقی کار کند. بنابراین ارزیابی مستقل و نظارت انسانی همچنان بخش جدایی‌ناپذیر هر استقرار جدی است.

۱۰. پرسش‌های متداول

Ataraxos دقیقاً چیست؟

این یک مدل هوش مصنوعی برای بازی‌های اطلاعات ناقص است که با خودبازی آموزش دیده و هنگام بازی با حدس‌زدن وضعیت پنهان حریف برنامه‌ریزی می‌کند. هدف اولیه‌ی آن استراتگو بوده است.

آیا Ataraxos از ChatGPT یا مدل‌های زبانی بزرگ ساخته شده است؟

خیر. این مدل یک سیستم یادگیری تقویتی تخصصی برای بازی است و مدل زبانی عمومی مثل ChatGPT یا Gemini به شمار نمی‌آید. با این حال ایده‌هایش می‌تواند در عامل‌های هوشمند آینده به کار برود.

آیا کد آن در دسترس است؟

بله. بر اساس گزارش‌ها کد و وزن‌های مدل در گیت‌هاب منتشر شده است. اگر می‌خواهید با ابزارهایی مثل ChatGPT بهتر کار کنید، آموزش آموزش‌های ChatGPT و راهنمای پرامپت‌نویسی برای مبتدیان نقطه‌ی شروع خوبی هستند.

آیا هوش مصنوعی در جنگ یا مذاکره جای انسان را می‌گیرد؟

پژوهشگران صراحتاً می‌گویند چنین کاربردهایی هنوز به نظارت انسانی نیاز دارند. بازی استراتگو قوانین ثابت و هدف روشن دارد، اما دنیای واقعی این‌طور نیست. تفاوت یک مهندس واقعی با یک ابزار هم در همین ظرافت‌هاست؛ نگاه جالب این موضوع را در توهم هوش مصنوعی؛ توسعه‌دهنده‌ی تنها در برابر مهندس واقعی بخوانید.

چرا این خبر برای فعالان هوش مصنوعی مهم است؟

چون نشان می‌دهد تصمیم‌گیری در شرایط عدم قطعیت، که قلب بسیاری از کاربردهای واقعی است، با روش‌های ارزان‌تر هم قابل حل است. این یعنی ورود تیم‌های کوچک‌تر به رقابت واقع‌بینانه‌تر شده است.

جمع‌بندی. پیروزی Ataraxos بر پیم نیمایر با نتیجه‌ی ۱۵ بر ۱ و ۴ تساوی، یکی از نقاط عطف هوش مصنوعی در بازی‌هاست. نکته‌ی اصلی فقط برد نیست؛ هزینه‌ی کم، روش قابل تعمیم و متن‌باز بودن آن است. هنوز تا کاربرد واقعی در مذاکره و امنیت راه است، اما مسیر روشن‌تر شده. برای دنبال‌کردن داغ‌ترین اخبار هوش مصنوعی به کانال تلگرام @MrChatGPT_IR بپیوندید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *