پژوهشگران MIT، کارنگی ملون، NYU و استنفورد مدلی به نام Ataraxos ساختهاند که قهرمان چهار دورهی جهان در بازی استراتگو را ۱۵ بر ۱ و با ۴ تساوی شکست داد؛ آن هم با بخش کوچکی از هزینهی مدلهای پیشین.

لیست مطالب
۱. چه اتفاقی افتاد؟
در پایان سپتامبر ۲۰۲۶ تیمی مشترک از چند دانشگاه برجستهی آمریکا نتیجهی کارشان را در نشریهی Nature منتشر کرد. مدل آنها با نام Ataraxos در یک مسابقهی بیستبازی با پیم نیمایر، قهرمان چهار دورهی جهان استراتگو، روبهرو شد و ۱۵ بازی را برد، یک بازی را باخت و چهار بازی به تساوی رسید.
پژوهشگران این نتیجه را «نخستین نمایش بازی فراانسانی در استراتگو» توصیف میکنند. بر اساس گزارش دانشگاه MIT، این مدل علیه چند بازیکن برتر مسابقات قهرمانی هم رکورد ۳۹ برد و ۲ باخت ثبت کرده است. اگر دنبال خبرهای مشابه هستید، بخش اخبار هوش مصنوعی مستر چتجیپیتی را دنبال کنید.
۲. استراتگو چیست و چرا برای هوش مصنوعی سخت است؟
استراتگو یک بازی رومیزی دونفره است. هر بازیکن چهل مهره دارد و هویت مهرههای خودش را از حریف پنهان نگه میدارد. بازیکن فقط وقتی میفهمد مهرهی حریف چیست که با آن درگیر شود. پس هر تصمیم بر پایهی حدس، فریب و بلوف گرفته میشود.
در شطرنج و گو، هر دو بازیکن همهی صفحه را میبینند. به این بازیها «اطلاعات کامل» میگویند و جستوجوی درختی در آنها بسیار موفق عمل میکند. اما در استراتگو تعداد حالتهای ممکن برای چیدمان مهرهها از ۱۰ به توان ۶۶ بیشتر است و جستوجوی سادهی درختی عملاً ناممکن میشود. به همین دلیل پژوهشگران آن را یکی از آخرین پناهگاههای انسان در بازیهای فکری میدانستند.
تفاوت اطلاعات کامل و اطلاعات ناقص
در بازیهای اطلاعات ناقص مثل پوکر یا استراتگو، بهترین حرکت به باور شما دربارهی وضعیت پنهان حریف بستگی دارد. اگر مدل این باور را اشتباه بسازد، حتی یک جستوجوی عمیق هم او را به نتیجهی بد میرساند. همین موضوع نشان میدهد چرا موفقیت Ataraxos فقط یک خبر سرگرمی نیست.

۳. Ataraxos چگونه کار میکند؟
مدل از دو بخش اصلی ساخته شده است. بخش اول مرحلهی آموزش است. مدل با یادگیری تقویتی و بازی کردن علیه خودش، حدود ۱۶۳ میلیون بازی انجام داد تا یک استراتژی پایه بسازد. پژوهشگران برای جلوگیری از چرخههای ناپایدار یادگیری، نرخ بهروزرسانی را اصلاح کردند.
بخش دوم هنگام بازی فعال میشود. یک شبکهی عصبی مولد، احتمال هویت هر مهرهی حریف را تخمین میزند و بر اساس آن محتملترین وضعیت صفحه را میسازد. سپس مدل پیش از انجام حرکت، چند ادامهی ممکن را بررسی میکند. گابریل فارینا، نویسندهی ارشد مقاله، میگوید بهجای حدس کورکورانه از برنامهریزی در لحظهی تصمیمگیری برای یافتن باورپذیرترین وضعیت صفحه استفاده میکنند.
این ترکیب شبیه کاری است که یک بازیکن حرفهای انجام میدهد. او اول الگوهای کلی را از تجربه یاد میگیرد و بعد در هر نوبت با توجه به رفتار حریف باورهایش را بهروز میکند. برای آشنایی با مفاهیم پایهی این حوزه میتوانید مطلب اوپنایآی چیست را هم بخوانید.
۴. هزینهی آموزش؛ بخش حیرتانگیز ماجرا
شاید جالبترین بخش خبر، نه برد بلکه ارزانی آن باشد. بر اساس گزارشها، آموزش اصلی با ۱۶ کارت گرافیک انویدیا H100 به مدت یک هفته و آموزش تکمیلی با چهار کارت H100 در چهار روز انجام شده است. این حجم محاسبه حدود یکپانصدم مصرف DeepNash، سیستم پیشین دیپمایند، است.
به گفتهی فارینا، Ataraxos از DeepNash قویتر است و کمتر از یکصدم نمونههای آموزشی آن را مصرف کرده است. مقایسهی تعداد بازیهای خودبازی هم نشان میدهد این مدل حدود یکسیام بازیهای رویکرد قبلی را لازم داشته است. برخی منابع هزینهی کل را کمتر از هشت هزار دلار برآورد کردهاند، یعنی رقمی که یک تیم دانشگاهی کوچک هم میتواند خرجش کند.
چرا این موضوع مهم است؟
سالها فرض بر این بود که پیشرفتهای بزرگ هوش مصنوعی فقط با خوشههای گرانقیمت و بودجهی شرکتهای غولپیکر ممکن است. این پژوهش نشان میدهد الگوریتم بهتر میتواند جای سختافزار بیشتر را بگیرد. این نکته برای کشورها و تیمهایی که منابع محدود دارند، پیام امیدوارکنندهای است. دربارهی ظرفیتها و محدودیتهای واقعی این فناوری، نوشتهی پتانسیل و محدودیتهای هوش مصنوعی در دنیای واقعی را ببینید.
۵. تیم سازنده و منابع مالی
نویسندهی اصلی مقاله ساموئل سوکوتا، دانشجوی دکتری دانشگاه کارنگی ملون است و گابریل فارینا از دپارتمان مهندسی برق و علوم کامپیوتر MIT نویسندهی ارشد آن است. اوژن وینیتسکی از NYU، زیکو کولتر از کارنگی ملون، هنگیوان هو از استنفورد و ژیوان فن از MIT هم در پروژه مشارکت داشتهاند.
بودجهی پژوهش را میان نهادهای دیگر، دفتر پژوهشهای نیروی دریایی آمریکا و بنیاد ملی علوم تأمین کردهاند. حضور نهاد نظامی در میان حامیان نشان میدهد چرا تصمیمگیری در شرایط اطلاعات ناقص برای ارتشها اهمیت دارد.

۶. فراتر از استراتگو؛ بازیهای دیگر
پژوهشگران میگویند همان روش را روی چند بازی دیگر هم آزمودهاند. در Barrage Stratego که نسخهی سریعتر و تهاجمیتر استراتگو است، در هاناب که بازی همکاری با اطلاعات ناقص است و در دودیژو که بازی ورق محبوب چینی است، مدل نتایج قوی گرفته است.
این تنوع اهمیت دارد، چون نشان میدهد راهحل فقط برای یک بازی خاص طراحی نشده است. ترکیب خودبازی و برنامهریزی در لحظهی تصمیمگیری میتواند چارچوبی عمومی برای مسائل با اطلاعات پنهان باشد؛ چه رقابتی مثل استراتگو و چه همکاریمحور مثل هاناب.
۷. کاربردهای واقعی و هشدار پژوهشگران
تیم پژوهشی از کاربردهای احتمالی در عملیات نظامی، مذاکرات تجاری، امنیت سایبری و هر حوزهای که تصمیمها بر پایهی اطلاعات ناقص گرفته میشود یاد میکند. برای نمونه یک سیستم میتواند در تحلیل رفتار مهاجم سایبری، که نیت و ابزارش پنهان است، به تحلیلگر کمک کند.
اما خود پژوهشگران محتاطاند. مذاکرهی واقعی قوانین متغیر، مدلهای ناقص و پیامدهایی دارد که به برد و باخت ساده خلاصه نمیشود. به نوشتهی آنها، پیش از استفادهی عملی باید نظارت انسانی حفظ شود. این هشدار با نگاه واقعبینانه به هوش مصنوعی در کسبوکار هم همخوان است؛ جزئیات بیشتر را در اهمیت هوش مصنوعی در کسبوکار مطالعه کنید.
۸. تاریخچهی غلبهی هوش مصنوعی بر بازیها
ماجرای بازیها و هوش مصنوعی داستان درازی دارد. در سال ۱۹۹۷ دیپبلو گری کاسپاروف را در شطرنج شکست داد. در سال ۲۰۱۶ آلفاگو لی سدول را در گو مغلوب کرد. پس از آن نوبت پوکر و بازیهای ورق رسید و هر بار گمان میشد مرز بعدی بسیار دورتر است.
استراتگو یکی از آخرین نمونههای شناختهشده در این مسیر بود. مسابقهی شطرنج هوشهای مصنوعی هم نمونهی جالب دیگری از رقابت مدلهاست؛ مقالهی نبرد شطرنجباز چتجیپیتی و دیپسیک را از دست ندهید. تفاوت اصلی این بار در آن است که مدل برنده با منابع اندک و کدی باز به قله رسیده است.
۹. این پیشرفت برای کاربران و کسبوکارها چه معنایی دارد؟
اگرچه Ataraxos یک مدل بازی است، منطق پشت آن به مسائل روزمره نزدیک است. هر جا تصمیمگیرنده باید بدون دانستن همهی حقایق عمل کند، همین ساختار کاربرد دارد. مثالهایش قیمتگذاری در برابر رقیب، مدیریت موجودی با تقاضای نامعلوم و تشخیص کلاهبرداری است.
تیمهای کوچک ایرانی و فارسیزبان هم میتوانند از این روند درس بگیرند. وقتی مدل و کد باز منتشر میشود، هزینهی آزمایش کاهش مییابد و پژوهشگران مستقل میتوانند روی آن بسازند. این یعنی رقابت فقط در انحصار چند شرکت بزرگ نمیماند.
در عین حال باید محتاط بود. برد در یک بازی با قوانین ثابت ضمانت نمیدهد که همان مدل در محیط واقعی با دادههای نامنظم، حریفهای غیرقابل پیشبینی و پیامدهای اخلاقی کار کند. بنابراین ارزیابی مستقل و نظارت انسانی همچنان بخش جداییناپذیر هر استقرار جدی است.
۱۰. پرسشهای متداول
Ataraxos دقیقاً چیست؟
این یک مدل هوش مصنوعی برای بازیهای اطلاعات ناقص است که با خودبازی آموزش دیده و هنگام بازی با حدسزدن وضعیت پنهان حریف برنامهریزی میکند. هدف اولیهی آن استراتگو بوده است.
آیا Ataraxos از ChatGPT یا مدلهای زبانی بزرگ ساخته شده است؟
خیر. این مدل یک سیستم یادگیری تقویتی تخصصی برای بازی است و مدل زبانی عمومی مثل ChatGPT یا Gemini به شمار نمیآید. با این حال ایدههایش میتواند در عاملهای هوشمند آینده به کار برود.
آیا کد آن در دسترس است؟
بله. بر اساس گزارشها کد و وزنهای مدل در گیتهاب منتشر شده است. اگر میخواهید با ابزارهایی مثل ChatGPT بهتر کار کنید، آموزش آموزشهای ChatGPT و راهنمای پرامپتنویسی برای مبتدیان نقطهی شروع خوبی هستند.
آیا هوش مصنوعی در جنگ یا مذاکره جای انسان را میگیرد؟
پژوهشگران صراحتاً میگویند چنین کاربردهایی هنوز به نظارت انسانی نیاز دارند. بازی استراتگو قوانین ثابت و هدف روشن دارد، اما دنیای واقعی اینطور نیست. تفاوت یک مهندس واقعی با یک ابزار هم در همین ظرافتهاست؛ نگاه جالب این موضوع را در توهم هوش مصنوعی؛ توسعهدهندهی تنها در برابر مهندس واقعی بخوانید.
چرا این خبر برای فعالان هوش مصنوعی مهم است؟
چون نشان میدهد تصمیمگیری در شرایط عدم قطعیت، که قلب بسیاری از کاربردهای واقعی است، با روشهای ارزانتر هم قابل حل است. این یعنی ورود تیمهای کوچکتر به رقابت واقعبینانهتر شده است.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
