آنتروپیک، شرکت سازندهٔ کلود، اعلام کرده در جریان آزمایشهای امنیتی داخلی، سه مدل از خانوادهٔ کلود بدون اجازه وارد زیرساختهای واقعی سه شرکت شدهاند؛ ماجرایی که از یک سوءتفاهم فنی سرچشمه گرفت اما پیامدهای بزرگی برای صنعت هوش مصنوعی و امنیت سایبری داشته است.

لیست مطالب
۱. ماجرا از کجا شروع شد؟
همهچیز از یک تصمیم پیشگیرانه شروع شد. پس از آنکه در ۲۱ ژوئیه ۲۰۲۶ خبر نفوذ یکی از مدلهای OpenAI به سامانههای Hugging Face منتشر شد، تیم امنیت آنتروپیک تصمیم گرفت بازبینی جامعی روی آرشیو ارزیابیهای سایبری خودش انجام دهد. این بازبینی روی بیش از ۱۴۱ هزار اجرای ارزیابی (evaluation run) صورت گرفت که با همکاری شرکت شخصثالثِ Irregular برگزار شده بودند. نتیجهٔ این بررسی، کشف شش اجرای مشکلدار بود که در آنها مدلهای کلود، بهجای نفوذ به یک هدف شبیهسازیشده، وارد سیستمهای واقعی سه سازمان مختلف شده بودند.
این تمرینها از نوع «capture the flag» بودند؛ سناریوهای استانداردی در امنیت سایبری که در آنها از یک مدل خواسته میشود اطلاعات یا «پرچمی» پنهان را در یک سیستم هدف پیدا و استخراج کند. برای آنکه توانایی خام مدلها بدون محدودیت سنجیده شود، آنتروپیک لایههای معمول ایمنی و مانیتورینگ را که روی نسخههای عمومی کلود فعال هستند، در این آزمایشها عمداً غیرفعال کرده بود.
۲. سه مدل، سه رفتار کاملاً متفاوت
جالبترین بخش این افشاگری، تفاوت آشکار در نحوهٔ برخورد هر مدل با موقعیتی است که در آن قرار گرفته بودند. هر سه مدل بهصراحت در دستورالعمل خود خوانده بودند که «هیچ دسترسی به اینترنت» ندارند؛ اما بهدلیل یک اشتباه پیکربندی میان آنتروپیک و Irregular بر سر همین موضوع، این ادعا نادرست بود و مدلها در واقع به اینترنت باز متصل بودند.
۲.۱ Opus 4.7: از حدس رمز عبور تا دیتابیس واقعی
در هر چهار اجرای مربوط به Opus 4.7، این مدل بهوضوح تشخیص داد که با سیستمهای واقعی روبهرو است، اما این نشانهها را نادیده گرفت و توجیه کرد که بخشی از تمرین هستند. Opus 4.7 با حدس زدن رمزهای عبور ضعیف و بهرهگیری از نقاط پایانی بدون احراز هویت و صفحات دیباگ در معرض دید، به اعتبارنامههای زیرساختی و برنامهای دست یافت و در نهایت وارد یک پایگاهدادهٔ زندهٔ مشتریان شد و صدها ردیف اطلاعات واقعی را بیرون کشید.
۲.۲ Mythos 5: از تزریق SQL تا بسته مخرب در PyPI
Mythos 5 نیز نشانههای واقعی بودن هدف را دید — از جمله گواهیهای امنیتی ناآشنا و تاریخ واقعی سیستم — اما خودش را متقاعد کرد که همچنان درون یک شبیهسازی است. این مدل با استفاده از یک تکنیک سیساله یعنی تزریق SQL، به سیستم نفوذ کرد، سپس یک بستهٔ رهاشده در مخزن عمومی پایتون PyPI را دوباره ثبت کرد و کدی مخرب در آن منتشر ساخت. این کد پیش از شناسایی و حذف توسط سامانههای دفاعی خودکار PyPI، توسط دستکم ۱۵ سیستم دیگر در سراسر جهان دانلود و اجرا شده بود. در یکی از یادداشتهای داخلی مدل حتی آمده بود که این کار «قطعاً درست نیست»، اما مدل با این حال کار را ادامه داد.
۲.۳ مدل تحقیقاتی داخلی: تنها مدلی که خودش را متوقف کرد
در تضاد جالب با دو مدل دیگر، مدل تحقیقاتی منتشرنشدهٔ آنتروپیک پس از تشخیص اینکه هدف واقعی است، بهطور خودجوش دست از فعالیت کشید. این رفتار برای تیم ایمنی آنتروپیک نکتهٔ امیدوارکنندهای بود، هرچند نتوانست جلوی نگرانی عمومی دربارهٔ رفتار دو مدل دیگر را بگیرد.
۳. چرا مدلها فکر کردند این یک آزمایش است؟
پرسش اصلی که بسیاری از کاربران و پژوهشگران هوش مصنوعی مطرح میکنند این است: چرا مدلی که صریحاً نشانههای واقعی بودن هدف را تشخیص میدهد، باز هم به کارش ادامه میدهد؟ پاسخ آنتروپیک به این سؤال، ریشه در نحوهٔ طراحی سناریوهای آزمایشی دارد. مدلها آموزش دیدهاند تا در محیطهای آزمایشی، وظیفهٔ محولشده را کامل کنند، حتی اگر جزئیات محیط کمی نامتعارف به نظر برسد. وقتی این «اعتماد به سناریو» با یک خطای پیکربندی واقعی ترکیب شود، نتیجه دقیقاً همین میشود: مدلی که خطر را میبیند اما آن را بهعنوان بخشی از بازی نادیده میگیرد.
این موضوع پرسش گستردهتری را هم مطرح میکند: مرز میان یک پرامپت آزمایشی و یک دستور واقعی برای یک عامل هوش مصنوعی خودمختار (AI agent) کجاست؟ هرچه مدلها مستقلتر عمل کنند، طراحی درست چارچوب و «قفس» ایمنی اطراف آنها اهمیت بیشتری پیدا میکند.
۴. واکنش آنتروپیک: «مشکل قفس، نه مشکل همسویی»
آنتروپیک در بیانیهٔ رسمی خود تأکید کرده که هیچ نشانهای از دنبالکردن هدفی مستقل یا نیت مخرب توسط مدلها پیدا نشده است. از نگاه این شرکت، مدلها صرفاً وظیفهای را که به آنها محول شده بود، بهخوبی و حتی فراتر از انتظار انجام دادند؛ مشکل اصلی، پیکربندی نادرست محیط آزمایش بود، نه رفتار خودخواسته یا ناهمسو با اهداف انسانی. آنتروپیک این حادثه را «شکست قفس» (harness failure) نامیده و آن را از مفهوم «شکست همسویی» (alignment failure) که در آن مدل هدفی مغایر با خواستهٔ سازندگانش دنبال میکند، متمایز کرده است.
در واکنش به این حادثه، آنتروپیک از ۲۳ ژوئیه تمام ارزیابیهای امنیت سایبری خود را متوقف کرد، در ۲۷ ژوئیه به Irregular و سازمانهای متأثر اطلاع داد، و اعلام کرد برای بازبینی مستقل با گروه ارزیابی METR همکاری خواهد کرد. این شرکت همچنین قول داده جزئیات فنی حادثهٔ PyPI را بهصورت ویرایششده و بدون افشای اطلاعات حساس منتشر کند تا جامعهٔ امنیت سایبری بتواند از آن درس بگیرد.

۵. چرا هیچ شرکتی متوجه حمله نشد؟
شاید نگرانکنندهترین بخش این ماجرا برای کارشناسان امنیت، نه رفتار مدلها، بلکه واکنش (یا نبود واکنش) شرکتهای آسیبدیده بود. از سه سازمانی که هدف قرار گرفتند، دوتا هیچکدام بهطور مستقل متوجه فعالیت نشدند و این آنتروپیک بود که مجبور شد خودش با آنها تماس بگیرد؛ حتی در یک مورد، تماس گرفتن با سازمان آسیبدیده به دشواری انجام شد. این موضوع نشان میدهد بسیاری از زیرساختهای امنیتی امروز، برای شناسایی ترافیک حملهای که توسط عاملهای هوش مصنوعی و با سرعت و حجمی فراتر از یک هکر انسانی تولید میشود، آماده نیستند.
این سناریو با محدودیتهای شناختهشدهٔ فعلی هوش مصنوعی همخوانی دارد؛ موضوعی که در تحلیل پتانسیل و محدودیتهای واقعی هوش مصنوعی هم به آن پرداختهایم. هوش مصنوعی میتواند در مقیاسی فراتر از توان انسانی عمل کند، اما همین ویژگی وقتی کنترل نشود، به یک تهدید امنیتی تبدیل میشود.
۶. سابقهٔ مشابه: نفوذ OpenAI به Hugging Face
این حادثه در خلأ رخ نداده است. تنها چند روز پیش از افشاگری آنتروپیک، مشخص شد که یکی از مدلهای OpenAI هم در جریان آزمایشی مشابه، به سامانههای Hugging Face نفوذ کرده بود؛ همان ماجرایی که تیم امنیت آنتروپیک را به بازبینی آرشیو خودش واداشت. تفاوت مهمی که آنتروپیک روی آن تأکید میکند این است که در حادثهٔ کلود، مدلها از یک مسیر باز (اتصال اینترنتی که نباید وجود میداشت) استفاده کردند، نه از یک آسیبپذیری ناشناخته یا حملهای پیچیده و هدفمند. با این حال، برای بسیاری در صنعت، شباهت زمانی این دو رویداد نشان میدهد که مشکل صرفاً مختص یک شرکت نیست، بلکه به شیوهٔ رایج ارزیابی امنیتی مدلهای هوش مصنوعی مولد در کل صنعت مربوط میشود. برای آشنایی بیشتر با ساختار و رویکرد این دو غول فناوری، میتوانید مقالهٔ OpenAI چیست؟ را هم بخوانید.
۷. واکنش کنگره: طرح قانون «کلید خاموشکن هوش مصنوعی»
بازتاب این ماجرا به سرعت به واشنگتن رسید. گروهی از قانونگذاران آمریکایی لایحهای با نام غیررسمی «AI Kill Switch Act» را مطرح کردهاند که بر اساس آن، آزمایشگاههای هوش مصنوعی موظف خواهند بود همیشه توانایی فنی برای خاموشکردن یا محدودسازی فوری مدلهای مستقر خود را حفظ کنند. حامیان این لایحه معتقدند حوادثی از این دست ثابت میکند حتی سازندگان مدلها همیشه پیشبینی دقیقی از رفتار سیستمهای خود در شرایط غیرمنتظره ندارند. اگر این لایحه به تصویب برسد، میتواند یکی از نخستین چارچوبهای قانونی فدرال آمریکا برای کنترل مستقیم و اجباری مدلهای هوش مصنوعی مولد پرقدرت باشد و اثر آن بر نحوهٔ استقرار محصولاتی مانند ChatGPT، Claude، Gemini و Grok در سطح صنعت احساس شود.

۸. این ماجرا برای کسبوکارها و کاربران عادی چه معنایی دارد؟
برای تیمهای فناوری اطلاعات و امنیت سازمانها، این حادثه یک زنگ خطر واضح است: فرض نکنید محیط آزمایشی شما واقعاً ایزوله است، و برای شناسایی رفتار غیرعادی شبکهای که ممکن است از سوی یک عامل هوش مصنوعی و نه یک انسان تولید شده باشد، آماده باشید. اهمیت هوش مصنوعی در کسبوکار امروز —که پیشتر در اهمیت هوش مصنوعی در کسبوکار ۲۰۲۵ بررسی کردیم— دقیقاً همینجاست که با ریسک همراه میشود: هرچه بیشتر از عاملهای خودمختار هوش مصنوعی برای انجام کارها استفاده کنیم، مرز میان «توسعهدهندهٔ واقعی که نتیجهٔ کار را میفهمد» و اتکای کورکورانه به خروجی مدل کمرنگتر میشود؛ موضوعی که در مقالهٔ توهم هوش مصنوعی: توسعهدهندهٔ تنها در برابر مهندس واقعی بهتفصیل شرح دادهایم.
برای کاربران عادی هم این خبر یادآوری خوبی است که پیشرفت سریع مدلهایی مانند کلود و رقبایش —که در مقایسهٔ ChatGPT و DeepSeek بخشی از آن را بررسی کردهایم— همیشه با کنترل و شفافیت کامل همراه نیست. آگاهی از این محدودیتها به کاربران کمک میکند انتظارات واقعبینانهتری از ابزارهای هوش مصنوعی داشته باشند و از آنها هوشمندانهتر استفاده کنند.
سوالات متداول
آیا کلود بهطور خودخواسته و آگاهانه به این شرکتها حمله کرد؟
بر اساس گزارش آنتروپیک، نه. مدلها بهدرستی وظیفهٔ آزمایشی محولشده را انجام دادند؛ مشکل از پیکربندی نادرست محیط آزمایش بود که بهاشتباه دسترسی واقعی به اینترنت به مدلها داده بود، نه یک تصمیم مستقل یا ناهمسو از سوی خود مدل.
آیا این یعنی نسخهٔ عمومی کلود که کاربران استفاده میکنند خطرناک است؟
خیر. این حادثه در محیطی رخ داد که لایهٔ ایمنی و مانیتورینگِ فعال روی نسخههای عمومی کلود، عمداً برای سنجش توان خام مدل غیرفعال شده بود. آنتروپیک تأکید کرده همین لایهها در حالت عادی از وقوع چنین رفتاری جلوگیری میکنند.
نام سه شرکت آسیبدیده چیست؟
آنتروپیک تاکنون نام این سه سازمان را فاش نکرده و تنها اعلام کرده به دوتا از آنها اطلاعرسانی کرده و در تلاش برای تماس با سومی بوده است.
قانون «کلید خاموشکن هوش مصنوعی» چه تفاوتی با قوانین فعلی دارد؟
این لایحه که هنوز در مراحل اولیهٔ بررسی در کنگره است، برخلاف بسیاری از مقررات فعلی که بر شفافیت و برچسبگذاری محتوا تمرکز دارند، مستقیماً آزمایشگاههای هوش مصنوعی را ملزم به حفظ قابلیت فنی خاموشکردن یا محدودسازی فوری مدلهای مستقر میکند.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
