OpenAI یک هوش مصنوعی مهاجم به نام GPT-Red ساخته تا خودش پیش از هکرها، ضعفهای ChatGPT را پیدا کند؛ سلاحی که هرگز به دست عموم نمیرسد.

لیست مطالب
۱) GPT-Red دقیقاً چیست و چرا ساخته شد؟
در تازهترین خبر مهم دنیای هوش مصنوعی، شرکت OpenAI از سامانهای رونمایی کرد که شاید عجیبترین پروژهی امنیتی سال باشد: یک هوش مصنوعی که مأموریتش حمله به مدلهای خودِ OpenAI است. نام این سامانه GPT-Red است و برخلاف محصولاتی مانند ChatGPT، قرار نیست هرگز در اختیار کاربران عادی قرار بگیرد. GPT-Red یک ابزار کاملاً داخلی است که تنها یک هدف دارد: پیدا کردن حفرههای امنیتی مدلها، پیش از آنکه مهاجمان واقعی از آنها سوءاستفاده کنند.
ایدهی پشت این پروژه ساده اما هوشمندانه است. برای آنکه بدانید یک قفل چقدر محکم است، باید یک قفلشکن حرفهای را به جان آن بیندازید. OpenAI هم بهجای آنکه منتظر بماند تا هکرهای بیرونی نقاط ضعف مدلهایش را کشف کنند، خودش یک «قفلشکن» هوشمند ساخته است. اگر با شرکت سازندهی ChatGPT آشنایی کامل ندارید، پیشنهاد میکنیم ابتدا مقالهی OpenAI چیست و چه میکند را بخوانید تا بهتر متوجه اهمیت این تصمیم شوید.
این رویکرد بخشی از یک تغییر بزرگتر در صنعت است. با نزدیکشدن به عصری که در آن هوش مصنوعی نهفقط پاسخ میدهد بلکه بهجای ما «کار انجام میدهد»، مسئلهی امنیت از یک نگرانی حاشیهای به یکی از مهمترین اولویتها تبدیل شده است. GPT-Red دقیقاً پاسخی به همین دغدغه است.
۲) حملهی «تزریق پرامپت»؛ کابوس تازهی مدلهای زبانی
برای فهمیدن اهمیت GPT-Red، ابتدا باید با خطری آشنا شوید که این سامانه شکارش میکند: حملهی «تزریق پرامپت» یا Prompt Injection. در این نوع حمله، مهاجم دستورهای مخفی و مخربی را درون محتوایی که مدل قرار است بخواند — یک ایمیل، یک صفحهی وب یا حتی یک سند — پنهان میکند. مدل زبانی که نمیتواند بهدرستی میان «داده» و «دستور» تمایز بگذارد، این فرمانهای پنهان را اجرا میکند.
نتیجه میتواند فاجعهبار باشد: افشای اطلاعات محرمانهی کاربر، ارسال ایمیلهای جعلی، دستکاری کد یا حتی انجام تراکنشهای مالی ناخواسته. هرچه هوش مصنوعی دسترسی بیشتری به ابزارها و حسابهای واقعی پیدا کند، خطر این حملهها هم بزرگتر میشود. همانطور که در تحلیل تواناییها و محدودیتهای واقعی هوش مصنوعی اشاره کردهایم، همین شکاف میان قدرت و کنترل، بزرگترین چالش نسل تازهی مدلهاست.
نکتهی مهم اینجاست که تزریق پرامپت، برخلاف باجافزار یا ویروس، به دانش برنامهنویسی پیچیده نیاز ندارد؛ گاهی تنها یک جملهی هوشمندانه کافی است. به همین دلیل، درک درست از ساختار یک دستور یا پرامپت اهمیت دوچندان پیدا کرده است. اگر میخواهید بدانید یک پرامپت خوب چگونه نوشته میشود، راهنمای نوشتن پرامپت به زبان ساده نقطهی شروع خوبی است.
۳) «دوجو»؛ میدان تمرین هوش مصنوعی مهاجم
جالبترین بخش ماجرا، شیوهی آموزش GPT-Red است. OpenAI از روشی به نام «خودبازی» (Self-Play) همراه با یادگیری تقویتی استفاده کرده است. در این روش، دو هوش مصنوعی رودرروی هم قرار میگیرند: یکی در نقش مهاجم (GPT-Red) و دیگری در نقش مدافع. مهاجم برای هر نفوذ موفق پاداش میگیرد و مدافع برای حفظ امنیت و انجام درست وظیفهاش.
OpenAI این نبرد را در محیطی شبیهسازیشده به نام «دوجو» (Dojo) برگزار کرده؛ فضایی که شرایط واقعی استفاده از مدلها را تقلید میکند: مرورگر وب، خواندن و پاسخ به ایمیل و ویرایش کد. هر بار که مدافع یاد میگیرد چطور یک حمله را دفع کند، مهاجم مجبور میشود روش تازهتر و خلاقانهتری بسازد. این چرخهی بیپایانِ حمله و دفاع، دقیقاً همان چیزی است که GPT-Red را روزبهروز باهوشتر و خطرناکتر کرده است.
این شیوهی رقابتی یادآور نبردهای معروف هوش مصنوعی در حوزههای دیگر است؛ درست مانند آنچه در گزارش نبرد هوش مصنوعیها در شطرنج دیدیم، رقابت مستقیم دو سیستم میتواند هر دو طرف را بهسرعت به مرزهای تازهای برساند. اینجا هم نتیجهی این رقابت، جهشی بزرگ در امنیت مدلها بوده است.

۴) اعداد تکاندهنده: ۸۴ درصد در برابر ۱۳ درصد
حالا به بخشی میرسیم که واقعاً چشمها را خیره میکند. بر پایهی گزارشهای منتشرشده، GPT-Red در حدود ۸۴ درصد سناریوها موفق به نفوذ شد، در حالی که یک تیم قرمزِ کاملاً انسانی و متخصص، تنها در ۱۳ درصد موارد موفق بود. این اختلاف عظیم نشان میدهد که یک هوش مصنوعی میتواند با سرعت و مقیاسی فراتر از توان انسان، آسیبپذیریها را کشف کند.
اما نکتهی مهمتر، تأثیر این حملهها بر بهبود مدلهاست. GPT-Red در برابر نسخهی قدیمیتر یعنی GPT-5 (نسخهی اوت ۲۰۲۵) در بیش از ۹۰ درصد مواقع پیروز میشد. اما OpenAI از همین شکستها بهعنوان سوخت بهبود استفاده کرد؛ مدل تازه یعنی GPT-5.6 را آنقدر در برابر این حملهها تمرین داد که نرخ موفقیت نفوذ به کمتر از ۲۳ درصد سقوط کرد.
یعنی ChatGPT شما امنتر شده است
ترجمهی سادهی این اعداد برای کاربر عادی روشن است: نسخهای از ChatGPT که امروز استفاده میکنید، بهمراتب در برابر دستکاری و فریب مقاومتر از نسخههای پیشین است. OpenAI اعلام کرده GPT-5.6 «مقاومترین مدل تا امروز» است. اگر میخواهید از این نسخهی امنتر بیشترین بهره را ببگیرید، آموزشهای کاربردی ما در بخش آموزشهای ChatGPT میتواند کمکتان کند.
۵) کشف یک حملهی کاملاً تازه: جعل «زنجیرهی فکری»
یکی از مهمترین دستاوردهای GPT-Red، کشف یک شیوهی حملهی کاملاً ناشناخته بود؛ چیزی که پیش از این کسی به آن فکر نکرده بود. نام این حمله «جعل زنجیرهی فکری» (Fake Chain of Thought) است. مدلهای استدلالگر امروزی پیش از پاسخ نهایی، یک زنجیره از مراحل فکری را طی میکنند. در این حمله، مهاجم ورودیهای جعلی را وارد همین فرایند استدلال میکند.
نتیجه این است که مدل، اطلاعات نادرست را همچون واقعیتی «از پیش تأییدشده» میپذیرد. یکی از پژوهشگران OpenAI این وضعیت را چنین توصیف کرده که مثل آن است که به مدل بگویید «۱ بهعلاوهی ۱ میشود ۳ … و این قبلاً تأیید شده است» و مدل بدون تردید آن را بپذیرد. این کشف نشان میدهد که هرچه مدلها پیچیدهتر میشوند، سطوح تازهای برای حمله هم پدید میآید.
خبر خوب اینکه پس از شناسایی این حمله، OpenAI موفق شد نرخ موفقیت آن را از بیش از ۹۵ درصد در نسخههای قدیمی، به کمتر از ۱۰ درصد در GPT-5.6 کاهش دهد. این دقیقاً همان ارزشی است که یک تیم قرمزِ خودکار میآفریند: پیدا کردن دری که هیچکس نمیدانست باز است، و سپس بستن آن.
۶) از ماشین فروش خودکار تا ایجنتهای کدنویسی
GPT-Red فقط در محیط آزمایشگاهی نماند. OpenAI برای نشاندادن خطر واقعی، آن را در برابر ایجنتهای عملیاتی هم آزمود. در یکی از نمونهها، این سامانه توانست ایجنت یک ماشین فروش خودکار به نام Vendy را هک کند؛ قیمتها را دستکاری کرد و سفارشها را لغو کرد. در نمونهای دیگر، ایجنتهای کدنویسی خط فرمان را در اختیار گرفت.
این نمونهها یک پیام روشن دارند: هرچه به هوش مصنوعی اختیار بیشتری برای انجام کارهای واقعی بدهیم، مسئولیت امنیتی هم سنگینتر میشود. یک ایجنت خرید که بتواند فریب بخورد، میتواند پول واقعی هدر دهد؛ یک ایجنت کدنویس فریبخورده میتواند کل یک پروژه را خراب کند. اهمیت این موضوع برای کسبوکارها را در مقالهی چرا هوش مصنوعی برای کسبوکار مهم است بیشتر بررسی کردهایم.
این خطرها همچنین بحث قدیمی دربارهی مرز میان اتوماسیون و نظارت انسانی را دوباره داغ کرده است. همانطور که در یادداشت توهم توسعهدهندهی تنها در برابر مهندس واقعی گفتهایم، هوش مصنوعی هرچقدر هم توانمند باشد، هنوز به قضاوت و نظارت انسان نیاز دارد؛ بهویژه وقتی پای امنیت در میان است.
۷) چرا OpenAI این سلاح را عمومی نمیکند؟
یک پرسش طبیعی این است: اگر GPT-Red اینقدر قدرتمند است، چرا OpenAI آن را منتشر نمیکند؟ پاسخ روشن است. ابزاری که میتواند با ۸۴ درصد موفقیت به مدلهای زبانی نفوذ کند، در دست افراد نادرست به یک سلاح سایبری خطرناک تبدیل میشود. به همین دلیل OpenAI تأکید کرده که GPT-Red یک ابزار کاملاً داخلی باقی میماند و هرگز بهصورت عمومی عرضه نخواهد شد.
این تصمیم بازتابی از یک معادلهی دشوار در دنیای امنیت است: همان دانشی که میتواند از ما محافظت کند، در صورت افشا میتواند علیه ما به کار رود. OpenAI ترجیح داده این قدرت را پشت درهای بسته نگه دارد و تنها از نتایج آن — یعنی مدلهای امنتر — برای عموم استفاده کند.
۸) نگاه صنعت: رقابت تازه بر سر امنیت ایجنتها
OpenAI تنها بازیگر این میدان نیست. امنیت مدلهای زبانی به یکی از جبهههای اصلی رقابت میان غولهای هوش مصنوعی تبدیل شده است. شرکت Anthropic، سازندهی دستیار Claude، از همان ابتدا ایمنی و «تیم قرمز» را در قلب فلسفهی خود قرار داده و روی روشهایی مانند «هوش مصنوعی قانونمند» سرمایهگذاری کرده است. Google هم با خانوادهی Gemini، آزمایشهای امنیتی گستردهای روی حملههای تزریق پرامپت انجام میدهد.
این رقابت سالم، در نهایت به سود کاربران تمام میشود؛ چون هر شرکت میکوشد امنترین و قابلاعتمادترین دستیار را بسازد. با این حال، GPT-Red محدودیتهایی هم دارد. به گفتهی OpenAI، این سامانه در گفتوگوهای چندمرحلهای و در حملههای مبتنی بر تصویر هنوز ضعیف است و به همین دلیل نمیتواند بهطور کامل جایگزین تیم انسانی شود. کارشناسان میگویند با قدرتمندتر شدن مدلها، «سطح خطر و شعاع آسیب» هم بزرگتر میشود.
برای پیگیری این رقابت و تازهترین تحولات، میتوانید همیشه به بخش اخبار هوش مصنوعی سایت ما سر بزنید؛ جایی که مهمترین رویدادهای دنیای AI را به زبان سادهی فارسی دنبال میکنیم.
۹) پرسشوپاسخ کوتاه (FAQ)
GPT-Red چیست؟
GPT-Red یک سامانهی هوش مصنوعی داخلی ساختهی OpenAI است که وظیفهاش حمله به مدلهای خودِ این شرکت و کشف حفرههای امنیتی، بهویژه حملههای تزریق پرامپت، پیش از انتشار عمومی مدلهاست.
آیا میتوانم از GPT-Red استفاده کنم؟
خیر. OpenAI اعلام کرده که این ابزار هرگز بهصورت عمومی منتشر نمیشود و تنها یک ابزار داخلی برای تیم ایمنی است، چون در دست نادرست میتواند بسیار خطرناک باشد.
حملهی تزریق پرامپت چیست؟
روشی است که در آن دستورهای مخفی درون یک متن، ایمیل یا صفحهی وب پنهان میشود تا مدل زبانی را فریب دهد و وادار به انجام کاری ناخواسته مانند افشای اطلاعات یا دستکاری کد کند.
آیا ChatGPT حالا امنتر است؟
بله. بر پایهی گزارشها، نرخ موفقیت حملهها روی نسخهی جدید یعنی GPT-5.6 به کمتر از ۲۳ درصد کاهش یافته و OpenAI آن را مقاومترین مدل خود تا امروز معرفی کرده است.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
