سامانه GPT-Red شرکت OpenAI برای کشف حفره‌های امنیتی و تزریق پرامپت در ChatGPT

GPT-Red؛ هوش مصنوعی مهاجمی که OpenAI برای امن‌کردن ChatGPT ساخت

امنیت · هوش مصنوعی

OpenAI یک هوش مصنوعی مهاجم به نام GPT-Red ساخته تا خودش پیش از هکرها، ضعف‌های ChatGPT را پیدا کند؛ سلاحی که هرگز به دست عموم نمی‌رسد.

چکیده. GPT-Red یک «تیم قرمز» کاملاً خودکار است که با روش خودبازی و یادگیری تقویتی آموزش دیده تا حمله‌های تزریق پرامپت را کشف کند. این سامانه در ۸۴ درصد سناریوها موفق به نفوذ شد، یک شیوه‌ی حمله‌ی تازه به نام «جعل زنجیره‌ی فکری» را کشف کرد و در نهایت به ساخت مقاوم‌ترین نسخه‌ی ChatGPT تا امروز، یعنی GPT-5.6، انجامید.
سامانه GPT-Red شرکت OpenAI برای کشف حفره‌های امنیتی و تزریق پرامپت در ChatGPT

۱) GPT-Red دقیقاً چیست و چرا ساخته شد؟

در تازه‌ترین خبر مهم دنیای هوش مصنوعی، شرکت OpenAI از سامانه‌ای رونمایی کرد که شاید عجیب‌ترین پروژه‌ی امنیتی سال باشد: یک هوش مصنوعی که مأموریتش حمله به مدل‌های خودِ OpenAI است. نام این سامانه GPT-Red است و برخلاف محصولاتی مانند ChatGPT، قرار نیست هرگز در اختیار کاربران عادی قرار بگیرد. GPT-Red یک ابزار کاملاً داخلی است که تنها یک هدف دارد: پیدا کردن حفره‌های امنیتی مدل‌ها، پیش از آنکه مهاجمان واقعی از آن‌ها سوءاستفاده کنند.

ایده‌ی پشت این پروژه ساده اما هوشمندانه است. برای آنکه بدانید یک قفل چقدر محکم است، باید یک قفل‌شکن حرفه‌ای را به جان آن بیندازید. OpenAI هم به‌جای آنکه منتظر بماند تا هکرهای بیرونی نقاط ضعف مدل‌هایش را کشف کنند، خودش یک «قفل‌شکن» هوشمند ساخته است. اگر با شرکت سازنده‌ی ChatGPT آشنایی کامل ندارید، پیشنهاد می‌کنیم ابتدا مقاله‌ی OpenAI چیست و چه می‌کند را بخوانید تا بهتر متوجه اهمیت این تصمیم شوید.

این رویکرد بخشی از یک تغییر بزرگ‌تر در صنعت است. با نزدیک‌شدن به عصری که در آن هوش مصنوعی نه‌فقط پاسخ می‌دهد بلکه به‌جای ما «کار انجام می‌دهد»، مسئله‌ی امنیت از یک نگرانی حاشیه‌ای به یکی از مهم‌ترین اولویت‌ها تبدیل شده است. GPT-Red دقیقاً پاسخی به همین دغدغه است.

۲) حمله‌ی «تزریق پرامپت»؛ کابوس تازه‌ی مدل‌های زبانی

برای فهمیدن اهمیت GPT-Red، ابتدا باید با خطری آشنا شوید که این سامانه شکارش می‌کند: حمله‌ی «تزریق پرامپت» یا Prompt Injection. در این نوع حمله، مهاجم دستورهای مخفی و مخربی را درون محتوایی که مدل قرار است بخواند — یک ایمیل، یک صفحه‌ی وب یا حتی یک سند — پنهان می‌کند. مدل زبانی که نمی‌تواند به‌درستی میان «داده» و «دستور» تمایز بگذارد، این فرمان‌های پنهان را اجرا می‌کند.

نتیجه می‌تواند فاجعه‌بار باشد: افشای اطلاعات محرمانه‌ی کاربر، ارسال ایمیل‌های جعلی، دستکاری کد یا حتی انجام تراکنش‌های مالی ناخواسته. هرچه هوش مصنوعی دسترسی بیشتری به ابزارها و حساب‌های واقعی پیدا کند، خطر این حمله‌ها هم بزرگ‌تر می‌شود. همان‌طور که در تحلیل توانایی‌ها و محدودیت‌های واقعی هوش مصنوعی اشاره کرده‌ایم، همین شکاف میان قدرت و کنترل، بزرگ‌ترین چالش نسل تازه‌ی مدل‌هاست.

نکته‌ی مهم اینجاست که تزریق پرامپت، برخلاف باج‌افزار یا ویروس، به دانش برنامه‌نویسی پیچیده نیاز ندارد؛ گاهی تنها یک جمله‌ی هوشمندانه کافی است. به همین دلیل، درک درست از ساختار یک دستور یا پرامپت اهمیت دوچندان پیدا کرده است. اگر می‌خواهید بدانید یک پرامپت خوب چگونه نوشته می‌شود، راهنمای نوشتن پرامپت به زبان ساده نقطه‌ی شروع خوبی است.

۳) «دوجو»؛ میدان تمرین هوش مصنوعی مهاجم

جالب‌ترین بخش ماجرا، شیوه‌ی آموزش GPT-Red است. OpenAI از روشی به نام «خودبازی» (Self-Play) همراه با یادگیری تقویتی استفاده کرده است. در این روش، دو هوش مصنوعی رودرروی هم قرار می‌گیرند: یکی در نقش مهاجم (GPT-Red) و دیگری در نقش مدافع. مهاجم برای هر نفوذ موفق پاداش می‌گیرد و مدافع برای حفظ امنیت و انجام درست وظیفه‌اش.

OpenAI این نبرد را در محیطی شبیه‌سازی‌شده به نام «دوجو» (Dojo) برگزار کرده؛ فضایی که شرایط واقعی استفاده از مدل‌ها را تقلید می‌کند: مرورگر وب، خواندن و پاسخ به ایمیل و ویرایش کد. هر بار که مدافع یاد می‌گیرد چطور یک حمله را دفع کند، مهاجم مجبور می‌شود روش تازه‌تر و خلاقانه‌تری بسازد. این چرخه‌ی بی‌پایانِ حمله و دفاع، دقیقاً همان چیزی است که GPT-Red را روزبه‌روز باهوش‌تر و خطرناک‌تر کرده است.

این شیوه‌ی رقابتی یادآور نبردهای معروف هوش مصنوعی در حوزه‌های دیگر است؛ درست مانند آنچه در گزارش نبرد هوش مصنوعی‌ها در شطرنج دیدیم، رقابت مستقیم دو سیستم می‌تواند هر دو طرف را به‌سرعت به مرزهای تازه‌ای برساند. اینجا هم نتیجه‌ی این رقابت، جهشی بزرگ در امنیت مدل‌ها بوده است.

رقابت آنتروپیک و صنعت هوش مصنوعی در امنیت مدل‌های زبانی و تیم قرمز خودکار

۴) اعداد تکان‌دهنده: ۸۴ درصد در برابر ۱۳ درصد

حالا به بخشی می‌رسیم که واقعاً چشم‌ها را خیره می‌کند. بر پایه‌ی گزارش‌های منتشرشده، GPT-Red در حدود ۸۴ درصد سناریوها موفق به نفوذ شد، در حالی که یک تیم قرمزِ کاملاً انسانی و متخصص، تنها در ۱۳ درصد موارد موفق بود. این اختلاف عظیم نشان می‌دهد که یک هوش مصنوعی می‌تواند با سرعت و مقیاسی فراتر از توان انسان، آسیب‌پذیری‌ها را کشف کند.

اما نکته‌ی مهم‌تر، تأثیر این حمله‌ها بر بهبود مدل‌هاست. GPT-Red در برابر نسخه‌ی قدیمی‌تر یعنی GPT-5 (نسخه‌ی اوت ۲۰۲۵) در بیش از ۹۰ درصد مواقع پیروز می‌شد. اما OpenAI از همین شکست‌ها به‌عنوان سوخت بهبود استفاده کرد؛ مدل تازه یعنی GPT-5.6 را آن‌قدر در برابر این حمله‌ها تمرین داد که نرخ موفقیت نفوذ به کمتر از ۲۳ درصد سقوط کرد.

یعنی ChatGPT شما امن‌تر شده است

ترجمه‌ی ساده‌ی این اعداد برای کاربر عادی روشن است: نسخه‌ای از ChatGPT که امروز استفاده می‌کنید، به‌مراتب در برابر دستکاری و فریب مقاوم‌تر از نسخه‌های پیشین است. OpenAI اعلام کرده GPT-5.6 «مقاوم‌ترین مدل تا امروز» است. اگر می‌خواهید از این نسخه‌ی امن‌تر بیشترین بهره را ببگیرید، آموزش‌های کاربردی ما در بخش آموزش‌های ChatGPT می‌تواند کمک‌تان کند.

۵) کشف یک حمله‌ی کاملاً تازه: جعل «زنجیره‌ی فکری»

یکی از مهم‌ترین دستاوردهای GPT-Red، کشف یک شیوه‌ی حمله‌ی کاملاً ناشناخته بود؛ چیزی که پیش از این کسی به آن فکر نکرده بود. نام این حمله «جعل زنجیره‌ی فکری» (Fake Chain of Thought) است. مدل‌های استدلال‌گر امروزی پیش از پاسخ نهایی، یک زنجیره از مراحل فکری را طی می‌کنند. در این حمله، مهاجم ورودی‌های جعلی را وارد همین فرایند استدلال می‌کند.

نتیجه این است که مدل، اطلاعات نادرست را همچون واقعیتی «از پیش تأییدشده» می‌پذیرد. یکی از پژوهشگران OpenAI این وضعیت را چنین توصیف کرده که مثل آن است که به مدل بگویید «۱ به‌علاوه‌ی ۱ می‌شود ۳ … و این قبلاً تأیید شده است» و مدل بدون تردید آن را بپذیرد. این کشف نشان می‌دهد که هرچه مدل‌ها پیچیده‌تر می‌شوند، سطوح تازه‌ای برای حمله هم پدید می‌آید.

خبر خوب اینکه پس از شناسایی این حمله، OpenAI موفق شد نرخ موفقیت آن را از بیش از ۹۵ درصد در نسخه‌های قدیمی، به کمتر از ۱۰ درصد در GPT-5.6 کاهش دهد. این دقیقاً همان ارزشی است که یک تیم قرمزِ خودکار می‌آفریند: پیدا کردن دری که هیچ‌کس نمی‌دانست باز است، و سپس بستن آن.

۶) از ماشین فروش خودکار تا ایجنت‌های کدنویسی

GPT-Red فقط در محیط آزمایشگاهی نماند. OpenAI برای نشان‌دادن خطر واقعی، آن را در برابر ایجنت‌های عملیاتی هم آزمود. در یکی از نمونه‌ها، این سامانه توانست ایجنت یک ماشین فروش خودکار به نام Vendy را هک کند؛ قیمت‌ها را دستکاری کرد و سفارش‌ها را لغو کرد. در نمونه‌ای دیگر، ایجنت‌های کدنویسی خط فرمان را در اختیار گرفت.

این نمونه‌ها یک پیام روشن دارند: هرچه به هوش مصنوعی اختیار بیشتری برای انجام کارهای واقعی بدهیم، مسئولیت امنیتی هم سنگین‌تر می‌شود. یک ایجنت خرید که بتواند فریب بخورد، می‌تواند پول واقعی هدر دهد؛ یک ایجنت کدنویس فریب‌خورده می‌تواند کل یک پروژه را خراب کند. اهمیت این موضوع برای کسب‌وکارها را در مقاله‌ی چرا هوش مصنوعی برای کسب‌وکار مهم است بیشتر بررسی کرده‌ایم.

این خطرها همچنین بحث قدیمی درباره‌ی مرز میان اتوماسیون و نظارت انسانی را دوباره داغ کرده است. همان‌طور که در یادداشت توهم توسعه‌دهنده‌ی تنها در برابر مهندس واقعی گفته‌ایم، هوش مصنوعی هرچقدر هم توانمند باشد، هنوز به قضاوت و نظارت انسان نیاز دارد؛ به‌ویژه وقتی پای امنیت در میان است.

۷) چرا OpenAI این سلاح را عمومی نمی‌کند؟

یک پرسش طبیعی این است: اگر GPT-Red این‌قدر قدرتمند است، چرا OpenAI آن را منتشر نمی‌کند؟ پاسخ روشن است. ابزاری که می‌تواند با ۸۴ درصد موفقیت به مدل‌های زبانی نفوذ کند، در دست افراد نادرست به یک سلاح سایبری خطرناک تبدیل می‌شود. به همین دلیل OpenAI تأکید کرده که GPT-Red یک ابزار کاملاً داخلی باقی می‌ماند و هرگز به‌صورت عمومی عرضه نخواهد شد.

این تصمیم بازتابی از یک معادله‌ی دشوار در دنیای امنیت است: همان دانشی که می‌تواند از ما محافظت کند، در صورت افشا می‌تواند علیه ما به کار رود. OpenAI ترجیح داده این قدرت را پشت درهای بسته نگه دارد و تنها از نتایج آن — یعنی مدل‌های امن‌تر — برای عموم استفاده کند.

۸) نگاه صنعت: رقابت تازه بر سر امنیت ایجنت‌ها

OpenAI تنها بازیگر این میدان نیست. امنیت مدل‌های زبانی به یکی از جبهه‌های اصلی رقابت میان غول‌های هوش مصنوعی تبدیل شده است. شرکت Anthropic، سازنده‌ی دستیار Claude، از همان ابتدا ایمنی و «تیم قرمز» را در قلب فلسفه‌ی خود قرار داده و روی روش‌هایی مانند «هوش مصنوعی قانون‌مند» سرمایه‌گذاری کرده است. Google هم با خانواده‌ی Gemini، آزمایش‌های امنیتی گسترده‌ای روی حمله‌های تزریق پرامپت انجام می‌دهد.

این رقابت سالم، در نهایت به سود کاربران تمام می‌شود؛ چون هر شرکت می‌کوشد امن‌ترین و قابل‌اعتمادترین دستیار را بسازد. با این حال، GPT-Red محدودیت‌هایی هم دارد. به گفته‌ی OpenAI، این سامانه در گفت‌وگوهای چندمرحله‌ای و در حمله‌های مبتنی بر تصویر هنوز ضعیف است و به همین دلیل نمی‌تواند به‌طور کامل جایگزین تیم انسانی شود. کارشناسان می‌گویند با قدرتمندتر شدن مدل‌ها، «سطح خطر و شعاع آسیب» هم بزرگ‌تر می‌شود.

برای پیگیری این رقابت و تازه‌ترین تحولات، می‌توانید همیشه به بخش اخبار هوش مصنوعی سایت ما سر بزنید؛ جایی که مهم‌ترین رویدادهای دنیای AI را به زبان ساده‌ی فارسی دنبال می‌کنیم.

۹) پرسش‌وپاسخ کوتاه (FAQ)

GPT-Red چیست؟

GPT-Red یک سامانه‌ی هوش مصنوعی داخلی ساخته‌ی OpenAI است که وظیفه‌اش حمله به مدل‌های خودِ این شرکت و کشف حفره‌های امنیتی، به‌ویژه حمله‌های تزریق پرامپت، پیش از انتشار عمومی مدل‌هاست.

آیا می‌توانم از GPT-Red استفاده کنم؟

خیر. OpenAI اعلام کرده که این ابزار هرگز به‌صورت عمومی منتشر نمی‌شود و تنها یک ابزار داخلی برای تیم ایمنی است، چون در دست نادرست می‌تواند بسیار خطرناک باشد.

حمله‌ی تزریق پرامپت چیست؟

روشی است که در آن دستورهای مخفی درون یک متن، ایمیل یا صفحه‌ی وب پنهان می‌شود تا مدل زبانی را فریب دهد و وادار به انجام کاری ناخواسته مانند افشای اطلاعات یا دستکاری کد کند.

آیا ChatGPT حالا امن‌تر است؟

بله. بر پایه‌ی گزارش‌ها، نرخ موفقیت حمله‌ها روی نسخه‌ی جدید یعنی GPT-5.6 به کمتر از ۲۳ درصد کاهش یافته و OpenAI آن را مقاوم‌ترین مدل خود تا امروز معرفی کرده است.

جمع‌بندی. GPT-Red نشان می‌دهد که آینده‌ی امنیت هوش مصنوعی، خودِ هوش مصنوعی است. OpenAI با ساختن یک مهاجم خودکار، توانست پیش از هکرها ضعف‌های مدل‌هایش را پیدا و ترمیم کند و مقاوم‌ترین نسخه‌ی ChatGPT تا امروز را بسازد. این تازه آغاز رقابتی بزرگ بر سر امن‌ترین دستیار هوشمند است. برای اینکه هیچ خبر داغی از دنیای هوش مصنوعی را از دست ندهید، ما را در کانال تلگرام @MrChatGPT_IR دنبال کنید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

ورود | ثبت نام
شماره موبایل یا پست الکترونیک خود را وارد کنید

روش دریافت کد تایید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

برگشت
کد تایید را وارد کنید
کد تایید برای شماره موبایل شما ارسال گردید
کد تایید از طریق بازوی "رمز یکبار مصرف (OTP)" در پیام رسان بله برای شما ارسال شد"
برای دریافت کد تایید، شماره زیر را با موبایل خود به صورت کاملاً رایگان شماره گیری کنید"
تا لحظاتی دیگر برای اعلام کد تایید با شما تماس خواهیم گرفت
ارسال مجدد کد تا دیگر

روش دریافت کد تایید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

برگشت
رمز عبور را وارد کنید
رمز عبور حساب کاربری خود را وارد کنید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

برگشت
درخواست بازیابی رمز عبور
لطفاً پست الکترونیک یا موبایل خود را وارد نمایید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

برگشت
کد تایید را وارد کنید
کد تایید برای شماره موبایل شما ارسال گردید
ارسال مجدد کد تا دیگر

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

ایمیل بازیابی ارسال شد!
لطفاً به صندوق الکترونیکی خود مراجعه کرده و بر روی لینک ارسال شده کلیک نمایید.

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

تغییر رمز عبور
یک رمز عبور برای اکانت خود تنظیم کنید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

تغییر رمز با موفقیت انجام شد

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

دریافت ۵۰ پرامپت برای سوالات پیچیده

دریافت فایل