پرامپت بازاندیشی (Reflexion)؛ به هوش مصنوعی یاد بده از شکست خودش درس بگیرد

⏱ زمان مطالعه: حدود ۱۰ دقیقه✏️ تمرین دارد
آموزش · پرامپت‌نویسی

وقتی هوش مصنوعی جواب اشتباه می‌دهد، بیشتر ما فقط می‌نویسیم «دوباره امتحان کن». اما مدل نمی‌داند دقیقاً چه چیزی غلط بود، پس همان خطا را با ظاهری تازه تکرار می‌کند. بازاندیشی یا Reflexion دقیقاً همین حلقهٔ بی‌فایده را می‌شکند: قبل از هر تلاش دوباره، مدل را وادار می‌کنی ریشهٔ شکستش را بنویسد و از آن یک درس بسازد.

چکیده. بازاندیشی (Reflexion) یک تکنیک پرامپت‌نویسی است که به مدل می‌آموزد از شکست‌های خودش درس بگیرد. هستهٔ آن یک چرخهٔ چهارمرحله‌ای است: کنش، سنجش، بازاندیشی، و تلاش دوباره. در این آموزش یاد می‌گیری چطور یک سیگنال شکست روشن بدهی، ریشهٔ خطا را از زبان خود مدل بیرون بکشی، درس را به یک قانون کوتاه تبدیل کنی، و با ساختن «دفترچهٔ درس‌ها» کاری کنی که مدل هر بار باهوش‌تر از دفعهٔ قبل جواب بدهد. در پایان هم مرزهای درست استفاده و اشتباه‌های رایج را مرور می‌کنیم.
پرامپت بازاندیشی یا Reflexion برای یادگیری هوش مصنوعی از خطای خودش

بازاندیشی دقیقاً چیست؟

بازاندیشی یا Reflexion یعنی به‌جای اینکه مدل را کورکورانه به تلاش دوباره بفرستی، ابتدا از او بخواهی دربارهٔ عملکرد قبلی‌اش فکر کند و با کلمات خودش توضیح دهد چرا شکست خورد. این «توضیح» یک متن کوتاه و صریح است که نقش حافظه را بازی می‌کند و ورودی تلاش بعدی می‌شود. تفاوت ظریف اما مهم اینجاست: مدل دیگر از صفر شروع نمی‌کند، بلکه با یک درس مشخص در دست دوباره وارد میدان می‌شود.

ایدهٔ پشت این کار ساده است. مدل‌های زبانی وقتی مجبور شوند دلیل شکست را صریح بنویسند، همان متن در پنجرهٔ توجه‌شان باقی می‌ماند و رفتار بعدی‌شان را جهت می‌دهد. یعنی خودِ نوشتنِ اشتباه، احتمال تکرارش را پایین می‌آورد. اگر تازه با مفهوم پرامپت آشنا شده‌ای، پیشنهاد می‌کنم اول راهنمای صفر تا صد پرامپت‌نویسی را بخوانی تا پایهٔ کار محکم شود.

مثال: «متن زیر را برای من به انگلیسی روان ترجمه کردی ولی لحن خیلی رسمی شد. قبل از ترجمهٔ دوباره، در دو جمله بنویس چرا لحن از دست رفت، بعد با همان درس دوباره ترجمه کن.»

تفاوت بازاندیشی با خودانتقاد و راستی‌آزمایی

این سه تکنیک شبیه به‌نظر می‌رسند اما کارشان فرق دارد. خودانتقاد (Self-Refine) یک پاسخ را همان‌جا صیقل می‌دهد؛ مثل ویرایش یک پاراگراف. زنجیرهٔ راستی‌آزمایی (Chain of Verification) صحت ادعاها را با چند سؤال کنترلی می‌سنجد. اما بازاندیشی یک قدم فراتر می‌رود: درسِ حاصل از شکست را ذخیره می‌کند و به تلاش‌های بعدی، حتی روی کارهای مشابه دیگر، منتقل می‌کند.

به بیان ساده، خودانتقاد یعنی «این پاسخ را بهتر کن»، ولی بازاندیشی یعنی «یاد بگیر چرا این‌طور شد تا دفعهٔ بعد اصلاً پیش نیاید». برای مقایسهٔ عمیق‌تر می‌توانی آموزش پرامپت خودانتقاد و زنجیرهٔ راستی‌آزمایی را کنار همین مطلب بگذاری؛ این سه با هم یک جعبه‌ابزار قدرتمند برای بالا بردن کیفیت پاسخ می‌سازند.

مثال: «این پاراگراف را دو بار بررسی کن: بار اول با خودانتقاد فقط جمله‌بندی را بهتر کن؛ بار دوم با بازاندیشی بنویس چه الگوی اشتباهی در نوشتنم هست که باید در متن‌های بعدی هم رعایت کنم.»

چرخهٔ چهارمرحله‌ای بازاندیشی

کل تکنیک را می‌توان در یک حلقهٔ تکرارشونده خلاصه کرد. مرحلهٔ اول کنش است: مدل کار را انجام می‌دهد. مرحلهٔ دوم سنجش است: تو یا یک معیار روشن مشخص می‌کنی که کجا شکست خورد. مرحلهٔ سوم بازاندیشی است: مدل در چند جمله ریشهٔ خطا را می‌نویسد. مرحلهٔ چهارم تلاش دوباره است: مدل با در دست داشتن آن درس، دوباره تلاش می‌کند. این حلقه را می‌توانی تا رسیدن به کیفیت دلخواه تکرار کنی.

نکتهٔ مهم این است که هر چهار مرحله باید در یک گفت‌وگو و پشت سر هم اتفاق بیفتد تا مدل حافظهٔ کامل مسیر را داشته باشد. اگر بخواهی این چرخه را روی کارهای بزرگ‌تر و چندمرحله‌ای پیاده کنی، ترکیبش با تکنیک گام به عقب کمک می‌کند مسئله را قبل از حل، درست قاب‌بندی کنی.

مثال: «کار در چهار مرحله انجام شود. ۱) این ایمیل تبلیغاتی را بنویس. ۲) خودت با معیار «نرخ باز شدن» نقدش کن و نمره بده. ۳) بنویس چرا نمره پایین ماند. ۴) با همان درس، نسخهٔ بهتر را بده.»

چرخهٔ چهارمرحله‌ای بازاندیشی: کنش، سیگنال شکست، بازاندیشی و تلاش دوباره

گام یکم: به مدل یک سیگنال شکست روشن بده

بازاندیشی بدون یک سیگنال شکستِ دقیق کار نمی‌کند. اگر فقط بگویی «خوب نشد»، مدل هم درس مبهمی می‌گیرد. سیگنال خوب یعنی معیار قابل‌سنجش: پیام خطای دقیق، تستی که رد شده، شرطی که رعایت نشده، یا حتی یک نمرهٔ عددی. هرچه سیگنال شفاف‌تر باشد، بازاندیشی هم دقیق‌تر می‌شود.

اگر خودت معیار روشنی نداری، می‌توانی همان اول از مدل بخواهی معیار موفقیت را تعریف کند و بعد کار را با همان معیار بسنجد. این کار به‌ویژه در کارهای خلاقانه که «درست و غلط» مطلق ندارند خیلی مفید است.

مثال: «قبل از هر چیز سه معیار قابل‌اندازه‌گیری برای «یک عنوان خوب مقاله» تعریف کن. حالا ده عنوان بساز، هرکدام را با آن سه معیار نمره بده، و ضعیف‌ترین‌ها را کنار بگذار.»

گام دوم: ریشهٔ خطا را از زبان خود مدل بیرون بکش

قلب بازاندیشی همین‌جاست. از مدل می‌خواهی نه علامت خطا، بلکه ریشهٔ آن را بنویسد. فرق این دو حیاتی است: «کد کرش کرد» علامت است، اما «ورودی خالی را چک نکردم» ریشه است. وقتی مدل مجبور شود ریشه را کلمه‌به‌کلمه بنویسد، عملاً راه‌حل هم در دلش پیداست.

برای اینکه بازاندیشی به یک عذرخواهی توخالی تبدیل نشود، محدودیت بگذار: مثلاً «حداکثر دو جمله» و «بدون تعارف، فقط دلیل فنی». این کار مدل را وادار می‌کند به‌جای «متأسفم که اشتباه کردم»، دقیقاً انگشت روی نقطهٔ ضعف بگذارد. اگر می‌خواهی بدانی چرا مدل‌ها گاهی مطمئن ولی غلط جواب می‌دهند، مطلب توان و محدودیت‌های واقعی هوش مصنوعی زمینهٔ خوبی می‌دهد.

مثال: «پاسخ قبلی‌ات به سؤال ریاضی غلط بود؛ جواب درست ۱۸ است نه ۲۴. در حداکثر دو جمله و فقط از نظر منطقی بنویس در کدام گام محاسبه اشتباه کردی و چرا.»

گام سوم: درس را به یک قانون کوتاه و قابل‌استفاده تبدیل کن

یک بازاندیشی خوب باید به چیزی تبدیل شود که بتوانی دوباره از آن استفاده کنی. پس بعد از نوشتن ریشهٔ خطا، از مدل بخواه آن را به یک «قانون» یک‌خطی و کلی خلاصه کند. قانون خوب مستقل از این مورد خاص است و روی کارهای مشابه بعدی هم جواب می‌دهد. مثلاً به‌جای «این تابع باید ورودی خالی را چک کند»، قانون کلی می‌شود «همیشه قبل از پردازش، حالت‌های مرزی ورودی را بررسی کن».

این تبدیلِ «خطای خاص» به «قانون کلی» همان چیزی است که بازاندیشی را از یک اصلاح لحظه‌ای به یک یادگیری ماندگار ارتقا می‌دهد. این قوانین دقیقاً همان چیزی هستند که در گام بعد در دفترچهٔ درس‌ها ذخیره می‌کنیم.

مثال: «حالا از دلیل خطایی که نوشتی، یک قانون کلی و کوتاه بساز که روی هر کد مشابه دیگری هم قابل‌استفاده باشد، نه فقط همین مورد.»

گام چهارم: تلاش دوباره با حافظهٔ درس‌ها

حالا که ریشهٔ خطا و قانونش را داری، تلاش دوباره را انجام بده؛ اما این بار صریحاً از مدل بخواه که پاسخ جدیدش را با رعایت آن قانون بسازد و در انتها توضیح دهد که کجا قانون را اعمال کرده است. این «گزارش اعمال قانون» تضمین می‌کند که درس واقعاً به کار رفته، نه اینکه فقط تزئینی نوشته شده باشد.

اگر بعد از تلاش دوم هنوز به کیفیت دلخواه نرسیدی، حلقه را تکرار کن؛ ولی مراقب باش که هر دور یک سیگنال شکست تازه و مشخص داشته باشد، وگرنه مدل در جا می‌زند. معمولاً دو تا سه دور برای بیشتر کارها کافی است.

مثال: «با رعایت قانونی که ساختی، نسخهٔ نهایی کد را بنویس. زیر کد، در یک خط توضیح بده دقیقاً کجا آن قانون را اعمال کردی.»

دفترچهٔ درس‌ها به‌عنوان حافظهٔ بلندمدت برای پرامپت‌های بازاندیشی

دفترچهٔ درس‌ها؛ حافظهٔ بلندمدت پرامپت‌های شما

تا اینجا بازاندیشی درون یک گفت‌وگو اتفاق افتاد. اما قدرت واقعی وقتی آزاد می‌شود که درس‌ها را از دل گفت‌وگوها بیرون بکشی و در یک فایل ساده جمع کنی؛ چیزی که من اسمش را «دفترچهٔ درس‌ها» می‌گذارم. این دفترچه فهرستی از قوانین کوتاهی است که از شکست‌های قبلی یاد گرفته‌ای، و کافی است ابتدای کارهای مشابهِ بعدی همان‌ها را به مدل بدهی.

این کار عملاً به مدل یک حافظهٔ بلندمدت می‌دهد که بین گفت‌وگوها زنده می‌ماند. هرچه بیشتر کار کنی، دفترچه پرتر و پاسخ‌ها پخته‌تر می‌شوند. این همان تفاوتی است که یک کاربر حرفه‌ای را از یک تازه‌کار جدا می‌کند؛ موضوعی که در توهم توسعه‌دهندهٔ تنها در برابر مهندس واقعی هم به‌خوبی نشان داده شده است. برای دیدن جای این تکنیک در کل مسیر یادگیری، به سری کامل آموزش پرامپت‌نویسی سر بزن.

مثال: «این دفترچهٔ درس‌های من است؛ قبل از شروع کار، آن‌ها را بخوان و در پاسخت رعایت کن: ۱) خروجی همیشه JSON معتبر باشد. ۲) قبل از نتیجه‌گیری، فرض‌ها را فهرست کن. ۳) اعداد را با منبع بده.»

کجا بازاندیشی جواب می‌دهد و اشتباه‌های رایج

بازاندیشی جادو نیست و همه‌جا به‌درد نمی‌خورد. برای کارهای ساده و یک‌خطی، مثل یک ترجمهٔ کوتاه یا یک سؤال سرراست، فقط وقت و توکن هدر می‌دهد. بهترین جای استفاده‌اش کارهای چندمرحله‌ای با معیار موفقیت روشن است: کدنویسی و تست، حل مسئله، تحلیل داده، و پیش‌نویس‌هایی که باید چند بار پخته شوند. اگر می‌خواهی ببینی این نوع بهره‌وری چطور در کسب‌وکار ارزش می‌سازد، اهمیت هوش مصنوعی در کسب‌وکار را بخوان.

رایج‌ترین اشتباه‌ها هم اینها هستند: سیگنال شکست مبهم که به درس مبهم منجر می‌شود؛ رضایت به عذرخواهی به‌جای ریشه‌یابی واقعی؛ تکرار بی‌پایان حلقه بدون سیگنال تازه؛ و ذخیره‌نکردن درس‌ها که باعث می‌شود هر بار از صفر شروع کنی. برای شروع و تمرین بیشتر، آموزش‌های چت‌جی‌پی‌تی و آشنایی با اوپن‌ای‌آی نقطهٔ خوبی برای ادامهٔ مسیر است.

مثال: «این کار فقط یک جملهٔ ساده است؛ نیازی به بازاندیشی ندارد، مستقیم و کوتاه جواب بده.» (یعنی بدانی کجا این تکنیک را خاموش کنی هم به‌اندازهٔ روشن‌کردنش مهم است.)

پرسش‌های پرتکرار

بازاندیشی با «دوباره امتحان کن» چه فرقی دارد؟ در «دوباره امتحان کن» مدل نمی‌داند چه چیزی غلط بود؛ در بازاندیشی اول ریشهٔ خطا را می‌نویسد و بعد با آن درس تلاش می‌کند، پس احتمال تکرار همان خطا خیلی کمتر است.

چند بار باید حلقه را تکرار کنم؟ معمولاً دو تا سه دور برای بیشتر کارها کافی است. اگر بعد از سه دور پیشرفتی ندیدی، احتمالاً مشکل از سیگنال شکست یا صورت‌مسئله است، نه از تعداد تکرار.

آیا برای همهٔ مدل‌ها کار می‌کند؟ بله، بازاندیشی یک تکنیک پرامپت‌نویسی است و به مدل خاصی وابسته نیست؛ روی مدل‌های قوی‌تر که استدلال بهتری دارند نتیجهٔ محسوس‌تری می‌گیری.

✏️ تمرین

مهم‌ترین تفاوت بازاندیشی (Reflexion) با خودانتقاد ساده چیست؟

🔒

این تمرین ویژهٔ اعضاست

برای دیدن این بخش باید عضو ویژه (VIP) باشی. با شمارهٔ موبایلت وارد شو تا ۱۴ روز دسترسی رایگان فعال شود.

🎁 ورود / ثبت‌نام و شروع ۱۴ روز رایگان
قبلاً عضو شده‌ای؟ فقط کافی است وارد شوی. اشتراک: از ۱۹۹٬۰۰۰ تومان / ماه
جمع‌بندی. بازاندیشی یعنی به‌جای فرستادن کورکورانهٔ مدل به تلاش دوباره، اول از او بخواهی ریشهٔ شکستش را بنویسد، آن را به یک قانون کوتاه تبدیل کند، و با همان درس دوباره تلاش کند. وقتی این درس‌ها را در «دفترچهٔ درس‌ها» جمع کنی، عملاً به مدل یک حافظهٔ بلندمدت می‌دهی که هر بار پاسخ‌ها را پخته‌تر می‌کند. همین امروز روی یک کار واقعی امتحانش کن و اولین قانونت را بنویس. برای آموزش‌های تازهٔ هوش مصنوعی، ما را در @MrChatGPT_IR دنبال کن.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *