اولین جوابی که هوش مصنوعی به تو میدهد، لزوماً بهترین جوابش نیست؛ فقط سریعترین است. تکنیک «پرامپت داور» یا LLM-as-Judge کاری میکند که مدل بهجای یک تلاشِ شانسی، چند نامزدِ جواب بسازد، آنها را با معیارِ روشن بسنجد و برندهٔ نهایی را با دلیل انتخاب کند. در این آموزش گامبهگام یاد میگیری این تکنیک را روی کارهای واقعی خودت پیاده کنی.

لیست مطالب
بخش ۱: داوری چیست و چرا اولین جواب همیشه بهترین نیست؟
مدلهای زبانی هر بار که پاسخ میدهند، عملاً از میان هزاران مسیرِ ممکن یکی را انتخاب میکنند. این انتخاب سریع است، اما بهینه نیست؛ درست مثل نویسندهای که اولین جملهای را که به ذهنش میرسد مینویسد و رد میشود. «پرامپت داور» این عادت را میشکند: بهجای اینکه به تکجوابِ اول اعتماد کنی، از مدل میخواهی چند گزینه بسازد و بعد مثل یک داورِ بیطرف بینشان قضاوت کند. مغز ماجرا این است که «تولید» و «ارزیابی» دو مهارت جدا هستند و وقتی آنها را از هم جدا کنی، کیفیت پرش میکند.
مثال: «برای این پست اینستاگرام سه کپشنِ کاملاً متفاوت بنویس: یکی احساسی، یکی آماری، یکی طنز. بعد در نقش یک ادیتور حرفهای، هر کدام را از ۱۰ بر اساس «قلابداری» نمره بده و بگو کدام برای مخاطب ایرانی جواب میدهد و چرا.» اگر تازه با اصول پرامپت آشنا میشوی، پیشنهاد میکنم اول راهنمای پایهٔ پرامپتنویسی را بخوانی تا این تکنیک روی زمینهٔ محکمتری بنشیند.
بخش ۲: تفاوت داور با خودانتقادی و اجماع چندپاسخ
سه تکنیک شبیه به نظر میرسند اما هدفشان فرق دارد. در «خودانتقادی» (Self-Refine) مدل یک جواب میدهد و بعد همان را نقد و بازنویسی میکند؛ یعنی یک نامزد داری که پختهتر میشود. در «اجماع چندپاسخ» (Self-Consistency) مدل چند بار یک مسئلهٔ مشخص را حل میکند و رأیِ اکثریت را برمیداری؛ این برای جوابهای کوتاه و قطعی مثل مسائل ریاضی عالی است. اما «پرامپت داور» برای جایی است که جوابها بلند و کیفیاند و باید با معیارهای چندگانه مقایسه شوند؛ اینجا رأیگیریِ ساده کافی نیست و به یک قضاوتِ استدلالی نیاز داری.
مثال: «سه استراتژی متفاوت برای افزایش فروش یک فروشگاه اینترنتی کوچک پیشنهاد بده. سپس در یک جدول، هر استراتژی را بر اساس هزینهٔ اجرا، سرعت نتیجه و ریسک، هر کدام از ۵، نمره بده و در پایان بگو با بودجهٔ محدود کدام را انتخاب میکنی.» برای درک بهتر اینکه چرا قضاوتِ درست در تصمیمهای کسبوکار حیاتی است، این مطلب مفید است: اهمیت هوش مصنوعی در کسبوکار.
بخش ۳: سه ستون یک پرامپت داور خوب — نامزد، معیار، حکم
هر پرامپت داورِ حرفهای روی سه ستون میایستد. ستون اول «نامزدها» هستند: باید صریح بخواهی که گزینهها واقعاً متفاوت باشند، وگرنه مدل سه نسخهٔ تقریباً یکسان میسازد و داوری بیمعنا میشود. ستون دوم «معیارها» است: بدون معیارِ روشن، مدل بر اساس سلیقهٔ مبهم قضاوت میکند. ستون سوم «حکم» است: باید بخواهی نتیجه شامل نمرهٔ هر گزینه، دلیل، و انتخاب نهایی باشد تا قضاوت شفاف و قابل بازبینی شود.
مثال: «برای نام یک اپلیکیشن یادگیری زبان، پنج نام پیشنهاد بده که از نظر سبک کاملاً متفاوت باشند. معیارها: بهیادماندنی بودن (وزن ۳)، مرتبط بودن با موضوع (وزن ۲)، و کوتاهی (وزن ۱). هر نام را بر اساس هر معیار نمره بده، امتیاز وزنی را حساب کن و برندهٔ نهایی را اعلام کن.»

بخش ۴: معیارسازی — چطور یک روبریک شفاف بنویسیم؟
قلبِ داوری، «روبریک» است؛ همان فهرست معیارها با وزنهایشان. یک روبریک خوب سه ویژگی دارد: معیارها را طوری تعریف میکند که قابلسنجش باشند (مثلاً «وضوح» را به «آیا یک تازهوارد در ده ثانیه میفهمد؟» ترجمه میکنی)، به هر معیار وزن میدهد تا مدل بداند کدام مهمتر است، و مقیاس نمره را مشخص میکند (مثلاً از ۱ تا ۵). وقتی معیارها مبهم بمانند، مدل به سمت جوابهای کلی و بیخطر میرود؛ وقتی دقیق باشند، داوری هم دقیق میشود.
مثال: «این سه پیشنویسِ ایمیل بازاریابی را داوری کن. روبریک: (۱) قلاب در جملهٔ اول — آیا کنجکاوی میسازد؟ وزن ۴؛ (۲) شفافیت پیشنهاد — آیا خواننده دقیقاً میداند چه کاری انجام دهد؟ وزن ۳؛ (۳) لحن — آیا صمیمی است بدون اینکه غیرحرفهای شود؟ وزن ۲. برای هر ایمیل جدول نمره بده و برنده را با یک پاراگراف توجیه معرفی کن.»
بخش ۵: الگوی «چند نامزد بساز، بعد داوری کن» در یک پرامپت
قویترین شکل این تکنیک، انجام هر دو مرحله در یک پرامپت است: هم تولید، هم داوری. مزیتش این است که مدل نامزدها را جلوی چشمش دارد و میتواند مستقیم مقایسه کند. ساختار پیشنهادی اینگونه است: اول تعداد و تنوع نامزدها را مشخص کن، بعد روبریک را بده، سپس بخواه که نامزدها را نمره بدهد، و در آخر یا برنده را انتخاب کند یا از بهترین بخشهای چند نامزد یک نسخهٔ ترکیبیِ برتر بسازد. همین گام آخر — ساختن نسخهٔ ترکیبی — اغلب جوابی میدهد که از هر سه نامزدِ اولیه بهتر است.
مثال: «سه عنوان برای یک ویدیوی یوتیوب دربارهٔ صرفهجویی در هزینهٔ خانه بنویس؛ هر عنوان باید زاویهٔ متفاوتی داشته باشد. بعد هر عنوان را از ۱۰ بر اساس کنجکاوی، وضوح و مناسب بودن برای جستوجو نمره بده. در پایان، با ترکیب نقاط قوتِ سه عنوان، یک عنوان چهارم و بهتر بساز.» این ایدهٔ «مقایسه برای انتخاب» را میتوانی در یک نمونهٔ واقعی هم ببینی: مقایسهٔ دو هوش مصنوعی در بازی شطرنج.
بخش ۶: داوری بین دو نوشتهٔ خودت
پرامپت داور فقط برای جوابهای خودِ مدل نیست؛ یکی از کاربردیترین حالتهایش این است که دو پیشنویسِ خودت را به داوری بگذاری. مثلاً دو نسخه از معرفی محصول نوشتهای و نمیدانی کدام بهتر است. بهجای حدس زدن، هر دو را به مدل بده، معیارها را مشخص کن و بخواه بیطرفانه داوری کند. نکتهٔ مهم این است که به مدل بگویی نامِ نویسنده یا ترتیب را نادیده بگیرد تا سوگیری نکند.
مثال: «دو متنِ زیر معرفی یک دورهٔ آموزشی هستند (متن الف و متن ب). بدون توجه به ترتیب، هر کدام را بر اساس وضوح ارزش پیشنهادی، اعتمادسازی، و دعوتبهاقدام نمره بده. اگر هیچکدام کامل نبود، صریح بگو کدام قسمت از هر متن را باید در نسخهٔ نهایی نگه داریم.» برای آشنایی بیشتر با ابزارهایی که این کار را انجام میدهند، آشنایی با OpenAI نقطهٔ شروع خوبی است.
بخش ۷: داوری متقابل و مهار توهم مدل
یک کاربرد پیشرفتهتر، «داوری متقابل» است: از یک مدل میخواهی جوابِ مدلی دیگر (یا جوابِ قبلیِ خودش) را نقد و ارزیابی کند. این کار بهویژه برای کاهش «توهم» مفید است؛ چون داور موظف میشود ادعاها را وارسی کند، نه اینکه فقط زیبایی نوشته را بسنجد. یک معیارِ کلیدی که همیشه در روبریکِ داوری بگذار، «صحتِ ادعاها» است: از داور بخواه هر ادعای مهم را علامت بزند و بگوید آیا قابلاتکاست یا نیاز به بررسی دارد.
مثال: «متن زیر یک توضیح فنی است. در نقش یک داورِ سختگیر، هر جملهٔ حاوی ادعای واقعی را جدا کن و برای هر کدام بنویس: درست، مشکوک، یا نیازمند منبع. در پایان یک نمرهٔ اعتماد از ۱۰ به کل متن بده.» محدودیتهای واقعی این مدلها و اینکه چرا وارسی لازم است را اینجا بخوان: توان و محدودیتهای واقعی هوش مصنوعی.

بخش ۸: دامهای رایج داوری و راه فرار از آنها
داوریِ مدل بیعیب نیست و چند دام شناختهشده دارد. اول «سوگیری موقعیت»: مدلها تمایل دارند به گزینهٔ اول یا آخر نمرهٔ بهتری بدهند؛ راهحل این است که ترتیب نامزدها را در نظر نگیرد یا آنها را با برچسبِ خنثی (الف، ب، ج) معرفی کنی. دوم «تعارف»: مدل ممکن است بیشازحد مثبت داوری کند؛ برای مقابله، صریح بخواه که سختگیر باشد و حداقل یک ضعف برای هر نامزد پیدا کند. سوم «معیارِ ناپیدا»: اگر روبریک ندهی، مدل معیار خودش را میسازد و نتیجه غیرقابلاتکا میشود.
مثال: «این چهار ایده را با برچسب الف تا د داوری کن. سختگیر باش: برای هر ایده دقیقاً یک نقطهقوت و یک نقطهضعف بنویس، بعد نمره بده. اگر دو ایده نمرهٔ نزدیک گرفتند، معیارِ تصمیمشکن را خودت مشخص کن و توضیح بده.» قضاوت و کیفیت، همان چیزی است که کارِ حرفهای را از کارِ سطحی جدا میکند؛ این نگاه را در تفاوت توسعهدهندهٔ تنها و مهندس واقعی عمیقتر ببین.
بخش ۹: چکلیست ساختن یک پرامپت داور
برای اینکه هر بار پرامپت داورِ خوبی بسازی، این پنج قدم را طی کن: نامزدها را با تنوعِ صریح بخواه؛ روبریک را با معیارهای وزندار و قابلسنجش تعریف کن؛ مقیاس نمره و قالب خروجی (مثلاً جدول) را مشخص کن؛ برای مقابله با سوگیری، برچسبهای خنثی و سختگیری را اضافه کن؛ و در آخر بین «انتخاب برنده» یا «ساخت نسخهٔ ترکیبی» تصمیم بگیر. اگر میخواهی این تکنیک را کنار بقیهٔ روشها یکجا یاد بگیری، مجموعهٔ کامل آموزشها اینجاست: آموزشهای چتجیپیتی و برای دنبالکردن بهروزترینها هم اخبار هوش مصنوعی را از دست نده.
مثال: «قالبِ آمادهٔ داور: [کار] را در نظر بگیر. ۳ نامزدِ متفاوت بساز. روبریک: [معیار۱، وزن]، [معیار۲، وزن]، [معیار۳، وزن]. هر نامزد را با برچسب الف/ب/ج در یک جدول نمره بده، سختگیر باش، امتیاز وزنی را حساب کن، برنده را اعلام کن و در صورت امکان یک نسخهٔ ترکیبیِ بهتر بنویس.»
پرسشهای پرتکرار
پرامپت داور با پرامپت ارزیابی چه فرقی دارد؟ پرامپت ارزیابی کیفیتِ خودِ پرامپت را میسنجد، اما پرامپت داور کیفیتِ چند جوابِ تولیدشده را مقایسه میکند و بهترین را انتخاب میکند.
آیا برای کارهای ساده هم به داوری نیاز است؟ نه. برای جوابهای کوتاه و قطعی، «اجماع چندپاسخ» کافی است. داوری وقتی میدرخشد که جوابها بلند، کیفی و چندمعیاره باشند.
چند نامزد ایدهآل است؟ معمولاً سه تا پنج نامزد بهترین تعادل بین تنوع و تمرکز است؛ بیشتر از آن، داوری را سطحی و طولانی میکند.
در «پرامپت داور» (LLM-as-Judge) نقش اصلی مدل چیست؟
این تمرین ویژهٔ اعضاست
برای دیدن این بخش باید عضو ویژه (VIP) باشی. با شمارهٔ موبایلت وارد شو تا ۱۴ روز دسترسی رایگان فعال شود.
🎁 ورود / ثبتنام و شروع ۱۴ روز رایگان