قسمت اول سری پرامپتنویسی تصویر: پرامپت تصویری از چه اجزایی ساخته میشود، چرا هر مدل یک برداشت متفاوت از حرف شما دارد، و چطور در سه تلاش به اولین تصویر قابلقبول برسید.

لیست مطالب
۱. پرامپت تصویری با پرامپت متنی چه فرقی دارد؟
وقتی از یک مدل زبانی متن میخواهید، در واقع با چیزی حرف میزنید که جملهها را دنبال میکند: منظور شما را از ساختار جمله، از ترتیب استدلال و از لحن میفهمد. مدلهای تصویرساز اینطور کار نمیکنند. آنها متن شما را به یک بردار معنایی تبدیل میکنند و بعد تصویری میسازند که به آن بردار نزدیک باشد. نتیجهٔ عملی این تفاوت یک نکتهٔ مهم است: در پرامپت تصویری، وزن کلمهها مهمتر از دستور زبان است. جملهٔ «یک گربه که روی صندلی چوبی کنار پنجره نشسته و نور بعدازظهر روی صورتش افتاده» و فهرست «گربه، صندلی چوبی، کنار پنجره، نور بعدازظهر روی صورت» تقریباً یک تصویر میسازند، اما فهرست کنترل بیشتری به شما میدهد چون میتوانید هر جزء را جدا اضافه یا حذف کنید.
تفاوت دوم، نبودِ حافظهٔ گفتوگویی است. در چت متنی میتوانید بگویید «همان را کوتاهتر کن». در تصویرسازی، هر بار پرامپت کامل دوباره خوانده میشود؛ حتی اگر ابزار شما امکان ویرایش داشته باشد، مدل چیزی از تلاش قبلی «به یاد نمیآورد» مگر آنکه در متن جدید تکرارش کنید. به همین دلیل عادت درست این است که پرامپت را همیشه بهصورت یک متن کامل و مستقل نگه دارید، نه دنبالهٔ اصلاحات.
تفاوت سوم، تفسیرپذیری واژههای انتزاعی است. کلمهای مثل «زیبا»، «مدرن» یا «حرفهای» برای مدل تقریباً بیمعناست، چون میلیونها تصویر با این برچسبها آموزش دیدهاند و هیچکدام یک نقطهٔ مشخص در فضای معنایی نمیسازند. هر واژهٔ انتزاعی که در پرامپت میگذارید، یک تصمیم است که به مدل واگذار میکنید.
۲. چهار جزء حداقلی هر پرامپت تصویری
پرامپتهای حرفهای در قسمتهای بعدی این سری نُه جزء دارند، اما برای شروع فقط چهار جزء لازم است و همین چهارتا بیش از هفتاد درصد کیفیت خروجی را تعیین میکند.
سوژه: چه چیزی در مرکز تصویر است. باید یک اسم مشخص باشد، نه یک مفهوم. «یک فنجان قهوهٔ اسپرسو» سوژه است؛ «حس صبح» سوژه نیست.
زمینه: سوژه کجاست و دور و برش چه میگذرد. زمینه همان چیزی است که تصویر را از عکس محصولِ بیروح جدا میکند: «روی میز چوبی کافه، کنار دفترچهٔ باز».
نوع تصویر: این عکس است، نقاشی رنگروغن، رندر سهبعدی، تصویرسازی خطی، یا عکس تبلیغاتی استودیویی؟ اگر این را نگویید، مدل بر اساس بقیهٔ کلمهها حدس میزند و حدسش معمولاً میانگینِ بیشخصیتِ همهچیز است.
قاب: نمای نزدیک، نیمتنه، تمامقد، یا نمای باز. همین یک کلمه بیشتر از هر صفتِ دیگری تصویر را عوض میکند، چون تعیین میکند مدل چقدر از جزئیات را باید بسازد.
نور، لنز، سبک و پالت رنگ هم مهماند، اما آنها موضوع قسمت سوم و قسمت چهارم این سری هستند و اینجا عمداً واردشان نمیشویم.
۳. چرا یک پرامپت در دو مدل دو نتیجه میدهد
مدلهای تصویرساز روی مجموعهدادههای متفاوت و با معماریهای متفاوت آموزش دیدهاند، و مهمتر از آن، هرکدام یک «لایهٔ بازنویسی» متفاوت دارند. برخی ابزارها پرامپت کوتاه شما را قبل از پردازش بهصورت خودکار بسط میدهند؛ یعنی متنی که مدل واقعاً میبیند، متن شما نیست. این توضیح میدهد چرا گاهی یک پرامپت سهکلمهای نتیجهٔ فوقالعاده میدهد و یک پرامپت دقیقِ صد کلمهای نتیجهٔ عجیب: در حالت اول لایهٔ بازنویسی جای خالی را با تصمیمهای خوب پر کرده، در حالت دوم با متن شما تداخل پیدا کرده است.
در عمل سه رفتار متفاوت میبینید. دستهٔ اول مدلهایی که متن طبیعی و توصیفی را بهتر میفهمند و از فهرست کلمات کلیدی گیج میشوند. دستهٔ دوم مدلهایی که با فهرست وزندار کلمات بهترین کار را میکنند. دستهٔ سوم مدلهای داخل دستیارهای گفتوگویی که خودشان پرامپت شما را بازنویسی میکنند و بهترین راه استفاده از آنها این است که بهجای پرامپت فنی، هدف نهایی را توضیح بدهید.
راه تشخیص ساده است: یک پرامپت پایه بنویسید و همان را بدون تغییر در دو ابزار امتحان کنید. اگر ابزاری با متن طولانیتر بهتر شد، اهل توصیف است؛ اگر با متن کوتاهتر و کلیدواژهمحور بهتر شد، اهل فهرست است. این آزمایش پنجدقیقهای، ماهها حدسزدن را حذف میکند.

۴. روش سهتلاشی برای رسیدن به اولین تصویر قابلقبول
مبتدیها معمولاً یک پرامپت طولانی مینویسند، نتیجه را نمیپسندند، و بعد همهچیز را از نو عوض میکنند. این کار اطلاعاتی به شما نمیدهد چون نمیفهمید کدام تغییر اثر داشت. روش درست، سه تلاش با هدف مشخص است.
تلاش اول — اسکلت: فقط چهار جزء حداقلی را بنویسید و هیچ صفتی اضافه نکنید. هدف این تلاش زیبایی نیست؛ هدف این است که ببینید مدل سوژه و قاب را درست فهمیده یا نه. اگر گربه شد سگ یا نمای نزدیک شد نمای باز، مشکل در بنیاد است و اضافهکردن صفت آن را حل نمیکند.
تلاش دوم — تصحیح یک مورد: فقط و فقط بزرگترین ایرادِ تلاش اول را برطرف کنید. یک تغییر، نه بیشتر. اگر همزمان چهار چیز را عوض کنید، هرگز نمیفهمید کدامیک جواب داد و این دانش برای پرامپتهای بعدیتان از خود تصویر ارزشمندتر است.
تلاش سوم — غنیسازی: حالا که اسکلت درست است، دو یا سه جزئیات کیفی اضافه کنید: جنس سطح، حالت چهره، یک عنصر فرعی در پسزمینه. اگر تصویر بعد از این سه تلاش هنوز قابل استفاده نیست، معمولاً یعنی سوژهتان برای این مدل بیش از حد پیچیده است و باید سادهترش کنید، نه اینکه پرامپت را بلندتر کنید.
۵. سه اشتباهی که تصویر اول را خراب میکند
انباشتن صفتهای تشویقی. عبارتهایی مثل «بسیار زیبا، شاهکار، کیفیت هشتکا، برندهٔ جایزه» زمانی در مدلهای قدیمی اثر داشت. در مدلهای امروزی این کلمات بیشتر از آنکه کیفیت را بالا ببرند، تصویر را به سمت زیباییشناسی کلیشهای و مصنوعی هل میدهند. یک توصیف مشخص از جنس نور، ارزش ده صفتِ تشویقی را دارد.
تضاد پنهان در پرامپت. نوشتن «نمای نزدیک از صورت» در کنار «چشمانداز وسیع کوهستان در پسزمینه» مدل را بین دو خواسته گیر میاندازد و نتیجه معمولاً هیچکدام نیست. قبل از اجرا، پرامپت را یکبار بخوانید و بپرسید آیا این تصویر از نظر فیزیکی امکانپذیر است.
توصیف چیزی که نمیخواهید. نوشتن «بدون متن» یا «بدون آدم» در پرامپت اصلی، در بسیاری از مدلها نتیجهٔ معکوس میدهد چون آن مفهوم را فعال میکند. مدیریت درستِ نخواستن، موضوع پرامپت منفی است که در قسمت ششم سری به آن میپردازیم.
۶. یک پرامپت پایهٔ آمادهٔ کپی
این پرامپت عمداً ساده است و فقط چهار جزء حداقلی را دارد. آن را عیناً اجرا کنید، بعد فقط یک بخش از آن را عوض کنید و اثرش را ببینید. این تمرین بیش از خواندن ده مقاله به شما یاد میدهد.
یک فنجان قهوهٔ اسپرسو روی میز چوبی تیره در یک کافهٔ کوچک، کنار یک دفترچهٔ باز و یک خودکار، عکس واقعگرایانه، نمای نزدیک از زاویهٔ کمی بالاتر از میز، پسزمینه بهآرامی محو
حالا نسخهٔ دوم را با تغییر فقط «نوع تصویر» بسازید: بهجای «عکس واقعگرایانه» بنویسید «تصویرسازی آبرنگ». همهچیز دیگر ثابت. تفاوت دو خروجی به شما نشان میدهد که یک جزء از پرامپت چقدر قدرت دارد.

۷. نقشهٔ راه بقیهٔ سری
این قسمت عمداً چیزهایی را کنار گذاشت که در قسمتهای بعدی جای بهتری دارند. قسمت دوم ساختار کامل نُهمرحلهای را میدهد که در آن هر جزء جای مشخصی دارد. قسمت سوم به نور، لنز و عمق میدان میپردازد؛ یعنی همان چیزی که تصویر آماتور را از حرفهای جدا میکند. قسمت چهارم دربارهٔ سبک، پالت رنگ و ارجاع هنری بدون کپیبرداری است. قسمت پنجم مسئلهٔ سختِ ثابتنگهداشتن یک شخصیت در چند تصویر را حل میکند و قسمت ششم به پرامپت منفی و رفع خطاهای رایج مثل دستهای اشتباه اختصاص دارد. فهرست کامل قسمتها در صفحهٔ سری پرامپتنویسی است.
اگر پیش از ادامه میخواهید پایهٔ پرامپتنویسی متنی را هم محکم کنید، راهنمای پرامپتنویسی برای مبتدیها نقطهٔ شروع خوبی است، و برای شناخت بازیگران اصلی این حوزه میتوانید معرفی اوپنایآی را بخوانید.
۸. پرسش و پاسخ
پرامپت باید فارسی باشد یا انگلیسی؟ بیشتر مدلها روی دادههای عمدتاً انگلیسی آموزش دیدهاند، پس پرامپت انگلیسی معمولاً دقت بیشتری در جزئیات فنی میدهد. اما اگر از یک دستیار گفتوگویی استفاده میکنید، نوشتن به فارسی کاملاً کار میکند چون خودش ترجمه و بسط میدهد. توصیهٔ عملی: مفهوم را فارسی بنویسید، و اگر نتیجه دقیق نبود همان را انگلیسی امتحان کنید.
پرامپت چقدر باید بلند باشد؟ هیچ عدد جادویی وجود ندارد، اما قاعدهٔ کاربردی این است: هر جملهای که یک تصمیم بصری مشخص میگیرد، بماند؛ هر جملهای که فقط تعریف و تمجید است، برود. معمولاً بین چهل تا صد کلمه برای اکثر تصاویر کافی است.
چرا خروجی من هر بار متفاوت است؟ چون فرایند تولید تصویر تصادفی است و از یک نقطهٔ شروع اتفاقی حرکت میکند. اگر ابزارتان امکان تعیین «سید» میدهد، با ثابتکردن آن میتوانید تغییرات پرامپت را منصفانه مقایسه کنید.
برای شبکههای اجتماعی از کجا شروع کنم؟ از قاب شروع کنید، نه از سوژه. تصویری که برای پست مربعی ساخته شده در استوری بریده میشود. تعیین نسبت تصویر در همان تلاش اول، دوبارهکاری را حذف میکند.
در تلاش اولِ روش سهتلاشی، هدف اصلی چیست؟
این تمرین ویژهٔ اعضاست
برای دیدن این بخش باید عضو ویژه (VIP) باشی. با شمارهٔ موبایلت وارد شو تا ۱۴ روز دسترسی رایگان فعال شود.
🎁 ورود / ثبتنام و شروع ۱۴ روز رایگان