مبانی پرامپت‌نویسی تصویر با هوش مصنوعی

قسمت ۱ — مبانی پرامپت‌نویسی تصویر

⏱ زمان مطالعه: حدود ۱۰ دقیقه✏️ تمرین دارد
آموزش · پرامپت‌نویسی

قسمت اول سری پرامپت‌نویسی تصویر: پرامپت تصویری از چه اجزایی ساخته می‌شود، چرا هر مدل یک برداشت متفاوت از حرف شما دارد، و چطور در سه تلاش به اولین تصویر قابل‌قبول برسید.

چکیده. بیشتر کسانی که از تصویرسازی هوش مصنوعی ناامید می‌شوند، مشکلشان خلاقیت نیست؛ مشکلشان این است که نمی‌دانند مدل دقیقاً به چه چیزی در جملهٔ آن‌ها واکنش نشان می‌دهد. این قسمت پایهٔ سری است: یاد می‌گیرید یک پرامپت تصویری از چه بخش‌هایی تشکیل شده، این بخش‌ها در ذهن مدل چه نقشی دارند، چرا یک متن یکسان در دو مدل مختلف دو خروجی کاملاً متفاوت می‌دهد، و با چه روش کوتاهی می‌توانید بدون دانش فنی به اولین تصویر «قابل استفاده» برسید. قسمت‌های بعدی سری روی جزئیات حرفه‌ای بنا می‌شوند؛ این قسمت زمینِ زیر پای آن‌هاست.
مبانی پرامپت‌نویسی تصویر با هوش مصنوعی

۱. پرامپت تصویری با پرامپت متنی چه فرقی دارد؟

وقتی از یک مدل زبانی متن می‌خواهید، در واقع با چیزی حرف می‌زنید که جمله‌ها را دنبال می‌کند: منظور شما را از ساختار جمله، از ترتیب استدلال و از لحن می‌فهمد. مدل‌های تصویرساز این‌طور کار نمی‌کنند. آن‌ها متن شما را به یک بردار معنایی تبدیل می‌کنند و بعد تصویری می‌سازند که به آن بردار نزدیک باشد. نتیجهٔ عملی این تفاوت یک نکتهٔ مهم است: در پرامپت تصویری، وزن کلمه‌ها مهم‌تر از دستور زبان است. جملهٔ «یک گربه که روی صندلی چوبی کنار پنجره نشسته و نور بعدازظهر روی صورتش افتاده» و فهرست «گربه، صندلی چوبی، کنار پنجره، نور بعدازظهر روی صورت» تقریباً یک تصویر می‌سازند، اما فهرست کنترل بیشتری به شما می‌دهد چون می‌توانید هر جزء را جدا اضافه یا حذف کنید.

تفاوت دوم، نبودِ حافظهٔ گفت‌وگویی است. در چت متنی می‌توانید بگویید «همان را کوتاه‌تر کن». در تصویرسازی، هر بار پرامپت کامل دوباره خوانده می‌شود؛ حتی اگر ابزار شما امکان ویرایش داشته باشد، مدل چیزی از تلاش قبلی «به یاد نمی‌آورد» مگر آنکه در متن جدید تکرارش کنید. به همین دلیل عادت درست این است که پرامپت را همیشه به‌صورت یک متن کامل و مستقل نگه دارید، نه دنبالهٔ اصلاحات.

تفاوت سوم، تفسیرپذیری واژه‌های انتزاعی است. کلمه‌ای مثل «زیبا»، «مدرن» یا «حرفه‌ای» برای مدل تقریباً بی‌معناست، چون میلیون‌ها تصویر با این برچسب‌ها آموزش دیده‌اند و هیچ‌کدام یک نقطهٔ مشخص در فضای معنایی نمی‌سازند. هر واژهٔ انتزاعی که در پرامپت می‌گذارید، یک تصمیم است که به مدل واگذار می‌کنید.

۲. چهار جزء حداقلی هر پرامپت تصویری

پرامپت‌های حرفه‌ای در قسمت‌های بعدی این سری نُه جزء دارند، اما برای شروع فقط چهار جزء لازم است و همین چهارتا بیش از هفتاد درصد کیفیت خروجی را تعیین می‌کند.

سوژه: چه چیزی در مرکز تصویر است. باید یک اسم مشخص باشد، نه یک مفهوم. «یک فنجان قهوهٔ اسپرسو» سوژه است؛ «حس صبح» سوژه نیست.

زمینه: سوژه کجاست و دور و برش چه می‌گذرد. زمینه همان چیزی است که تصویر را از عکس محصولِ بی‌روح جدا می‌کند: «روی میز چوبی کافه، کنار دفترچهٔ باز».

نوع تصویر: این عکس است، نقاشی رنگ‌روغن، رندر سه‌بعدی، تصویرسازی خطی، یا عکس تبلیغاتی استودیویی؟ اگر این را نگویید، مدل بر اساس بقیهٔ کلمه‌ها حدس می‌زند و حدسش معمولاً میانگینِ بی‌شخصیتِ همه‌چیز است.

قاب: نمای نزدیک، نیم‌تنه، تمام‌قد، یا نمای باز. همین یک کلمه بیشتر از هر صفتِ دیگری تصویر را عوض می‌کند، چون تعیین می‌کند مدل چقدر از جزئیات را باید بسازد.

نور، لنز، سبک و پالت رنگ هم مهم‌اند، اما آن‌ها موضوع قسمت سوم و قسمت چهارم این سری هستند و اینجا عمداً واردشان نمی‌شویم.

۳. چرا یک پرامپت در دو مدل دو نتیجه می‌دهد

مدل‌های تصویرساز روی مجموعه‌داده‌های متفاوت و با معماری‌های متفاوت آموزش دیده‌اند، و مهم‌تر از آن، هرکدام یک «لایهٔ بازنویسی» متفاوت دارند. برخی ابزارها پرامپت کوتاه شما را قبل از پردازش به‌صورت خودکار بسط می‌دهند؛ یعنی متنی که مدل واقعاً می‌بیند، متن شما نیست. این توضیح می‌دهد چرا گاهی یک پرامپت سه‌کلمه‌ای نتیجهٔ فوق‌العاده می‌دهد و یک پرامپت دقیقِ صد کلمه‌ای نتیجهٔ عجیب: در حالت اول لایهٔ بازنویسی جای خالی را با تصمیم‌های خوب پر کرده، در حالت دوم با متن شما تداخل پیدا کرده است.

در عمل سه رفتار متفاوت می‌بینید. دستهٔ اول مدل‌هایی که متن طبیعی و توصیفی را بهتر می‌فهمند و از فهرست کلمات کلیدی گیج می‌شوند. دستهٔ دوم مدل‌هایی که با فهرست وزن‌دار کلمات بهترین کار را می‌کنند. دستهٔ سوم مدل‌های داخل دستیارهای گفت‌وگویی که خودشان پرامپت شما را بازنویسی می‌کنند و بهترین راه استفاده از آن‌ها این است که به‌جای پرامپت فنی، هدف نهایی را توضیح بدهید.

راه تشخیص ساده است: یک پرامپت پایه بنویسید و همان را بدون تغییر در دو ابزار امتحان کنید. اگر ابزاری با متن طولانی‌تر بهتر شد، اهل توصیف است؛ اگر با متن کوتاه‌تر و کلیدواژه‌محور بهتر شد، اهل فهرست است. این آزمایش پنج‌دقیقه‌ای، ماه‌ها حدس‌زدن را حذف می‌کند.

چهار جزء حداقلی یک پرامپت تصویری

۴. روش سه‌تلاشی برای رسیدن به اولین تصویر قابل‌قبول

مبتدی‌ها معمولاً یک پرامپت طولانی می‌نویسند، نتیجه را نمی‌پسندند، و بعد همه‌چیز را از نو عوض می‌کنند. این کار اطلاعاتی به شما نمی‌دهد چون نمی‌فهمید کدام تغییر اثر داشت. روش درست، سه تلاش با هدف مشخص است.

تلاش اول — اسکلت: فقط چهار جزء حداقلی را بنویسید و هیچ صفتی اضافه نکنید. هدف این تلاش زیبایی نیست؛ هدف این است که ببینید مدل سوژه و قاب را درست فهمیده یا نه. اگر گربه شد سگ یا نمای نزدیک شد نمای باز، مشکل در بنیاد است و اضافه‌کردن صفت آن را حل نمی‌کند.

تلاش دوم — تصحیح یک مورد: فقط و فقط بزرگ‌ترین ایرادِ تلاش اول را برطرف کنید. یک تغییر، نه بیشتر. اگر هم‌زمان چهار چیز را عوض کنید، هرگز نمی‌فهمید کدام‌یک جواب داد و این دانش برای پرامپت‌های بعدی‌تان از خود تصویر ارزشمندتر است.

تلاش سوم — غنی‌سازی: حالا که اسکلت درست است، دو یا سه جزئیات کیفی اضافه کنید: جنس سطح، حالت چهره، یک عنصر فرعی در پس‌زمینه. اگر تصویر بعد از این سه تلاش هنوز قابل استفاده نیست، معمولاً یعنی سوژه‌تان برای این مدل بیش از حد پیچیده است و باید ساده‌ترش کنید، نه اینکه پرامپت را بلندتر کنید.

۵. سه اشتباهی که تصویر اول را خراب می‌کند

انباشتن صفت‌های تشویقی. عبارت‌هایی مثل «بسیار زیبا، شاهکار، کیفیت هشت‌کا، برندهٔ جایزه» زمانی در مدل‌های قدیمی اثر داشت. در مدل‌های امروزی این کلمات بیشتر از آنکه کیفیت را بالا ببرند، تصویر را به سمت زیبایی‌شناسی کلیشه‌ای و مصنوعی هل می‌دهند. یک توصیف مشخص از جنس نور، ارزش ده صفتِ تشویقی را دارد.

تضاد پنهان در پرامپت. نوشتن «نمای نزدیک از صورت» در کنار «چشم‌انداز وسیع کوهستان در پس‌زمینه» مدل را بین دو خواسته گیر می‌اندازد و نتیجه معمولاً هیچ‌کدام نیست. قبل از اجرا، پرامپت را یک‌بار بخوانید و بپرسید آیا این تصویر از نظر فیزیکی امکان‌پذیر است.

توصیف چیزی که نمی‌خواهید. نوشتن «بدون متن» یا «بدون آدم» در پرامپت اصلی، در بسیاری از مدل‌ها نتیجهٔ معکوس می‌دهد چون آن مفهوم را فعال می‌کند. مدیریت درستِ نخواستن، موضوع پرامپت منفی است که در قسمت ششم سری به آن می‌پردازیم.

۶. یک پرامپت پایهٔ آمادهٔ کپی

این پرامپت عمداً ساده است و فقط چهار جزء حداقلی را دارد. آن را عیناً اجرا کنید، بعد فقط یک بخش از آن را عوض کنید و اثرش را ببینید. این تمرین بیش از خواندن ده مقاله به شما یاد می‌دهد.

یک فنجان قهوهٔ اسپرسو روی میز چوبی تیره در یک کافهٔ کوچک، کنار یک دفترچهٔ باز و یک خودکار، عکس واقع‌گرایانه، نمای نزدیک از زاویهٔ کمی بالاتر از میز، پس‌زمینه به‌آرامی محو

حالا نسخهٔ دوم را با تغییر فقط «نوع تصویر» بسازید: به‌جای «عکس واقع‌گرایانه» بنویسید «تصویرسازی آبرنگ». همه‌چیز دیگر ثابت. تفاوت دو خروجی به شما نشان می‌دهد که یک جزء از پرامپت چقدر قدرت دارد.

روش سه‌تلاشی برای ساخت تصویر با هوش مصنوعی

۷. نقشهٔ راه بقیهٔ سری

این قسمت عمداً چیزهایی را کنار گذاشت که در قسمت‌های بعدی جای بهتری دارند. قسمت دوم ساختار کامل نُه‌مرحله‌ای را می‌دهد که در آن هر جزء جای مشخصی دارد. قسمت سوم به نور، لنز و عمق میدان می‌پردازد؛ یعنی همان چیزی که تصویر آماتور را از حرفه‌ای جدا می‌کند. قسمت چهارم دربارهٔ سبک، پالت رنگ و ارجاع هنری بدون کپی‌برداری است. قسمت پنجم مسئلهٔ سختِ ثابت‌نگه‌داشتن یک شخصیت در چند تصویر را حل می‌کند و قسمت ششم به پرامپت منفی و رفع خطاهای رایج مثل دست‌های اشتباه اختصاص دارد. فهرست کامل قسمت‌ها در صفحهٔ سری پرامپت‌نویسی است.

اگر پیش از ادامه می‌خواهید پایهٔ پرامپت‌نویسی متنی را هم محکم کنید، راهنمای پرامپت‌نویسی برای مبتدی‌ها نقطهٔ شروع خوبی است، و برای شناخت بازیگران اصلی این حوزه می‌توانید معرفی اوپن‌ای‌آی را بخوانید.

۸. پرسش و پاسخ

پرامپت باید فارسی باشد یا انگلیسی؟ بیشتر مدل‌ها روی داده‌های عمدتاً انگلیسی آموزش دیده‌اند، پس پرامپت انگلیسی معمولاً دقت بیشتری در جزئیات فنی می‌دهد. اما اگر از یک دستیار گفت‌وگویی استفاده می‌کنید، نوشتن به فارسی کاملاً کار می‌کند چون خودش ترجمه و بسط می‌دهد. توصیهٔ عملی: مفهوم را فارسی بنویسید، و اگر نتیجه دقیق نبود همان را انگلیسی امتحان کنید.

پرامپت چقدر باید بلند باشد؟ هیچ عدد جادویی وجود ندارد، اما قاعدهٔ کاربردی این است: هر جمله‌ای که یک تصمیم بصری مشخص می‌گیرد، بماند؛ هر جمله‌ای که فقط تعریف و تمجید است، برود. معمولاً بین چهل تا صد کلمه برای اکثر تصاویر کافی است.

چرا خروجی من هر بار متفاوت است؟ چون فرایند تولید تصویر تصادفی است و از یک نقطهٔ شروع اتفاقی حرکت می‌کند. اگر ابزارتان امکان تعیین «سید» می‌دهد، با ثابت‌کردن آن می‌توانید تغییرات پرامپت را منصفانه مقایسه کنید.

برای شبکه‌های اجتماعی از کجا شروع کنم؟ از قاب شروع کنید، نه از سوژه. تصویری که برای پست مربعی ساخته شده در استوری بریده می‌شود. تعیین نسبت تصویر در همان تلاش اول، دوباره‌کاری را حذف می‌کند.

✏️ تمرین

در تلاش اولِ روش سه‌تلاشی، هدف اصلی چیست؟

🔒

این تمرین ویژهٔ اعضاست

برای دیدن این بخش باید عضو ویژه (VIP) باشی. با شمارهٔ موبایلت وارد شو تا ۱۴ روز دسترسی رایگان فعال شود.

🎁 ورود / ثبت‌نام و شروع ۱۴ روز رایگان
قبلاً عضو شده‌ای؟ فقط کافی است وارد شوی. اشتراک: از ۱۹۹٬۰۰۰ تومان / ماه
جمع‌بندی. پرامپت تصویری یک جمله نیست؛ مجموعه‌ای از تصمیم‌هاست. هر تصمیمی که خودتان نگیرید، مدل به‌جای شما می‌گیرد و معمولاً میانگین بی‌شخصیتِ همه‌چیز را انتخاب می‌کند. با چهار جزء حداقلی شروع کنید، رفتار ابزارتان را با یک آزمایش کوتاه بشناسید، و به‌جای بازنویسی کامل، هر بار یک متغیر را عوض کنید. وقتی این عادت جا افتاد، آمادهٔ ساختار نُه‌مرحله‌ای قسمت دوم هستید.
— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *