پرامپت تحلیل تصویر ورودی و مشخص‌کردن محدودهٔ توجه در اسکرین‌شات

پرامپت تحلیل تصویر ورودی؛ از عکس و اسکرین‌شات جواب دقیق بگیر

⏱ زمان مطالعه: حدود ۱۰ دقیقه✏️ تمرین دارد
آموزش · پرامپت‌نویسی

مدل‌های تازهٔ هوش مصنوعی دیگر فقط متن نمی‌خوانند؛ چشم هم دارند. می‌توانید یک عکس، اسکرین‌شات، فاکتور، فرم دست‌نویس یا نمودار به آن‌ها بدهید و بخواهید تحلیلش کنند. اما اگر تا حالا یک تصویر آپلود کرده‌اید و جواب کلی و بی‌فایده گرفته‌اید، مشکل از دید مدل نیست؛ از پرامپت است. در این آموزش یاد می‌گیرید چطور با یک پرامپت درست، از هر تصویری دادهٔ دقیق و قابل‌استفاده بیرون بکشید.

چکیده. تحلیل تصویر ورودی یعنی شما تصویر را می‌دهید و مدل باید آن را بخواند و بفهمد؛ این تکنیک با ساخت تصویر کاملاً فرق دارد. سه ستون یک پرامپت خوب برای تصویر عبارت‌اند از: مشخص‌کردن محدودهٔ توجه، تعیین قالب خروجی ساخت‌یافته، و روشن‌کردن مرز نامعلوم تا مدل بخش‌های ناخوانا را حدس نزند. در ادامه هر ستون را با مثال‌های واقعی و کاربردی برای فاکتور، اسکرین‌شات، فرم و نمودار می‌بینید.

قدم اول: تفاوت «خواندن تصویر» با «ساختن تصویر»

خیلی‌ها وقتی حرف از «پرامپت تصویر» می‌شود، ذهنشان می‌رود سراغ تولید عکس با میدجرنی یا دال‌ئی. اما یک دنیای کاملاً جدا هم وجود دارد: دادن تصویر به مدل و خواستن تحلیل. در حالت اول مدل خالق است، در حالت دوم مدل خواننده و تحلیل‌گر است. برای تولید تصویر باید سوژه، سبک و نور را توصیف کنید؛ اما برای تحلیل تصویر باید بگویید به چه چیزی نگاه کند، چه چیزی را استخراج کند و خروجی را چطور تحویل دهد. اگر تازه‌کار هستید، پیشنهاد می‌کنم اول با مبانی پرامپت‌نویسی به زبان ساده شروع کنید تا پایهٔ کار محکم شود.

مثال: «به این عکس نگاه کن و بگو در آن چه می‌بینی» یک پرامپت ضعیف است. نسخهٔ حرفه‌ای‌اش این است: «این عکس یک قفسهٔ فروشگاه است؛ فقط محصولاتی که برچسب قیمت قرمز دارند را فهرست کن و قیمت هرکدام را کنارش بنویس.»

کاربردهای واقعی این تکنیک بی‌شمار است و هر روز بیشتر می‌شود: خواندن یک فاکتور کاغذی و تبدیلش به داده، تحلیل اسکرین‌شات یک پیام خطا در برنامه‌نویسی، استخراج جدول از عکس یک اسلاید، مقایسهٔ دو طرح گرافیکی، خواندن نمودار یک گزارش مالی، یا حتی توضیح یک مسئلهٔ ریاضی از روی عکس دفتر. نکتهٔ مشترک همهٔ این موارد این است که ارزش کار در دقت است؛ یک جواب تقریبی و کلی به درد نمی‌خورد و گاهی حتی خطرناک است. برای همین، پرامپت تحلیل تصویر باید سنجیده‌تر از یک پرامپت متنی معمولی نوشته شود.

قدم دوم: محدودهٔ توجه را مشخص کن

بزرگ‌ترین اشتباه، پرامپت باز و کلی است. وقتی می‌گویید «این را توضیح بده»، مدل مجبور است حدس بزند کدام بخش برایتان مهم است و معمولاً وقتش را روی جزئیات بی‌ربط تلف می‌کند. به‌جایش، مثل یک کارگردان، دوربین را روی نقطهٔ درست بگذارید. بگویید به کدام گوشه، کدام ردیف، یا کدام رنگ نگاه کند. هرچه محدوده باریک‌تر باشد، دقت بالاتر می‌رود.

مثال: «در این اسکرین‌شات فقط به نوار خطای قرمز بالای صفحه نگاه کن، متن خطا را کلمه‌به‌کلمه بنویس و بعد سه علت محتمل برایش فهرست کن؛ به بقیهٔ صفحه کاری نداشته باش.»

پرامپت تحلیل تصویر ورودی و مشخص‌کردن محدودهٔ توجه در اسکرین‌شات

قدم سوم: نقش و هدف را به مدل بده

همان‌طور که در نقش‌دهی متنی جواب عوض می‌شود، در تحلیل تصویر هم دادن نقش، عمق پاسخ را چند برابر می‌کند. وقتی به مدل می‌گویید «تو یک حسابدار هستی» یا «تو یک بازرس ایمنی هستی»، عینکی که با آن به تصویر نگاه می‌کند تغییر می‌کند و نکته‌هایی را می‌بیند که یک نگاه عمومی از دست می‌دهد. نقش را با هدف ترکیب کنید تا مدل بداند خروجی به چه دردی می‌خورد.

مثال: «تو یک بازرس ایمنی کارگاه هستی. به این عکس محیط کار نگاه کن و هر موردی که خطر ایمنی است را با درجهٔ ریسک بالا، متوسط یا پایین فهرست کن و برای هرکدام یک اقدام اصلاحی کوتاه پیشنهاد بده.»

نکتهٔ ظریف اینجاست که نقش باید با محتوای تصویر هم‌خوان باشد. اگر عکس یک منوی رستوران است، نقش «کارشناس تغذیه» یا «مدیر رستوران» جواب‌های متفاوتی می‌سازد؛ اولی روی کالری و ترکیب غذا تمرکز می‌کند و دومی روی قیمت‌گذاری و چیدمان منو. پس پیش از نوشتن پرامپت، از خودتان بپرسید خروجی را برای چه تصمیمی می‌خواهید و نقش را بر همان اساس انتخاب کنید.

قدم چهارم: قالب خروجی را تعیین کن (جدول و JSON)

اگر از یک تصویر داده می‌خواهید، نگذارید مدل جواب را به‌صورت پاراگراف بنویسد. قالب خروجی را صریح بخواهید: جدول برای مرور انسانی، و JSON وقتی می‌خواهید خروجی مستقیم وارد اکسل یا پایگاه داده شود. این کار عملاً یک عکس معمولی را به دادهٔ ساخت‌یافته تبدیل می‌کند. کنترل قالب خروجی یکی از پرکاربردترین مهارت‌های پرامپت‌نویسی است و اگر می‌خواهید عمیق‌تر یادش بگیرید، آموزش‌های چت‌جی‌پی‌تی نقطهٔ خوبی برای ادامه است.

مثال: «این رسید خرید را بخوان و خروجی را فقط در قالب JSON با این کلیدها بده: تاریخ، نام_فروشگاه، مبلغ_کل، و فهرست_اقلام که هر قلم شامل نام و قیمت باشد. هیچ توضیح اضافه‌ای ننویس.»

قدم پنجم: استخراج متن و داده از اسکرین‌شات و فاکتور

یکی از پرکاربردترین موارد، تبدیل عکس به متن است: فاکتور کاغذی، فرم دست‌نویس، اسلاید یک ارائه، یا اسکرین‌شات یک جدول. اینجا دقت همه‌چیز است. به مدل بگویید متن را دقیق و بدون تغییر بازنویسی کند، ترتیب اصلی را حفظ کند و اگر جدول است، ساختار ستون و ردیف را نگه دارد. برای کسب‌وکارها این کار می‌تواند ساعت‌ها ورود دستی داده را حذف کند؛ اهمیت این‌گونه صرفه‌جویی‌ها را در مطلب چرا هوش مصنوعی در کسب‌وکار مهم است بیشتر توضیح داده‌ایم.

مثال: «این فاکتور دست‌نویس را بخوان و در یک جدول با ستون‌های ردیف، شرح کالا، تعداد و مبلغ بازنویسی کن. ترتیب ردیف‌ها را دقیقاً مثل خود فاکتور نگه دار و جمع کل را در ردیف آخر بیاور.»

اگر متن تصویر به زبان دیگری است یا خط دست‌نویس دشوار دارد، این را هم در پرامپت بگویید. مثلاً می‌توانید بخواهید مدل اول متن را همان‌طور که هست بازنویسی کند و بعد ترجمه‌اش را در ستون کناری بیاورد. این کار دو فایده دارد: هم می‌بینید مدل دقیقاً چه چیزی خوانده و هم ترجمه را جدا در اختیار دارید. جداکردن مرحلهٔ «خواندن» از مرحلهٔ «تفسیر» یکی از مؤثرترین ترفندها برای بالابردن دقت در فاکتور، فرم و اسناد رسمی است.

قدم ششم: خواندن نمودار و چارت بدون توصیف کلی

وقتی یک نمودار می‌دهید، اغلب جواب می‌گیرید «این نمودار روند صعودی دارد» که تقریباً بی‌فایده است. به‌جای توصیف، از مدل بخواهید عددها را استخراج کند، بیشینه و کمینه را نام ببرد، و یک نتیجهٔ عملی بگیرد. مهم‌تر از همه، از او بخواهید صادق باشد دربارهٔ عددهایی که روی نمودار برچسب ندارند و نمی‌شود دقیق خواندشان.

مثال: «این نمودار فروش ماهانه را تحلیل کن: ماه اوج و ماه افت را نام ببر، درصد رشد از ابتدای دوره تا انتها را تخمین بزن، و صریح بگو کدام مقادیر را چون برچسب عددی ندارند نمی‌توان دقیق از تصویر خواند.»

برای گزارش‌های حرفه‌ای می‌توانید یک لایهٔ دیگر هم اضافه کنید: بعد از استخراج داده، از مدل بخواهید دو یا سه بینش تصمیم‌ساز از نمودار بیرون بکشد و برای هرکدام بگوید بر چه شواهدی در تصویر تکیه کرده است. این «الزام به ذکر شاهد» جلوی نتیجه‌گیری‌های بی‌پایه را می‌گیرد و تحلیل را قابل‌اعتمادتر می‌کند. همان‌طور که در متن هم ذکر منبع مهم است، در تصویر هم باید مدل بگوید حرفش را از کجای عکس درآورده است.

استخراج داده از فاکتور و اسکرین‌شات با پرامپت و خروجی جدول و JSON

قدم هفتم: مرز نامعلوم و مهار توهم تصویری

مدل‌ها وقتی بخشی از تصویر تار، کج یا ناخوانا باشد، تمایل دارند خلأ را با حدس پر کنند و همین‌جا توهم متولد می‌شود؛ عددی که وجود ندارد، کلمه‌ای که آنجا نیست. راه‌حل، یک جملهٔ ساده در پرامپت است: به مدل اجازه بده نداند. بگویید هر بخش ناخوانا را به‌جای حدس، «نامشخص» علامت بزند. این تفاوت میان یک دستیار قابل‌اعتماد و یک ماشین قصه‌ساز است. اگر می‌خواهید بدانید مرز واقعی توانایی و محدودیت این مدل‌ها کجاست، مطلب پتانسیل و محدودیت‌های واقعی هوش مصنوعی را بخوانید.

مثال: «اعداد این قبض را بخوان. هر رقمی که مطمئن نیستی درست خوانده‌ای را داخل کروشه و با کلمهٔ نامطمئن مشخص کن، و اگر بخشی کاملاً ناخواناست بنویس نامشخص. تحت هیچ شرایطی عددی را که واضح نمی‌بینی از خودت نساز.»

قدم هشتم: چند تصویر با هم؛ مقایسه و قبل و بعد

گاهی قدرت واقعی در دادن چند تصویر هم‌زمان است. می‌توانید دو نسخه از یک طراحی، یک عکس قبل و بعد، یا چند اسکرین‌شات از یک روند را با هم بدهید و بخواهید مدل تفاوت‌ها را پیدا کند. کلید کار این است که به تصاویر شماره بدهید تا مدل بداند به کدام اشاره می‌کند. این تکنیک برای بازبینی طراحی، کنترل کیفیت و تحلیل رقبا فوق‌العاده است.

مثال: «دو تصویر می‌فرستم؛ تصویر ۱ نسخهٔ قبلی صفحهٔ محصول و تصویر ۲ نسخهٔ جدید است. در یک جدول سه‌ستونی تفاوت‌های چیدمان، رنگ و متن دکمه‌ها را فهرست کن و در ستون آخر بگو هر تغییر احتمالاً چه اثری بر نرخ کلیک دارد.»

مهار توهم مدل در خواندن تصویر و علامت‌گذاری بخش ناخوانا به‌عنوان نامشخص

پرسش‌های پرتکرار

آیا همهٔ مدل‌ها می‌توانند تصویر را تحلیل کنند؟ نسخه‌های جدید چت‌جی‌پی‌تی، جمینای و کلود ورودی تصویری دارند، اما کیفیتشان فرق می‌کند؛ برای متن ریز و دست‌خط، مدل قوی‌تر جواب دقیق‌تری می‌دهد. آخرین وضعیت مدل‌ها را می‌توانید در بخش اخبار دنبال کنید.

چرا مدل گاهی متن عکس را اشتباه می‌خواند؟ معمولاً به‌خاطر کیفیت پایین، کجی یا نور بد تصویر است. عکس واضح و صاف بگیرید و در پرامپت از مدل بخواهید بخش ناخوانا را حدس نزند.

آیا می‌توانم به دادهٔ استخراج‌شده اعتماد کامل کنم؟ نه به‌طور کورکورانه. برای کارهای حساس مثل حسابداری، همیشه خروجی را با اصل تصویر یک‌بار مقابله کنید؛ چرا هوش مصنوعی جای مهارت انسانی را کامل نمی‌گیرد را در مطلب توهم توسعه‌دهندهٔ تنها توضیح داده‌ایم.

✏️ تمرین

در پرامپت تحلیل تصویر، کدام کار بیشترین اثر را در جلوگیری از توهم مدل روی بخش‌های ناخوانا دارد؟

🔒

این تمرین ویژهٔ اعضاست

برای دیدن این بخش باید عضو ویژه (VIP) باشی. با شمارهٔ موبایلت وارد شو تا ۱۴ روز دسترسی رایگان فعال شود.

🎁 ورود / ثبت‌نام و شروع ۱۴ روز رایگان
قبلاً عضو شده‌ای؟ فقط کافی است وارد شوی. اشتراک: از ۱۹۹٬۰۰۰ تومان / ماه
جمع‌بندی. تحلیل تصویر ورودی یک ابرقدرت تازه در دست شماست، اما فقط وقتی درست ازش بخواهید. سه عادت را همیشه به یاد داشته باشید: محدودهٔ توجه را مشخص کن، قالب خروجی ساخت‌یافته بده، و مرز نامعلوم را روشن کن تا مدل چیز ناخوانا را نسازد. همین سه قانون، عکس و اسکرین‌شات شما را از یک تصویر ساده به منبع دادهٔ قابل‌اعتماد تبدیل می‌کند. این درس بخشی از یک مسیر آموزشی کامل است؛ بقیهٔ تکنیک‌ها را در سری آموزش پرامپت‌نویسی دنبال کنید. برای درس‌ها و پرامپت‌های تازه، به کانال ما بپیوندید: @MrChatGPT_IR

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *