مدلهای تازهٔ هوش مصنوعی دیگر فقط متن نمیخوانند؛ چشم هم دارند. میتوانید یک عکس، اسکرینشات، فاکتور، فرم دستنویس یا نمودار به آنها بدهید و بخواهید تحلیلش کنند. اما اگر تا حالا یک تصویر آپلود کردهاید و جواب کلی و بیفایده گرفتهاید، مشکل از دید مدل نیست؛ از پرامپت است. در این آموزش یاد میگیرید چطور با یک پرامپت درست، از هر تصویری دادهٔ دقیق و قابلاستفاده بیرون بکشید.
لیست مطالب
قدم اول: تفاوت «خواندن تصویر» با «ساختن تصویر»
خیلیها وقتی حرف از «پرامپت تصویر» میشود، ذهنشان میرود سراغ تولید عکس با میدجرنی یا دالئی. اما یک دنیای کاملاً جدا هم وجود دارد: دادن تصویر به مدل و خواستن تحلیل. در حالت اول مدل خالق است، در حالت دوم مدل خواننده و تحلیلگر است. برای تولید تصویر باید سوژه، سبک و نور را توصیف کنید؛ اما برای تحلیل تصویر باید بگویید به چه چیزی نگاه کند، چه چیزی را استخراج کند و خروجی را چطور تحویل دهد. اگر تازهکار هستید، پیشنهاد میکنم اول با مبانی پرامپتنویسی به زبان ساده شروع کنید تا پایهٔ کار محکم شود.
مثال: «به این عکس نگاه کن و بگو در آن چه میبینی» یک پرامپت ضعیف است. نسخهٔ حرفهایاش این است: «این عکس یک قفسهٔ فروشگاه است؛ فقط محصولاتی که برچسب قیمت قرمز دارند را فهرست کن و قیمت هرکدام را کنارش بنویس.»
کاربردهای واقعی این تکنیک بیشمار است و هر روز بیشتر میشود: خواندن یک فاکتور کاغذی و تبدیلش به داده، تحلیل اسکرینشات یک پیام خطا در برنامهنویسی، استخراج جدول از عکس یک اسلاید، مقایسهٔ دو طرح گرافیکی، خواندن نمودار یک گزارش مالی، یا حتی توضیح یک مسئلهٔ ریاضی از روی عکس دفتر. نکتهٔ مشترک همهٔ این موارد این است که ارزش کار در دقت است؛ یک جواب تقریبی و کلی به درد نمیخورد و گاهی حتی خطرناک است. برای همین، پرامپت تحلیل تصویر باید سنجیدهتر از یک پرامپت متنی معمولی نوشته شود.
قدم دوم: محدودهٔ توجه را مشخص کن
بزرگترین اشتباه، پرامپت باز و کلی است. وقتی میگویید «این را توضیح بده»، مدل مجبور است حدس بزند کدام بخش برایتان مهم است و معمولاً وقتش را روی جزئیات بیربط تلف میکند. بهجایش، مثل یک کارگردان، دوربین را روی نقطهٔ درست بگذارید. بگویید به کدام گوشه، کدام ردیف، یا کدام رنگ نگاه کند. هرچه محدوده باریکتر باشد، دقت بالاتر میرود.
مثال: «در این اسکرینشات فقط به نوار خطای قرمز بالای صفحه نگاه کن، متن خطا را کلمهبهکلمه بنویس و بعد سه علت محتمل برایش فهرست کن؛ به بقیهٔ صفحه کاری نداشته باش.»

قدم سوم: نقش و هدف را به مدل بده
همانطور که در نقشدهی متنی جواب عوض میشود، در تحلیل تصویر هم دادن نقش، عمق پاسخ را چند برابر میکند. وقتی به مدل میگویید «تو یک حسابدار هستی» یا «تو یک بازرس ایمنی هستی»، عینکی که با آن به تصویر نگاه میکند تغییر میکند و نکتههایی را میبیند که یک نگاه عمومی از دست میدهد. نقش را با هدف ترکیب کنید تا مدل بداند خروجی به چه دردی میخورد.
مثال: «تو یک بازرس ایمنی کارگاه هستی. به این عکس محیط کار نگاه کن و هر موردی که خطر ایمنی است را با درجهٔ ریسک بالا، متوسط یا پایین فهرست کن و برای هرکدام یک اقدام اصلاحی کوتاه پیشنهاد بده.»
نکتهٔ ظریف اینجاست که نقش باید با محتوای تصویر همخوان باشد. اگر عکس یک منوی رستوران است، نقش «کارشناس تغذیه» یا «مدیر رستوران» جوابهای متفاوتی میسازد؛ اولی روی کالری و ترکیب غذا تمرکز میکند و دومی روی قیمتگذاری و چیدمان منو. پس پیش از نوشتن پرامپت، از خودتان بپرسید خروجی را برای چه تصمیمی میخواهید و نقش را بر همان اساس انتخاب کنید.
قدم چهارم: قالب خروجی را تعیین کن (جدول و JSON)
اگر از یک تصویر داده میخواهید، نگذارید مدل جواب را بهصورت پاراگراف بنویسد. قالب خروجی را صریح بخواهید: جدول برای مرور انسانی، و JSON وقتی میخواهید خروجی مستقیم وارد اکسل یا پایگاه داده شود. این کار عملاً یک عکس معمولی را به دادهٔ ساختیافته تبدیل میکند. کنترل قالب خروجی یکی از پرکاربردترین مهارتهای پرامپتنویسی است و اگر میخواهید عمیقتر یادش بگیرید، آموزشهای چتجیپیتی نقطهٔ خوبی برای ادامه است.
مثال: «این رسید خرید را بخوان و خروجی را فقط در قالب JSON با این کلیدها بده: تاریخ، نام_فروشگاه، مبلغ_کل، و فهرست_اقلام که هر قلم شامل نام و قیمت باشد. هیچ توضیح اضافهای ننویس.»
قدم پنجم: استخراج متن و داده از اسکرینشات و فاکتور
یکی از پرکاربردترین موارد، تبدیل عکس به متن است: فاکتور کاغذی، فرم دستنویس، اسلاید یک ارائه، یا اسکرینشات یک جدول. اینجا دقت همهچیز است. به مدل بگویید متن را دقیق و بدون تغییر بازنویسی کند، ترتیب اصلی را حفظ کند و اگر جدول است، ساختار ستون و ردیف را نگه دارد. برای کسبوکارها این کار میتواند ساعتها ورود دستی داده را حذف کند؛ اهمیت اینگونه صرفهجوییها را در مطلب چرا هوش مصنوعی در کسبوکار مهم است بیشتر توضیح دادهایم.
مثال: «این فاکتور دستنویس را بخوان و در یک جدول با ستونهای ردیف، شرح کالا، تعداد و مبلغ بازنویسی کن. ترتیب ردیفها را دقیقاً مثل خود فاکتور نگه دار و جمع کل را در ردیف آخر بیاور.»
اگر متن تصویر به زبان دیگری است یا خط دستنویس دشوار دارد، این را هم در پرامپت بگویید. مثلاً میتوانید بخواهید مدل اول متن را همانطور که هست بازنویسی کند و بعد ترجمهاش را در ستون کناری بیاورد. این کار دو فایده دارد: هم میبینید مدل دقیقاً چه چیزی خوانده و هم ترجمه را جدا در اختیار دارید. جداکردن مرحلهٔ «خواندن» از مرحلهٔ «تفسیر» یکی از مؤثرترین ترفندها برای بالابردن دقت در فاکتور، فرم و اسناد رسمی است.
قدم ششم: خواندن نمودار و چارت بدون توصیف کلی
وقتی یک نمودار میدهید، اغلب جواب میگیرید «این نمودار روند صعودی دارد» که تقریباً بیفایده است. بهجای توصیف، از مدل بخواهید عددها را استخراج کند، بیشینه و کمینه را نام ببرد، و یک نتیجهٔ عملی بگیرد. مهمتر از همه، از او بخواهید صادق باشد دربارهٔ عددهایی که روی نمودار برچسب ندارند و نمیشود دقیق خواندشان.
مثال: «این نمودار فروش ماهانه را تحلیل کن: ماه اوج و ماه افت را نام ببر، درصد رشد از ابتدای دوره تا انتها را تخمین بزن، و صریح بگو کدام مقادیر را چون برچسب عددی ندارند نمیتوان دقیق از تصویر خواند.»
برای گزارشهای حرفهای میتوانید یک لایهٔ دیگر هم اضافه کنید: بعد از استخراج داده، از مدل بخواهید دو یا سه بینش تصمیمساز از نمودار بیرون بکشد و برای هرکدام بگوید بر چه شواهدی در تصویر تکیه کرده است. این «الزام به ذکر شاهد» جلوی نتیجهگیریهای بیپایه را میگیرد و تحلیل را قابلاعتمادتر میکند. همانطور که در متن هم ذکر منبع مهم است، در تصویر هم باید مدل بگوید حرفش را از کجای عکس درآورده است.

قدم هفتم: مرز نامعلوم و مهار توهم تصویری
مدلها وقتی بخشی از تصویر تار، کج یا ناخوانا باشد، تمایل دارند خلأ را با حدس پر کنند و همینجا توهم متولد میشود؛ عددی که وجود ندارد، کلمهای که آنجا نیست. راهحل، یک جملهٔ ساده در پرامپت است: به مدل اجازه بده نداند. بگویید هر بخش ناخوانا را بهجای حدس، «نامشخص» علامت بزند. این تفاوت میان یک دستیار قابلاعتماد و یک ماشین قصهساز است. اگر میخواهید بدانید مرز واقعی توانایی و محدودیت این مدلها کجاست، مطلب پتانسیل و محدودیتهای واقعی هوش مصنوعی را بخوانید.
مثال: «اعداد این قبض را بخوان. هر رقمی که مطمئن نیستی درست خواندهای را داخل کروشه و با کلمهٔ نامطمئن مشخص کن، و اگر بخشی کاملاً ناخواناست بنویس نامشخص. تحت هیچ شرایطی عددی را که واضح نمیبینی از خودت نساز.»
قدم هشتم: چند تصویر با هم؛ مقایسه و قبل و بعد
گاهی قدرت واقعی در دادن چند تصویر همزمان است. میتوانید دو نسخه از یک طراحی، یک عکس قبل و بعد، یا چند اسکرینشات از یک روند را با هم بدهید و بخواهید مدل تفاوتها را پیدا کند. کلید کار این است که به تصاویر شماره بدهید تا مدل بداند به کدام اشاره میکند. این تکنیک برای بازبینی طراحی، کنترل کیفیت و تحلیل رقبا فوقالعاده است.
مثال: «دو تصویر میفرستم؛ تصویر ۱ نسخهٔ قبلی صفحهٔ محصول و تصویر ۲ نسخهٔ جدید است. در یک جدول سهستونی تفاوتهای چیدمان، رنگ و متن دکمهها را فهرست کن و در ستون آخر بگو هر تغییر احتمالاً چه اثری بر نرخ کلیک دارد.»

پرسشهای پرتکرار
آیا همهٔ مدلها میتوانند تصویر را تحلیل کنند؟ نسخههای جدید چتجیپیتی، جمینای و کلود ورودی تصویری دارند، اما کیفیتشان فرق میکند؛ برای متن ریز و دستخط، مدل قویتر جواب دقیقتری میدهد. آخرین وضعیت مدلها را میتوانید در بخش اخبار دنبال کنید.
چرا مدل گاهی متن عکس را اشتباه میخواند؟ معمولاً بهخاطر کیفیت پایین، کجی یا نور بد تصویر است. عکس واضح و صاف بگیرید و در پرامپت از مدل بخواهید بخش ناخوانا را حدس نزند.
آیا میتوانم به دادهٔ استخراجشده اعتماد کامل کنم؟ نه بهطور کورکورانه. برای کارهای حساس مثل حسابداری، همیشه خروجی را با اصل تصویر یکبار مقابله کنید؛ چرا هوش مصنوعی جای مهارت انسانی را کامل نمیگیرد را در مطلب توهم توسعهدهندهٔ تنها توضیح دادهایم.
در پرامپت تحلیل تصویر، کدام کار بیشترین اثر را در جلوگیری از توهم مدل روی بخشهای ناخوانا دارد؟
این تمرین ویژهٔ اعضاست
برای دیدن این بخش باید عضو ویژه (VIP) باشی. با شمارهٔ موبایلت وارد شو تا ۱۴ روز دسترسی رایگان فعال شود.
🎁 ورود / ثبتنام و شروع ۱۴ روز رایگاننسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
