چت‌جی‌پی‌تی تصاویر ۲.۵: ویرایش دقیق‌تر و تولید تا ۵۰ درصد سریع‌تر

اخبار · هوش مصنوعی

OpenAI موتور تصویرسازی چت‌جی‌پی‌تی را با نسخه‌ی ۲.۵ به‌روزرسانی کرد؛ ویرایش دقیق‌تر، تولید تا ۵۰ درصد سریع‌تر و دو مدل تازه برای توسعه‌دهنده‌ها.

چکیده. شرکت OpenAI در هشتم سپتامبر ۲۰۲۶ نسخه‌ی تازه‌ی موتور تصویرسازی چت‌جی‌پی‌تی، یعنی ChatGPT Images 2.5، را عرضه کرد. مدل تازه با نام GPT-Image-2.5 در دو نسخه‌ی Flare و Sunburst در دسترس است، سرعت تولید تصویر تا ۵۰ درصد افزایش یافته و ابزارهای تازه‌ای مثل اسکچ، قالب‌های آماده و یادداشت‌گذاری روی تصویر هم اضافه شده‌اند. این مقاله همه‌ی جزئیات فنی، قیمت‌گذاری، بازخورد شرکای صنعتی و جایگاه این عرضه در رقابت تصویرسازی هوش مصنوعی را بررسی می‌کند.
معرفی ChatGPT Images 2.5 توسط OpenAI با ویرایش دقیق‌تر تصویر

۱. چرا این عرضه برای کاربران چت‌جی‌پی‌تی مهم است؟

تصویرسازی یکی از پرکاربردترین قابلیت‌های چت‌جی‌پی‌تی است؛ از طراحی پست شبکه‌های اجتماعی گرفته تا ساخت موکاپ محصول و تصویر مقاله. با هر نسخه‌ی تازه، فاصله‌ی بین «چیزی که در ذهن کاربر است» و «چیزی که مدل تولید می‌کند» کمتر می‌شود. طبق اعلام رسمی OpenAI، نسخه‌ی ۲.۵ دقیقاً همین شکاف را هدف گرفته: جزئیات تصویر شفاف‌تر شده، نور و بافت طبیعی‌تر به نظر می‌رسد و از همه مهم‌تر، وقتی کاربر یک تصویر را ویرایش می‌کند، فقط همان بخش موردنظر تغییر می‌کند و بقیه‌ی ترکیب‌بندی دست‌نخورده می‌ماند. اگر تا امروز از آموزش‌های چت‌جی‌پی‌تی برای ساخت تصویر استفاده کرده باشید، این تفاوت را از همان اولین پرامپت متوجه می‌شوید.

نکته‌ی دیگری که در اعلامیه‌ی رسمی OpenAI به آن اشاره شده، بهبود تشخیص سوژه در عکس‌های مرجع است. تا پیش از این، وقتی کاربر عکس یک محصول یا چهره را به‌عنوان مرجع می‌داد و از مدل می‌خواست آن را در صحنه‌ی تازه‌ای قرار دهد، گاهی جزئیات ظریف چهره یا طرح محصول کمی تغییر می‌کرد. طبق ادعای شرکت، نسخه‌ی ۲.۵ این مشکل را تا حد زیادی حل کرده و سوژه در ترکیب‌بندی‌های تازه با وفاداری بیشتری بازتولید می‌شود؛ موضوعی که برای طراحان بسته‌بندی، تیم‌های تبلیغاتی و کسانی که برای کاراکترهای ثابت محتوا می‌سازند اهمیت زیادی دارد.

۲. چه چیزهای تازه‌ای به چت‌جی‌پی‌تی اضافه شد؟

در کنار موتور اصلی، OpenAI سه ابزار کاربردی تازه هم معرفی کرده است. اول، قابلیت «اسکچ» که به کاربر اجازه می‌دهد مستقیم داخل چت یک طرح دستی بکشد و از آن به‌عنوان راهنمای ترکیب‌بندی تصویر نهایی استفاده کند. دوم، مجموعه‌ای از قالب‌های آماده برای فرمت‌های پرکاربرد مثل پوستر، بنر شبکه‌های اجتماعی و طرح‌های تبلیغاتی، که کار طراح‌های تازه‌کار را ساده‌تر می‌کند. سوم، امکان گذاشتن یادداشت ویرایش دقیقاً روی همان نقطه‌ای از تصویر که باید تغییر کند؛ به‌جای توصیف طولانی در قالب متن، کاربر می‌تواند روی خود تصویر کلیک کند و بنویسد چه چیزی باید عوض شود.

اشتراک‌گذاری پرامپت

ویژگی دیگری که کمتر دیده شده اما برای تیم‌های محتوا کاربردی است، اشتراک‌گذاری پرامپت است. کاربر می‌تواند دستور کامل خود را با دیگران به اشتراک بگذارد تا آن‌ها با عکس‌های مرجع خودشان همان سبک و ترکیب‌بندی را بازتولید کنند؛ این قابلیت به‌خصوص برای تیم‌های تولید محتوا و آژانس‌های تبلیغاتی که باید سبک واحدی را در چند پروژه تکرار کنند، صرفه‌جویی زیادی در زمان ایجاد می‌کند.

۳. دو مدل تازه در API: Flare و Sunburst

برای توسعه‌دهنده‌ها و کسب‌وکارهایی که از API چت‌جی‌پی‌تی استفاده می‌کنند، OpenAI دو مدل جدید معرفی کرده است. اگر می‌خواهید بدانید این شرکت اساساً چه‌طور کار می‌کند و چه محصولاتی عرضه کرده، می‌توانید نگاهی به این معرفی کامل از OpenAI بیندازید.

GPT-Image-2.5 Flare

Flare مدل پیش‌فرض و بهینه‌شده برای سرعت است؛ تأخیر تولید نسبت به نسخه‌ی قبلی حدود ۵۰ درصد کمتر شده و برای تولید حجم بالا، محتوای شبکه‌های اجتماعی و تجربه‌های محصول‌محور مناسب معرفی شده است.

GPT-Image-2.5 Sunburst

Sunburst گزینه‌ی حرفه‌ای‌تر است؛ کنترل دقیق‌تری روی ویرایش می‌دهد و برای کارهای تولیدی نهایی و تصاویر محصول با کیفیت بالا طراحی شده. طبق گزارش‌های منتشرشده، نرخ تولید محتوای ناایمن در آزمایش‌های ادورساریال برای Sunburst حدود ۱.۰۹ درصد و برای Flare حدود ۱.۴۱ درصد بوده، در مقایسه با نرخ ۱.۶۴ درصدی نسخه‌ی قبلی؛ یعنی هر دو مدل تازه از نظر ایمنی هم پیشرفت داشته‌اند.

مدل‌های GPT-Image-2.5 Flare و Sunburst برای توسعه‌دهنده‌ها

۴. قیمت‌گذاری و در دسترس بودن

هر دو مدل Flare و Sunburst قیمت یکسانی دارند: ورودی تصویر حدود هشت دلار به ازای هر یک میلیون توکن (با نسخه‌ی کش‌شده حدود دو دلار)، خروجی تصویر حدود سی دلار به ازای هر یک میلیون توکن، و ورودی متن حدود پنج دلار به ازای هر یک میلیون توکن. نسخه‌ی ۲.۵ از همان روز عرضه برای همه‌ی کاربران چت‌جی‌پی‌تی، از جمله اشتراک‌های ChatGPT Work و Codex، روی وب، موبایل و دسکتاپ فعال شده و کاربر نیازی به فعال‌سازی جداگانه ندارد.

۵. واکنش شرکای صنعتی: Adobe، Manus و Higgsfield

چند شرکت که پیش از عرضه‌ی عمومی به این مدل دسترسی داشتند، بازخورد خود را منتشر کرده‌اند. Adobe اعلام کرده مدل GPT-Image-2.5 را به Firefly اضافه می‌کند تا گزینه‌های بیشتری برای تولید سریع‌تر و باثبات‌تر در اختیار کاربران بگذارد. تیم Manus از افزایش دو تا چهار برابری سرعت تولید تصاویر باکیفیت نسبت به نسخه‌ی قبلی خبر داده. Higgsfield هم روی همان نکته‌ای تأکید کرده که برای کاربران عادی هم مهم است: حفظ بهتر «هویت بصری» تصویر اصلی، یعنی ترکیب‌بندی و سبک، در طول چند مرحله‌ی ویرایش پیاپی.

۶. ایمنی، واترمارک و شفافیت تصاویر هوش مصنوعی

با گسترش استفاده از تصاویر تولیدشده با هوش مصنوعی، نگرانی درباره‌ی تشخیص اصالت تصویر هم بیشتر شده است. OpenAI اعلام کرده تصاویر ساخته‌شده با نسخه‌ی ۲.۵ هم‌چنان با متادیتای استاندارد C2PA و یک واترمارک نامرئی همراه‌اند تا مشخص شود تصویر با هوش مصنوعی تولید شده. این استاندارد به پلتفرم‌ها و ابزارهای بررسی تصویر کمک می‌کند منشأ فایل را تشخیص دهند، حتی اگر تصویر ویرایش یا فشرده شده باشد. برای کسانی که نگران محدودیت‌ها و ریسک‌های واقعی این‌جور ابزارهاست، این مقاله درباره‌ی توانایی‌ها و محدودیت‌های واقعی هوش مصنوعی نگاه خوبی به موضوع دارد.

استفاده‌ی Adobe و Higgsfield از مدل تازه‌ی تصویرسازی چت‌جی‌پی‌تی

۷. این تغییرات برای صاحبان کسب‌وکار و تولیدکننده‌های محتوا چه معنایی دارد؟

برای تیم‌های کوچک بازاریابی که بودجه‌ی طراح گرافیک اختصاصی ندارند، ترکیب سرعت بالاتر و ویرایش دقیق‌تر یعنی می‌شود در یک نشست کاری چند نسخه‌ی متفاوت از یک تصویر تبلیغاتی ساخت و همان‌جا بهترین گزینه را انتخاب کرد. قالب‌های آماده برای پوستر و بنر هم فاصله‌ی بین ایده و خروجی نهایی را کوتاه‌تر می‌کند؛ به‌جای این‌که کاربر مجبور باشد ابعاد و چیدمان را از صفر توصیف کند، از یک الگوی آماده شروع می‌کند و فقط محتوای آن را شخصی‌سازی می‌کند. برای فروشگاه‌های آنلاین هم قابلیت حفظ بهتر سوژه در عکس محصول می‌تواند هزینه‌ی عکاسی تبلیغاتی را برای بعضی سناریوها کاهش بدهد، هرچند برای تصاویر رسمی و تجاری هنوز عکاسی واقعی جایگزین‌ناپذیر است.

۸. جایگاه این عرضه در رقابت تصویرسازی هوش مصنوعی

بازار تصویرسازی هوش مصنوعی این روزها میدان رقابت فشرده‌ای میان چند شرکت بزرگ است و هر چند هفته یک‌بار یکی از آن‌ها مدل تازه‌ای معرفی می‌کند. عرضه‌ی ChatGPT Images 2.5 دقیقاً در همین فضا اتفاق افتاده؛ زمانی که رقبا هم روی سرعت، دقت ویرایش و حفظ ثبات تصویر در تولیدهای پی‌درپی سرمایه‌گذاری می‌کنند. برای کسب‌وکارهایی که تصمیم می‌گیرند کدام ابزار هوش مصنوعی را در جریان کاری خود جای بدهند، چنین رقابتی معمولاً به نفع کاربر تمام می‌شود؛ چون هم قیمت‌ها منطقی‌تر می‌شود و هم کیفیت بالاتر می‌رود. اگر می‌خواهید ببینید هوش مصنوعی چه‌طور می‌تواند در کسب‌وکار واقعی به کار بیاید، این راهنما درباره‌ی اهمیت هوش مصنوعی در کسب‌وکار نمونه‌های خوبی دارد.

نکته‌ی قابل‌توجه این است که این رقابت فقط به تصویرسازی محدود نمی‌ماند؛ همان شرکت‌هایی که در تصویرسازی رقابت می‌کنند، هم‌زمان روی مدل‌های زبانی و استدلالی خود هم کار می‌کنند و هر پیشرفت در یک حوزه معمولاً به حوزه‌های دیگر هم سرایت می‌کند. برای مقایسه‌ی دقیق‌تر مدل‌های زبانی بزرگ و دیدن این‌که چه‌طور شرکت‌های مختلف در برابر هم قد علم می‌کنند، خواندن این مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک هم خالی از لطف نیست.

۹. چطور از ChatGPT Images 2.5 بهترین نتیجه را بگیریم؟

نکته‌ی کلیدی در استفاده از این نسخه، دقیق‌نویسی پرامپت و استفاده از ابزار اسکچ برای ترکیب‌بندی‌های پیچیده است. به‌جای توصیف طولانی، کافی است طرح تقریبی صحنه را بکشید و مدل خودش جزئیات را کامل می‌کند. برای ویرایش‌های چندمرحله‌ای هم بهتر است هر بار فقط یک تغییر مشخص را با یادداشت روی تصویر درخواست بدهید تا مدل بقیه‌ی ترکیب‌بندی را دست‌نخورده نگه دارد. کسانی که تازه با نوشتن پرامپت آشنا می‌شوند می‌توانند از این راهنمای ساده‌ی نوشتن پرامپت شروع کنند؛ همان اصول برای پرامپت تصویر هم کاربرد دارد.

۱۰. پرسش‌های پرتکرار

آیا ChatGPT Images 2.5 برای همه‌ی کاربران رایگان است؟
بله، این نسخه برای همه‌ی سطوح اشتراک چت‌جی‌پی‌تی، از جمله کاربران رایگان، فعال شده؛ محدودیت تعداد تصویر بسته به نوع اشتراک همچنان برقرار است.

تفاوت اصلی Flare و Sunburst چیست؟
Flare برای سرعت و حجم بالا بهینه شده و مدل پیش‌فرض است؛ Sunburst کنترل ویرایش دقیق‌تری می‌دهد و برای کارهای تولیدی حرفه‌ای مناسب‌تر است.

آیا می‌شود فهمید یک تصویر با این مدل ساخته شده؟
بله، تصاویر با متادیتای C2PA و واترمارک نامرئی همراه‌اند که منشأ هوش مصنوعی آن‌ها را مشخص می‌کند.

چه زمانی این قابلیت در دسترس قرار گرفت؟
از هشتم سپتامبر ۲۰۲۶ (هجدهم شهریور ۱۴۰۵) روی وب، موبایل و دسکتاپ چت‌جی‌پی‌تی فعال شد.

آیا استفاده از این مدل نیاز به دانش فنی دارد؟
نه؛ در داخل چت‌جی‌پی‌تی همه‌چیز از طریق چت معمولی، اسکچ و قالب‌های آماده انجام می‌شود و فقط توسعه‌دهنده‌هایی که می‌خواهند از API استفاده کنند به آشنایی فنی نیاز دارند.

جمع‌بندی. عرضه‌ی ChatGPT Images 2.5 نشان می‌دهد OpenAI هنوز روی تصویرسازی به‌عنوان یکی از محورهای اصلی توسعه‌ی چت‌جی‌پی‌تی سرمایه‌گذاری می‌کند؛ سرعت بالاتر، ویرایش دقیق‌تر و ابزارهای تازه‌ای مثل اسکچ و یادداشت‌گذاری روی تصویر، این نسخه را برای کاربران عادی و توسعه‌دهنده‌ها هر دو جذاب کرده است. برای این‌که هیچ خبر مهم هوش مصنوعی را از دست ندهید، کانال اخبار هوش مصنوعی مای چت‌جی‌پی‌تی و تلگرام @MrChatGPT_IR را دنبال کنید.
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *