پوستر خبری معرفی گروک ایمجین ۱.۵ با پشتیبانی از ویدیوی بومی ۱۰۸۰p از ایکس‌ای‌آی

گروک ایمجین ۱.۵ با ویدیوی ۱۰۸۰p و صدای ثابت رونمایی شد

اخبار · هوش مصنوعی

ایکس‌ای‌آی نسخه تازه گروک ایمجین را با ویدیوی بومی ۱۰۸۰p، تا هفت مرجع تصویری و صدای یکسان در همه صحنه‌ها عرضه کرد؛ بروزرسانی‌ای که کنترل خلاقانه ابزارهای ویدیویی هوش مصنوعی را وارد مرحله تازه‌ای می‌کند.

چکیده. ایکس‌ای‌آی، شرکت هوش مصنوعی ایلان ماسک، گروک ایمجین ۱.۵ را با چند قابلیت کلیدی بروزرسانی کرد: تولید ویدیو در کیفیت بومی ۱۰۸۰p (هم از متن، هم از تصویر)، امکان استفاده از تا هفت تصویر مرجع برای ثابت نگه‌داشتن چهره، محصول یا مکان، و حفظ یکپارچگی صدا و چهره یک شخصیت در چند صحنه مختلف. این قابلیت‌ها از ۳۱ ژوئیه برای مشترکین SuperGrok در حال عرضه‌اند و به‌زودی برای همه کاربران و از طریق API نیز در دسترس قرار می‌گیرند.
پوستر خبری معرفی گروک ایمجین ۱.۵ با پشتیبانی از ویدیوی بومی ۱۰۸۰p از ایکس‌ای‌آی

۱. چه چیزی در گروک ایمجین ۱.۵ تازه است؟

ایکس‌ای‌آی از ۳۱ ژوئیه ۲۰۲۶ نسخه بروزرسانی‌شده ابزار تولید ویدیوی خود، گروک ایمجین ۱.۵، را در دسترس کاربران قرار داد. برخلاف بروزرسانی‌های قبلی که بیشتر روی کیفیت حرکت و فیزیک صحنه تمرکز داشتند، این نسخه مستقیماً سراغ یکی از دردسرهای همیشگی تولیدکنندگان محتوا رفته است: حفظ هویت یکسان یک شخصیت یا محصول در طول چند نما و صحنه متفاوت. برای کسانی که این حوزه را دنبال می‌کنند و می‌خواهند سیر تحول ابزارهای مولد را از نزدیک ببینند، بخش اخبار هوش مصنوعی مرچت‌جی‌پی‌تی بهترین منبع برای پیگیری روزانه این تغییرات است.

نکته مهم اینجاست که این بروزرسانی صرفاً یک ارتقای فنی نیست، بلکه تلاشی برای نزدیک‌تر کردن گروک ایمجین به نیازهای واقعی تولیدکنندگان محتوا، برندها و تیم‌های تبلیغاتی است؛ گروهی که تا امروز مجبور بودند برای حفظ ثبات چهره یا صدای یک شخصیت در چند کلیپ، از ترفندهای دستی یا نرم‌افزارهای ویرایش جانبی استفاده کنند.

۲. کیفیت بومی ۱۰۸۰p؛ گامی به‌سوی استاندارد استودیویی

یکی از تغییرات محسوس این نسخه، پشتیبانی بومی از رزولوشن ۱۰۸۰p است؛ هم در مسیر تولید ویدیو از روی متن (Text-to-Video) و هم در مسیر تولید ویدیو از روی تصویر (Image-to-Video). تا پیش از این، بسیاری از ابزارهای مشابه خروجی را در کیفیت پایین‌تر تولید می‌کردند و کاربر مجبور بود برای رسیدن به کیفیت قابل انتشار، از ابزارهای جداگانه بزرگ‌نمایی و بهبود کیفیت (Upscale) استفاده کند.

با فعال شدن ۱۰۸۰p به‌صورت پیش‌فرض، فاصله بین خروجی خام مدل و محتوایی که مستقیماً قابل انتشار در شبکه‌های اجتماعی یا حتی تیزرهای تبلیغاتی کوتاه باشد، به شکل قابل توجهی کم شده است. طبق اعلام ایکس‌ای‌آی، این قابلیت هم‌اکنون به‌صورت عمومی در وب، اپلیکیشن iOS و اندروید فعال است و نیازی به دسترسی ویژه یا اشتراک بالاتر ندارد.

۳. مرجع‌های چندگانه؛ کنترل کامل روی شخصیت، محصول و مکان

شاید جذاب‌ترین بخش این بروزرسانی، امکان ارسال تا هفت تصویر مرجع در یک درخواست تولید ویدیو باشد. این قابلیت به کاربر اجازه می‌دهد چند عنصر مختلف را هم‌زمان کنترل کند: می‌توان چهره یک شخصیت را از یک تصویر، ظاهر یک محصول را از تصویر دیگر و پس‌زمینه یا مکان را از تصویر سوم گرفت و همه را در یک صحنه واحد ترکیب کرد.

این یعنی یک برند می‌تواند یک سفیر مجازی ثابت داشته باشد که در چند ویدیوی متفاوت، با لباس‌ها، حالت‌ها و پس‌زمینه‌های گوناگون ظاهر شود، بدون آنکه چهره یا ویژگی‌های ظاهری‌اش هر بار از نو و به شکلی متفاوت بازسازی شود. برای تیم‌های محتوا و بازاریابی که به‌تازگی وارد این حوزه شده‌اند، آشنایی با اصول نوشتن دستور یا Prompt نیز اهمیت زیادی دارد؛ راهنمای نوشتن پرامپت برای مبتدیان نقطه شروع خوبی برای درک بهتر این مفاهیم است.

تصویر مفهومی قابلیت مرجع چندگانه تصویر و صدای ثابت شخصیت در گروک ایمجین ۱.۵

چگونه مرجع‌های چندگانه کار می‌کنند؟

در عمل، کاربر می‌تواند مشخص کند کدام بخش از هر تصویر مرجع باید حفظ شود؛ برای مثال ثابت نگه‌داشتن شخصیت در حالی که مکان تغییر می‌کند، یا برعکس، حفظ مکان در حالی که شخصیت‌های حاضر در صحنه عوض می‌شوند. این سطح از کنترل، چیزی است که تا پیش از این تنها در استودیوهای تدوین حرفه‌ای و با صرف زمان و هزینه قابل توجه ممکن بود.

۴. صدای ثابت؛ پایان صداهای نامتناسب در ویدیوهای هوش مصنوعی

یکی دیگر از مشکلات رایج ابزارهای تولید ویدیوی هوش مصنوعی، ناهماهنگی صدا و چهره شخصیت‌ها در صحنه‌های مختلف بوده است؛ گاهی صدای یک شخصیت در هر کلیپ تغییر می‌کرد یا اصلاً با ظاهرش تناسبی نداشت. گروک ایمجین ۱.۵ با ترکیب یک تصویر از شخصیت و یک نمونه صدا، می‌کوشد همان چهره و همان صدا را در چند صحنه مختلف حفظ کند.

این قابلیت به‌ویژه برای تولید محتوای آموزشی، تیزرهای تبلیغاتی چند‌قسمتی یا حتی شخصیت‌های مجازی ثابت روی شبکه‌های اجتماعی می‌تواند تفاوت بزرگی ایجاد کند. البته دقیقاً همین قابلیت است که نگرانی‌های تازه‌ای درباره سوءاستفاده احتمالی از صداهای شبیه‌سازی‌شده و محتوای جعلی (Deepfake) را نیز به همراه می‌آورد؛ موضوعی که در بخش پایانی این مقاله به آن می‌پردازیم.

۵. تولید ویدیو مستقیم از متن، بدون تصویر شروع

گروک ایمجین ۱.۵ همچنین امکان تولید ویدیو مستقیماً از روی یک توصیف متنی را فراهم می‌کند، بدون آنکه کاربر نیاز به آپلود یک تصویر شروع داشته باشد. کاربر تنها کافی است صحنه مورد نظر خود را با جزئیات کافی توصیف کند و مدل آن را به یک کلیپ ویدیویی تبدیل می‌کند. این رویکرد مسیر تولید محتوا را برای کسانی که تصویر آماده‌ای در اختیار ندارند، به‌طور قابل توجهی کوتاه‌تر می‌کند.

با این حال، کیفیت خروجی در این حالت همچنان به شدت به دقت و ساختار توصیف متنی وابسته است؛ موضوعی که یک بار دیگر اهمیت آشنایی با اصول درست‌نویسی دستورها را نشان می‌دهد و پیوند مستقیمی با محتوای آموزش نوشتن پرامپت دارد.

۶. نحوه دسترسی و زمان‌بندی عرضه

طبق اعلام رسمی ایکس‌ای‌آی، قابلیت‌های مرجع تصویری و صدا از ۳۱ ژوئیه برای مشترکین SuperGrok Heavy و SuperGrok Plus در نسخه وب (grok.com/imagine) و اپلیکیشن iOS فعال شده‌اند و طی چند روز آینده به همه سطوح اشتراک گسترش می‌یابند. در همین حال، تولید ویدیو از متن و کیفیت ۱۰۸۰p هم‌اکنون به‌صورت عمومی و برای همه کاربران در دسترس وب، iOS و اندروید فعال است.

این رویکرد مرحله‌ای در عرضه ویژگی‌ها، الگویی است که شرکت‌های بزرگ هوش مصنوعی این روزها بیشتر از آن استفاده می‌کنند؛ ابتدا عرضه محدود برای کاربران حرفه‌ای و پردرآمدتر، سپس گسترش تدریجی به کل کاربران.

۷. دسترسی برای توسعه‌دهندگان از طریق API

ایکس‌ای‌آی این قابلیت‌ها را از طریق مدل grok-imagine-video-1.5 در وب‌سرویس یا API خود نیز عرضه کرده است. توسعه‌دهندگان می‌توانند به قابلیت مرجع تصویری، تولید ویدیو از متن و کیفیت ۱۰۸۰p از طریق برنامه‌نویسی دسترسی داشته باشند، هرچند استفاده از مرجع صدا در سطح API هنوز نیازمند درخواست و تایید جداگانه از سوی ایکس‌ای‌آی است. این رویکرد محتاطانه احتمالاً به دلیل ریسک‌های امنیتی و اخلاقی مرتبط با شبیه‌سازی صدا اتخاذ شده است.

نمایش قابلیت تولید ویدیو مستقیم از متن در ابزارهای نسل جدید هوش مصنوعی

۸. جایگاه گروک ایمجین در رقابت ابزارهای ویدیویی هوش مصنوعی

بازار ابزارهای تولید ویدیوی هوش مصنوعی این روزها به یکی از داغ‌ترین جبهه‌های رقابت میان شرکت‌های بزرگ فناوری تبدیل شده است. هر یک از بازیگران اصلی این حوزه، از جمله همان شرکت‌هایی که پیش‌تر با معرفی اوپن‌ای‌آی و چت‌جی‌پی‌تی مسیر هوش مصنوعی مکالمه‌ای را دگرگون کردند، اکنون بخش قابل توجهی از منابع خود را به تولید ویدیو اختصاص داده‌اند. این رقابت، شبیه به همان رقابتی است که پیش‌تر در حوزه مدل‌های زبانی و حتی مقایسه‌های مستقیم میان مدل‌های مختلف هوش مصنوعی شاهد آن بودیم، اکنون در حوزه تصویر و ویدیو تکرار می‌شود.

تفاوت اصلی گروک ایمجین ۱.۵ با بسیاری از رقبا، تمرکز آن روی «ثبات هویت» به‌جای صرفاً کیفیت بصری خام است. در حالی که بسیاری از ابزارهای مشابه روی واقع‌گرایی حرکت و فیزیک صحنه رقابت می‌کنند، ایکس‌ای‌آی این بار روی مشکلی سرمایه‌گذاری کرده که مستقیماً کاربرد تجاری و روایی محتوا را تحت تاثیر قرار می‌دهد: توانایی ساخت یک شخصیت یا محصول که در طول چند ویدیوی جداگانه، همچنان «همان» باقی بماند.

۹. کاربردهای عملی برای کسب‌وکارها و تولیدکنندگان محتوا

برای کسب‌وکارهایی که به دنبال تولید محتوای ویدیویی مقیاس‌پذیر هستند، این بروزرسانی می‌تواند مسیر تولید تیزر، محتوای شبکه‌های اجتماعی و حتی آموزش‌های کوتاه محصول را کوتاه‌تر کند. یک برند می‌تواند با تعریف یک شخصیت ثابت یا یک محصول مشخص، ده‌ها نسخه متفاوت از یک ویدیوی تبلیغاتی بسازد بدون آنکه هر بار نیاز به فیلم‌برداری مجدد داشته باشد. اهمیت این نوع ابزارها برای کسب‌وکارهای کوچک و بزرگ را می‌توانید در مطلب چرا هوش مصنوعی برای کسب‌وکار اهمیت دارد با جزئیات بیشتری دنبال کنید.

با این حال، مهم است این ابزارها را با نگاهی واقع‌بینانه به‌کار برد. مانند هر فناوری نوظهور دیگری، محدودیت‌ها و خطاهای احتمالی همچنان وجود دارند و نباید انتظار جایگزینی کامل تولید محتوای انسانی را از این ابزارها داشت؛ نکته‌ای که در تحلیل پتانسیل واقعی و محدودیت‌های هوش مصنوعی به‌خوبی بررسی شده است.

۱۰. نگرانی‌ها: عمیق‌جعلی، صدای شبیه‌سازی‌شده و نیاز به شفافیت

قابلیت حفظ صدا و چهره ثابت یک شخصیت، هرچند برای تولید محتوای قانونی و خلاقانه بسیار کاربردی است، اما به‌طور طبیعی نگرانی‌هایی درباره سوءاستفاده احتمالی برای ساخت محتوای جعلی یا شبیه‌سازی صدای افراد واقعی بدون رضایت آن‌ها ایجاد می‌کند. دقیقاً در همین بازه زمانی، برخی نهادهای نظارتی مانند ایالت کالیفرنیا قوانین شفافیت محتوای هوش مصنوعی را عملیاتی کرده‌اند تا ابزارهای تولید محتوای مصنوعی موظف به درج نشانه‌های منبع باشند.

این تناقض میان سرعت نوآوری فنی و سرعت واکنش قانون‌گذاری، یکی از موضوعات همیشگی حوزه هوش مصنوعی است. کسانی که می‌خواهند درک بهتری از مرز میان محتوای واقعاً تولید‌شده توسط انسان و محتوای تولیدشده یا کمک‌گرفته از هوش مصنوعی داشته باشند، می‌توانند مطلب توهم هوش مصنوعی؛ توسعه‌دهنده تنها در برابر مهندس واقعی را نیز مطالعه کنند.

سوالات متداول

گروک ایمجین ۱.۵ چه زمانی منتشر شد؟
این بروزرسانی از ۳۱ ژوئیه ۲۰۲۶ به‌صورت مرحله‌ای در دسترس کاربران قرار گرفت.

آیا گروک ایمجین ۱.۵ رایگان است؟
تولید ویدیو از متن و کیفیت ۱۰۸۰p به‌صورت عمومی در دسترس همه کاربران است، اما مرجع‌های تصویری و صدا در حال حاضر ابتدا برای مشترکین SuperGrok Heavy و SuperGrok Plus فعال شده‌اند.

چند تصویر مرجع می‌توان استفاده کرد؟
کاربران می‌توانند تا هفت تصویر مرجع جداگانه در یک درخواست تولید ویدیو استفاده کنند.

آیا این قابلیت از طریق API هم در دسترس است؟
بله، از طریق مدل grok-imagine-video-1.5، اما استفاده از مرجع صدا در سطح API نیازمند درخواست و تایید جداگانه است.

آیا نگرانی امنیتی خاصی درباره این قابلیت مطرح شده؟
حفظ صدا و چهره ثابت شخصیت‌ها می‌تواند در کنار کاربردهای مثبت، ریسک سوءاستفاده برای محتوای جعلی را نیز افزایش دهد؛ موضوعی که با قوانین تازه شفافیت محتوای هوش مصنوعی در ارتباط مستقیم است.

گروک ایمجین ۱.۵ نشان می‌دهد رقابت ابزارهای ویدیویی هوش مصنوعی از مرحله «واقع‌گرایی بصری» به مرحله «ثبات هویت و کنترل خلاقانه» رسیده است. برای دنبال کردن ادامه این رقابت و سایر تحولات هوش مصنوعی، عضو کانال @MrChatGPT_IR شوید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *