ایکسایآی نسخه تازه گروک ایمجین را با ویدیوی بومی ۱۰۸۰p، تا هفت مرجع تصویری و صدای یکسان در همه صحنهها عرضه کرد؛ بروزرسانیای که کنترل خلاقانه ابزارهای ویدیویی هوش مصنوعی را وارد مرحله تازهای میکند.

لیست مطالب
۱. چه چیزی در گروک ایمجین ۱.۵ تازه است؟
ایکسایآی از ۳۱ ژوئیه ۲۰۲۶ نسخه بروزرسانیشده ابزار تولید ویدیوی خود، گروک ایمجین ۱.۵، را در دسترس کاربران قرار داد. برخلاف بروزرسانیهای قبلی که بیشتر روی کیفیت حرکت و فیزیک صحنه تمرکز داشتند، این نسخه مستقیماً سراغ یکی از دردسرهای همیشگی تولیدکنندگان محتوا رفته است: حفظ هویت یکسان یک شخصیت یا محصول در طول چند نما و صحنه متفاوت. برای کسانی که این حوزه را دنبال میکنند و میخواهند سیر تحول ابزارهای مولد را از نزدیک ببینند، بخش اخبار هوش مصنوعی مرچتجیپیتی بهترین منبع برای پیگیری روزانه این تغییرات است.
نکته مهم اینجاست که این بروزرسانی صرفاً یک ارتقای فنی نیست، بلکه تلاشی برای نزدیکتر کردن گروک ایمجین به نیازهای واقعی تولیدکنندگان محتوا، برندها و تیمهای تبلیغاتی است؛ گروهی که تا امروز مجبور بودند برای حفظ ثبات چهره یا صدای یک شخصیت در چند کلیپ، از ترفندهای دستی یا نرمافزارهای ویرایش جانبی استفاده کنند.
۲. کیفیت بومی ۱۰۸۰p؛ گامی بهسوی استاندارد استودیویی
یکی از تغییرات محسوس این نسخه، پشتیبانی بومی از رزولوشن ۱۰۸۰p است؛ هم در مسیر تولید ویدیو از روی متن (Text-to-Video) و هم در مسیر تولید ویدیو از روی تصویر (Image-to-Video). تا پیش از این، بسیاری از ابزارهای مشابه خروجی را در کیفیت پایینتر تولید میکردند و کاربر مجبور بود برای رسیدن به کیفیت قابل انتشار، از ابزارهای جداگانه بزرگنمایی و بهبود کیفیت (Upscale) استفاده کند.
با فعال شدن ۱۰۸۰p بهصورت پیشفرض، فاصله بین خروجی خام مدل و محتوایی که مستقیماً قابل انتشار در شبکههای اجتماعی یا حتی تیزرهای تبلیغاتی کوتاه باشد، به شکل قابل توجهی کم شده است. طبق اعلام ایکسایآی، این قابلیت هماکنون بهصورت عمومی در وب، اپلیکیشن iOS و اندروید فعال است و نیازی به دسترسی ویژه یا اشتراک بالاتر ندارد.
۳. مرجعهای چندگانه؛ کنترل کامل روی شخصیت، محصول و مکان
شاید جذابترین بخش این بروزرسانی، امکان ارسال تا هفت تصویر مرجع در یک درخواست تولید ویدیو باشد. این قابلیت به کاربر اجازه میدهد چند عنصر مختلف را همزمان کنترل کند: میتوان چهره یک شخصیت را از یک تصویر، ظاهر یک محصول را از تصویر دیگر و پسزمینه یا مکان را از تصویر سوم گرفت و همه را در یک صحنه واحد ترکیب کرد.
این یعنی یک برند میتواند یک سفیر مجازی ثابت داشته باشد که در چند ویدیوی متفاوت، با لباسها، حالتها و پسزمینههای گوناگون ظاهر شود، بدون آنکه چهره یا ویژگیهای ظاهریاش هر بار از نو و به شکلی متفاوت بازسازی شود. برای تیمهای محتوا و بازاریابی که بهتازگی وارد این حوزه شدهاند، آشنایی با اصول نوشتن دستور یا Prompt نیز اهمیت زیادی دارد؛ راهنمای نوشتن پرامپت برای مبتدیان نقطه شروع خوبی برای درک بهتر این مفاهیم است.

چگونه مرجعهای چندگانه کار میکنند؟
در عمل، کاربر میتواند مشخص کند کدام بخش از هر تصویر مرجع باید حفظ شود؛ برای مثال ثابت نگهداشتن شخصیت در حالی که مکان تغییر میکند، یا برعکس، حفظ مکان در حالی که شخصیتهای حاضر در صحنه عوض میشوند. این سطح از کنترل، چیزی است که تا پیش از این تنها در استودیوهای تدوین حرفهای و با صرف زمان و هزینه قابل توجه ممکن بود.
۴. صدای ثابت؛ پایان صداهای نامتناسب در ویدیوهای هوش مصنوعی
یکی دیگر از مشکلات رایج ابزارهای تولید ویدیوی هوش مصنوعی، ناهماهنگی صدا و چهره شخصیتها در صحنههای مختلف بوده است؛ گاهی صدای یک شخصیت در هر کلیپ تغییر میکرد یا اصلاً با ظاهرش تناسبی نداشت. گروک ایمجین ۱.۵ با ترکیب یک تصویر از شخصیت و یک نمونه صدا، میکوشد همان چهره و همان صدا را در چند صحنه مختلف حفظ کند.
این قابلیت بهویژه برای تولید محتوای آموزشی، تیزرهای تبلیغاتی چندقسمتی یا حتی شخصیتهای مجازی ثابت روی شبکههای اجتماعی میتواند تفاوت بزرگی ایجاد کند. البته دقیقاً همین قابلیت است که نگرانیهای تازهای درباره سوءاستفاده احتمالی از صداهای شبیهسازیشده و محتوای جعلی (Deepfake) را نیز به همراه میآورد؛ موضوعی که در بخش پایانی این مقاله به آن میپردازیم.
۵. تولید ویدیو مستقیم از متن، بدون تصویر شروع
گروک ایمجین ۱.۵ همچنین امکان تولید ویدیو مستقیماً از روی یک توصیف متنی را فراهم میکند، بدون آنکه کاربر نیاز به آپلود یک تصویر شروع داشته باشد. کاربر تنها کافی است صحنه مورد نظر خود را با جزئیات کافی توصیف کند و مدل آن را به یک کلیپ ویدیویی تبدیل میکند. این رویکرد مسیر تولید محتوا را برای کسانی که تصویر آمادهای در اختیار ندارند، بهطور قابل توجهی کوتاهتر میکند.
با این حال، کیفیت خروجی در این حالت همچنان به شدت به دقت و ساختار توصیف متنی وابسته است؛ موضوعی که یک بار دیگر اهمیت آشنایی با اصول درستنویسی دستورها را نشان میدهد و پیوند مستقیمی با محتوای آموزش نوشتن پرامپت دارد.
۶. نحوه دسترسی و زمانبندی عرضه
طبق اعلام رسمی ایکسایآی، قابلیتهای مرجع تصویری و صدا از ۳۱ ژوئیه برای مشترکین SuperGrok Heavy و SuperGrok Plus در نسخه وب (grok.com/imagine) و اپلیکیشن iOS فعال شدهاند و طی چند روز آینده به همه سطوح اشتراک گسترش مییابند. در همین حال، تولید ویدیو از متن و کیفیت ۱۰۸۰p هماکنون بهصورت عمومی و برای همه کاربران در دسترس وب، iOS و اندروید فعال است.
این رویکرد مرحلهای در عرضه ویژگیها، الگویی است که شرکتهای بزرگ هوش مصنوعی این روزها بیشتر از آن استفاده میکنند؛ ابتدا عرضه محدود برای کاربران حرفهای و پردرآمدتر، سپس گسترش تدریجی به کل کاربران.
۷. دسترسی برای توسعهدهندگان از طریق API
ایکسایآی این قابلیتها را از طریق مدل grok-imagine-video-1.5 در وبسرویس یا API خود نیز عرضه کرده است. توسعهدهندگان میتوانند به قابلیت مرجع تصویری، تولید ویدیو از متن و کیفیت ۱۰۸۰p از طریق برنامهنویسی دسترسی داشته باشند، هرچند استفاده از مرجع صدا در سطح API هنوز نیازمند درخواست و تایید جداگانه از سوی ایکسایآی است. این رویکرد محتاطانه احتمالاً به دلیل ریسکهای امنیتی و اخلاقی مرتبط با شبیهسازی صدا اتخاذ شده است.

۸. جایگاه گروک ایمجین در رقابت ابزارهای ویدیویی هوش مصنوعی
بازار ابزارهای تولید ویدیوی هوش مصنوعی این روزها به یکی از داغترین جبهههای رقابت میان شرکتهای بزرگ فناوری تبدیل شده است. هر یک از بازیگران اصلی این حوزه، از جمله همان شرکتهایی که پیشتر با معرفی اوپنایآی و چتجیپیتی مسیر هوش مصنوعی مکالمهای را دگرگون کردند، اکنون بخش قابل توجهی از منابع خود را به تولید ویدیو اختصاص دادهاند. این رقابت، شبیه به همان رقابتی است که پیشتر در حوزه مدلهای زبانی و حتی مقایسههای مستقیم میان مدلهای مختلف هوش مصنوعی شاهد آن بودیم، اکنون در حوزه تصویر و ویدیو تکرار میشود.
تفاوت اصلی گروک ایمجین ۱.۵ با بسیاری از رقبا، تمرکز آن روی «ثبات هویت» بهجای صرفاً کیفیت بصری خام است. در حالی که بسیاری از ابزارهای مشابه روی واقعگرایی حرکت و فیزیک صحنه رقابت میکنند، ایکسایآی این بار روی مشکلی سرمایهگذاری کرده که مستقیماً کاربرد تجاری و روایی محتوا را تحت تاثیر قرار میدهد: توانایی ساخت یک شخصیت یا محصول که در طول چند ویدیوی جداگانه، همچنان «همان» باقی بماند.
۹. کاربردهای عملی برای کسبوکارها و تولیدکنندگان محتوا
برای کسبوکارهایی که به دنبال تولید محتوای ویدیویی مقیاسپذیر هستند، این بروزرسانی میتواند مسیر تولید تیزر، محتوای شبکههای اجتماعی و حتی آموزشهای کوتاه محصول را کوتاهتر کند. یک برند میتواند با تعریف یک شخصیت ثابت یا یک محصول مشخص، دهها نسخه متفاوت از یک ویدیوی تبلیغاتی بسازد بدون آنکه هر بار نیاز به فیلمبرداری مجدد داشته باشد. اهمیت این نوع ابزارها برای کسبوکارهای کوچک و بزرگ را میتوانید در مطلب چرا هوش مصنوعی برای کسبوکار اهمیت دارد با جزئیات بیشتری دنبال کنید.
با این حال، مهم است این ابزارها را با نگاهی واقعبینانه بهکار برد. مانند هر فناوری نوظهور دیگری، محدودیتها و خطاهای احتمالی همچنان وجود دارند و نباید انتظار جایگزینی کامل تولید محتوای انسانی را از این ابزارها داشت؛ نکتهای که در تحلیل پتانسیل واقعی و محدودیتهای هوش مصنوعی بهخوبی بررسی شده است.
۱۰. نگرانیها: عمیقجعلی، صدای شبیهسازیشده و نیاز به شفافیت
قابلیت حفظ صدا و چهره ثابت یک شخصیت، هرچند برای تولید محتوای قانونی و خلاقانه بسیار کاربردی است، اما بهطور طبیعی نگرانیهایی درباره سوءاستفاده احتمالی برای ساخت محتوای جعلی یا شبیهسازی صدای افراد واقعی بدون رضایت آنها ایجاد میکند. دقیقاً در همین بازه زمانی، برخی نهادهای نظارتی مانند ایالت کالیفرنیا قوانین شفافیت محتوای هوش مصنوعی را عملیاتی کردهاند تا ابزارهای تولید محتوای مصنوعی موظف به درج نشانههای منبع باشند.
این تناقض میان سرعت نوآوری فنی و سرعت واکنش قانونگذاری، یکی از موضوعات همیشگی حوزه هوش مصنوعی است. کسانی که میخواهند درک بهتری از مرز میان محتوای واقعاً تولیدشده توسط انسان و محتوای تولیدشده یا کمکگرفته از هوش مصنوعی داشته باشند، میتوانند مطلب توهم هوش مصنوعی؛ توسعهدهنده تنها در برابر مهندس واقعی را نیز مطالعه کنند.
سوالات متداول
گروک ایمجین ۱.۵ چه زمانی منتشر شد؟
این بروزرسانی از ۳۱ ژوئیه ۲۰۲۶ بهصورت مرحلهای در دسترس کاربران قرار گرفت.
آیا گروک ایمجین ۱.۵ رایگان است؟
تولید ویدیو از متن و کیفیت ۱۰۸۰p بهصورت عمومی در دسترس همه کاربران است، اما مرجعهای تصویری و صدا در حال حاضر ابتدا برای مشترکین SuperGrok Heavy و SuperGrok Plus فعال شدهاند.
چند تصویر مرجع میتوان استفاده کرد؟
کاربران میتوانند تا هفت تصویر مرجع جداگانه در یک درخواست تولید ویدیو استفاده کنند.
آیا این قابلیت از طریق API هم در دسترس است؟
بله، از طریق مدل grok-imagine-video-1.5، اما استفاده از مرجع صدا در سطح API نیازمند درخواست و تایید جداگانه است.
آیا نگرانی امنیتی خاصی درباره این قابلیت مطرح شده؟
حفظ صدا و چهره ثابت شخصیتها میتواند در کنار کاربردهای مثبت، ریسک سوءاستفاده برای محتوای جعلی را نیز افزایش دهد؛ موضوعی که با قوانین تازه شفافیت محتوای هوش مصنوعی در ارتباط مستقیم است.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
