جمینای امنی ۱.۱ فلش گوگل؛ مدل جدید ساخت و ویرایش ویدیوی ۴K با هوش مصنوعی

اخبار · هوش مصنوعی

گوگل با رونمایی از جمینای امنی ۱.۱ فلش، بار دیگر معادلات بازار ویدیوسازی هوش مصنوعی را تغییر داد؛ مدلی که ساخت، ویرایش، ادامه‌ی صحنه و ارتقای کیفیت را در یک ابزار واحد جمع کرده است.

چکیده. شرکت گوگل مدل تازه‌ی جمینای امنی ۱.۱ فلش را معرفی کرد؛ مدلی چندوجهی که می‌تواند ویدیوهایی تا ۴۰ ثانیه در کیفیت ۴K بسازد، آن‌ها را با دستورهای متنی ساده ویرایش کند و صحنه‌ها را به‌شکل طبیعی ادامه دهد. این مدل با قیمت‌گذاری جدید و رده‌ی پیش‌نمایش ارزان‌قیمت، هم برای توسعه‌دهندگان حرفه‌ای و هم برای کاربران عادی اپلیکیشن جمینای در دسترس قرار گرفته است.
رونمایی گوگل از مدل هوش مصنوعی جمینای امنی ۱.۱ فلش برای ساخت ویدیوی ۴K

۱. جمینای امنی ۱.۱ فلش چیست؟

جمینای امنی ۱.۱ فلش تازه‌ترین عضو خانواده‌ی مدل‌های چندوجهی گوگل است که به‌طور اختصاصی برای تولید و ویرایش ویدیو طراحی شده. برخلاف نسل‌های قبلی که عمدتاً روی یک وظیفه‌ی مشخص مثل تولید کلیپ از روی متن تمرکز داشتند، این مدل چهار مرحله‌ی طراحی اولیه، ویرایش، ادامه‌ی صحنه و ارتقای کیفیت را در یک جریان کاری واحد کنار هم می‌گذارد. به بیان ساده، کاربر دیگر لازم نیست برای هر مرحله به ابزار جداگانه‌ای مراجعه کند؛ همه‌چیز از تولید ایده تا خروجی نهایی در یک محیط انجام می‌شود.

گوگل این مدل را زیرمجموعه‌ی خانواده‌ی امنی معرفی کرده که پیش‌تر هم با نسخه‌های قبلی خود توجه توسعه‌دهندگان را جلب کرده بود. تفاوت اصلی نسخه‌ی ۱.۱ نسبت به نسخه‌های پیشین، تمرکز بیشتر روی کنترل خلاقانه است؛ یعنی به‌جای آنکه صرفاً یک ویدیوی تصادفی از روی توصیف متنی تولید شود، سازنده می‌تواند مسیر دقیق روایت، نقطه‌ی شروع، نقطه‌ی پایان و حتی نوع حرکت دوربین را از پیش تعیین کند.

شرکت گوگل این به‌روزرسانی را در ادامه‌ی روند رقابتی خود در حوزه‌ی هوش مصنوعی مولد معرفی کرده؛ حوزه‌ای که این روزها رقابت میان غول‌های فناوری در آن به‌شدت داغ شده است. برای کسانی که می‌خواهند روند کلی این رقابت را دنبال کنند، صفحه‌ی اخبار هوش مصنوعی سایت مرجع خوبی برای پیگیری این تحولات به‌شمار می‌رود.

۲. چگونه ویدیوهای تا ۴۰ ثانیه ساخته می‌شوند؟

نکته‌ی مهمی که گوگل روی آن تأکید دارد این است که جمینای امنی ۱.۱ فلش، یک ویدیوی ۴۰ ثانیه‌ای را در یک مرحله تولید نمی‌کند. در واقع مدل، خروجی‌ها را در بازه‌های ده‌ثانیه‌ای می‌سازد و برای ادامه دادن هر بخش، تا ده ثانیه از زمینه‌ی تصویری قبلی را تحلیل می‌کند تا پیوستگی بصری صحنه حفظ شود. این رویکرد گام‌به‌گام باعث می‌شود کیفیت و ثبات شخصیت‌ها و اشیای داخل صحنه در طول زمان بهتر حفظ شود، هرچند گوگل هنوز داده‌ی دقیقی درباره‌ی میزان افت کیفیت در ادامه‌های طولانی‌تر منتشر نکرده است.

این رویکرد قطعه‌قطعه‌ی تولید ویدیو یادآور محدودیت‌هایی است که در بسیاری از مدل‌های فعلی هوش مصنوعی دیده می‌شود؛ موضوعی که در مقاله‌ی پتانسیل‌ها و محدودیت‌های واقعی هوش مصنوعی هم به‌طور مفصل بررسی شده است.

۳. ویرایش مکالمه‌ای؛ فقط با یک جمله

یکی از جذاب‌ترین بخش‌های این مدل، ویرایش مکالمه‌ای است. کاربر می‌تواند با یک دستور ساده مانند «صدای ساز را حذف کن» یا «رنگ آسمان را تیره‌تر کن»، بدون نیاز به بازسازی کامل کلیپ، تغییرات مورد نظرش را روی صحنه اعمال کند. این قابلیت عملاً فاصله‌ی میان کاربر حرفه‌ای و کاربر عادی را کم می‌کند؛ چون دیگر نیازی به دانش فنی تدوین ویدیو نیست و صرفاً توصیف دقیق خواسته کافی است.

با این حال باید توجه داشت که این مدل نمی‌تواند فایل صوتی را به‌عنوان ورودی بپذیرد، صدای گوینده را ویرایش کند یا صدای موجود در ویدیوهای مرجع را پردازش کند؛ محدودیتی که نشان می‌دهد بخش صوتی هنوز عقب‌تر از بخش تصویری این مدل توسعه یافته است. برای کسانی که می‌خواهند بهترین نتیجه را از این نوع دستورهای متنی بگیرند، آموزش‌های صفحه‌ی نوشتن پرامپت برای مبتدیان نقطه‌ی شروع خوبی است.

ویرایش مکالمه‌ای ویدیو با دستور متنی در جمینای امنی ۱.۱ فلش گوگل

۴. کنترل فریم آغاز و پایان و حرکت دوربین

قابلیت تعیین فریم آغاز و پایان به سازنده‌های محتوا اجازه می‌دهد دو تصویر مشخص را به‌عنوان نقطه‌ی شروع و پایان یک کلیپ تعیین کنند و مدل، حرکت طبیعی میان آن دو تصویر را تولید کند. این ویژگی به‌خصوص برای تدوین‌گرانی که به دنبال کنترل دقیق‌تر روی روایت تصویری هستند بسیار کاربردی است.

در کنار آن، کنترل دوربین هم به مجموعه‌ی ابزارها اضافه شده؛ شامل حرکت‌های داربی (نزدیک و دور شدن نرم دوربین)، زوم سریع و چرخش حول یک لحظه‌ی ثابت. تا پیش از این، این نوع کنترل‌های حرفه‌ای معمولاً تنها در نرم‌افزارهای تخصصی تدوین ویدیو در دسترس بود، نه در ابزارهای تولید محتوا با هوش مصنوعی.

۵. قیمت‌گذاری جدید: پیش‌نمایش ارزان ۳۶۰ پیکسلی

گوگل در کنار ویژگی‌های فنی، یک رده‌ی قیمتی تازه هم معرفی کرده است: پیش‌نمایش ۳۶۰ پیکسلی. این رده حدود یک‌سوم هزینه‌ی نسخه‌ی ۷۲۰ پیکسلی را دارد و تا ۶۰ درصد سریع‌تر تولید می‌شود؛ گزینه‌ای مناسب برای کسانی که می‌خواهند پیش از صرف هزینه‌ی بالا برای خروجی نهایی، ایده‌های مختلف را سریع آزمایش کنند. نسخه‌های ۷۲۰ پیکسلی، ۱۰۸۰ پیکسلی و ۴K هم بر پایه‌ی هر ثانیه از ویدیوی تولیدشده قیمت‌گذاری می‌شوند و هزینه‌ی نسخه‌ی نهایی ۴K به‌مراتب بیشتر از نسخه‌های پایین‌تر است.

برای کسب‌وکارهایی که تولید محتوای ویدیویی بخشی از استراتژی بازاریابی آن‌هاست، این نوع ابزارهای مقرون‌به‌صرفه می‌تواند تأثیر قابل‌توجهی روی هزینه‌های تولید محتوا داشته باشد؛ موضوعی که در مقاله‌ی اهمیت هوش مصنوعی در کسب‌وکار هم بررسی شده است.

۶. مقایسه با Veo و رقبای دیگر

در مقایسه با مدل ویدیویی دیگر گوگل یعنی Veo، قیمت رده‌ی ۷۲۰ پیکسلی جمینای امنی ۱.۱ فلش با نسخه‌ی سریع Veo برابر است، اما رده‌ی ۱۰۸۰ پیکسلی آن میان دو نسخه‌ی سبک و سریع Veo قرار می‌گیرد و رده‌ی ۴K هم دقیقاً هم‌قیمت نسخه‌ی سریع Veo است. به بیان دیگر، این مدل لزوماً از نظر قیمت ارزان‌تر از رقبای داخلی گوگل نیست؛ مزیت اصلی آن، رده‌ی جدید ۳۶۰ پیکسلی و یکپارچگی کل چرخه‌ی تولید محتوا در یک ابزار است، نه لزوماً قیمت پایین‌تر.

در سطح گسترده‌تر بازار، ابزارهای رقیب از جمله مدل‌های ویدیویی برخی آزمایشگاه‌های نوظهور نیز به همین سمت حرکت می‌کنند: تمرکز بر پیوستگی صحنه، ویرایش با دستور طبیعی‌زبان و کاهش نیاز به مهارت فنی. این موضوع نشان می‌دهد که رقابت واقعی دیگر تنها بر سر کیفیت تصویر خام نیست، بلکه بر سر تجربه‌ی کاربری کامل، از ایده تا خروجی نهایی، در جریان است.

رقابت میان مدل‌های مختلف هوش مصنوعی، چه در حوزه‌ی متن و چه در حوزه‌ی ویدیو، این روزها به یکی از داغ‌ترین موضوعات فناوری تبدیل شده است؛ روندی که پیش‌تر در مقاله‌ی مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک هم به آن پرداخته‌ایم.

قیمت‌گذاری و دسترسی به مدل ویدیوساز جمینای امنی ۱.۱ فلش گوگل برای توسعه‌دهندگان

۷. کجا می‌توان از این مدل استفاده کرد؟

جمینای امنی ۱.۱ فلش هم‌اکنون برای توسعه‌دهندگان از طریق گوگل ای‌آی استودیو و پلتفرم عامل‌های سازمانی جمینای در دسترس است. کاربران عادی هم می‌توانند از طریق گوگل فلو و همچنین اپلیکیشن جمینای، مشروط به داشتن اشتراک پلاس، پرو یا اولترا، از قابلیت ادامه‌ی صحنه استفاده کنند. البته باید توجه داشت که در حال حاضر زبان انگلیسی تنها زبانی است که به‌طور کامل پشتیبانی می‌شود و سایر زبان‌ها از جمله فارسی هنوز به‌طور رسمی ارزیابی و پشتیبانی نشده‌اند.

همچنین در منطقه‌ی اتحادیه‌ی اروپا، سوئیس و بریتانیا، محدودیت‌هایی برای ویرایش و ادامه‌دادن ویدیوهای آپلودشده از خارج اعمال شده که نشان می‌دهد گوگل همچنان با احتیاط بیشتری در این مناطق پیش می‌رود.

۸. همکاری با ادوبی، فیگما و رانوی

یکی از نشانه‌های جدی گرفته‌شدن این مدل در صنعت، همکاری شرکت‌های بزرگی مانند ادوبی فایرفلای، فیگما ویو، رانوی و جی‌ام‌آی کلاود است که اعلام کرده‌اند این فناوری را در محصولات خود ادغام کرده‌اند. این نوع همکاری‌ها نشان می‌دهد که ابزارهای تولید ویدیوی هوش مصنوعی گوگل دیگر تنها محصولی مستقل نیستند، بلکه به‌عنوان یک زیرساخت در اختیار سایر پلتفرم‌های خلاقانه هم قرار گرفته‌اند.

برای کسب‌وکارهای کوچک و فریلنسرهایی که می‌خواهند از این نوع ابزارها به‌درستی استفاده کنند، آشنایی با تفاوت میان کار یک توسعه‌دهنده‌ی واقعی و استفاده‌ی سطحی از هوش مصنوعی هم اهمیت دارد؛ موضوعی که در مقاله‌ی توهم هوش مصنوعی در برابر مهندسی واقعی بررسی شده است.

۹. محدودیت‌ها و نکات مهمی که باید بدانید

با وجود همه‌ی این پیشرفت‌ها، جمینای امنی ۱.۱ فلش هنوز محدودیت‌های مشخصی دارد. این مدل نمی‌تواند صحنه‌ای را در وسط یک کلیپ اضافه کند یا ویدیو را به عقب ادامه دهد؛ ادامه‌ی صحنه فقط از انتهای کلیپ ممکن است. همچنین ویدیوهای خارجی که برای ادامه یا ویرایش آپلود می‌شوند، باید حداکثر ده ثانیه باشند و مدل از ادامه‌دادن ویدیوهایی که فرد در حال صحبت‌کردن است با دیالوگ تازه پشتیبانی نمی‌کند.

واترمارک نامرئی سینتید هم روی تمام خروجی‌ها اعمال می‌شود تا محتوای تولیدشده با هوش مصنوعی قابل شناسایی باشد؛ اقدامی که در راستای شفافیت و مسئولیت‌پذیری در قبال محتوای مصنوعی صورت گرفته است. کسانی که تازه با این نوع ابزارها آشنا می‌شوند، می‌توانند برای درک بهتر مفاهیم پایه، سری آموزش‌های صفحه‌ی آموزش چت‌جی‌پی‌تی را هم مطالعه کنند.

پرسش‌های پرتکرار درباره‌ی جمینای امنی ۱.۱ فلش

آیا جمینای امنی ۱.۱ فلش رایگان است؟ خیر؛ این مدل بر پایه‌ی هزینه‌ی هر ثانیه از ویدیوی تولیدشده قیمت‌گذاری می‌شود، هرچند رده‌ی پیش‌نمایش ۳۶۰ پیکسلی گزینه‌ای ارزان‌تر برای آزمایش سریع ایده‌هاست.

آیا این مدل واقعاً یک ویدیوی ۴۰ ثانیه‌ای را یک‌جا می‌سازد؟ خیر؛ خروجی در بازه‌های ده‌ثانیه‌ای تولید و به‌صورت پیوسته ادامه داده می‌شود، نه در یک مرحله‌ی واحد.

آیا کاربران عادی هم می‌توانند از آن استفاده کنند؟ بله؛ از طریق گوگل فلو و اپلیکیشن جمینای، مشروط به داشتن اشتراک پلاس، پرو یا اولترا، امکان استفاده از قابلیت ادامه‌ی صحنه فراهم است.

چه زبان‌هایی پشتیبانی می‌شوند؟ در حال حاضر تنها زبان انگلیسی به‌طور کامل پشتیبانی می‌شود و ارزیابی رسمی برای سایر زبان‌ها هنوز منتشر نشده است.

جمینای امنی ۱.۱ فلش نشان می‌دهد که مسیر آینده‌ی ابزارهای ویدیویی هوش مصنوعی، به‌جای رقابت صرف بر سر طول یا کیفیت خروجی، به سمت یکپارچگی کامل چرخه‌ی تولید محتوا حرکت می‌کند. برای دنبال‌کردن جدیدترین اخبار هوش مصنوعی و بررسی ابزارهای مشابه، کانال تلگرام @MrChatGPT_IR را دنبال کنید.
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *