گوگل با رونمایی از جمینای امنی ۱.۱ فلش، بار دیگر معادلات بازار ویدیوسازی هوش مصنوعی را تغییر داد؛ مدلی که ساخت، ویرایش، ادامهی صحنه و ارتقای کیفیت را در یک ابزار واحد جمع کرده است.

لیست مطالب
۱. جمینای امنی ۱.۱ فلش چیست؟
جمینای امنی ۱.۱ فلش تازهترین عضو خانوادهی مدلهای چندوجهی گوگل است که بهطور اختصاصی برای تولید و ویرایش ویدیو طراحی شده. برخلاف نسلهای قبلی که عمدتاً روی یک وظیفهی مشخص مثل تولید کلیپ از روی متن تمرکز داشتند، این مدل چهار مرحلهی طراحی اولیه، ویرایش، ادامهی صحنه و ارتقای کیفیت را در یک جریان کاری واحد کنار هم میگذارد. به بیان ساده، کاربر دیگر لازم نیست برای هر مرحله به ابزار جداگانهای مراجعه کند؛ همهچیز از تولید ایده تا خروجی نهایی در یک محیط انجام میشود.
گوگل این مدل را زیرمجموعهی خانوادهی امنی معرفی کرده که پیشتر هم با نسخههای قبلی خود توجه توسعهدهندگان را جلب کرده بود. تفاوت اصلی نسخهی ۱.۱ نسبت به نسخههای پیشین، تمرکز بیشتر روی کنترل خلاقانه است؛ یعنی بهجای آنکه صرفاً یک ویدیوی تصادفی از روی توصیف متنی تولید شود، سازنده میتواند مسیر دقیق روایت، نقطهی شروع، نقطهی پایان و حتی نوع حرکت دوربین را از پیش تعیین کند.
شرکت گوگل این بهروزرسانی را در ادامهی روند رقابتی خود در حوزهی هوش مصنوعی مولد معرفی کرده؛ حوزهای که این روزها رقابت میان غولهای فناوری در آن بهشدت داغ شده است. برای کسانی که میخواهند روند کلی این رقابت را دنبال کنند، صفحهی اخبار هوش مصنوعی سایت مرجع خوبی برای پیگیری این تحولات بهشمار میرود.
۲. چگونه ویدیوهای تا ۴۰ ثانیه ساخته میشوند؟
نکتهی مهمی که گوگل روی آن تأکید دارد این است که جمینای امنی ۱.۱ فلش، یک ویدیوی ۴۰ ثانیهای را در یک مرحله تولید نمیکند. در واقع مدل، خروجیها را در بازههای دهثانیهای میسازد و برای ادامه دادن هر بخش، تا ده ثانیه از زمینهی تصویری قبلی را تحلیل میکند تا پیوستگی بصری صحنه حفظ شود. این رویکرد گامبهگام باعث میشود کیفیت و ثبات شخصیتها و اشیای داخل صحنه در طول زمان بهتر حفظ شود، هرچند گوگل هنوز دادهی دقیقی دربارهی میزان افت کیفیت در ادامههای طولانیتر منتشر نکرده است.
این رویکرد قطعهقطعهی تولید ویدیو یادآور محدودیتهایی است که در بسیاری از مدلهای فعلی هوش مصنوعی دیده میشود؛ موضوعی که در مقالهی پتانسیلها و محدودیتهای واقعی هوش مصنوعی هم بهطور مفصل بررسی شده است.
۳. ویرایش مکالمهای؛ فقط با یک جمله
یکی از جذابترین بخشهای این مدل، ویرایش مکالمهای است. کاربر میتواند با یک دستور ساده مانند «صدای ساز را حذف کن» یا «رنگ آسمان را تیرهتر کن»، بدون نیاز به بازسازی کامل کلیپ، تغییرات مورد نظرش را روی صحنه اعمال کند. این قابلیت عملاً فاصلهی میان کاربر حرفهای و کاربر عادی را کم میکند؛ چون دیگر نیازی به دانش فنی تدوین ویدیو نیست و صرفاً توصیف دقیق خواسته کافی است.
با این حال باید توجه داشت که این مدل نمیتواند فایل صوتی را بهعنوان ورودی بپذیرد، صدای گوینده را ویرایش کند یا صدای موجود در ویدیوهای مرجع را پردازش کند؛ محدودیتی که نشان میدهد بخش صوتی هنوز عقبتر از بخش تصویری این مدل توسعه یافته است. برای کسانی که میخواهند بهترین نتیجه را از این نوع دستورهای متنی بگیرند، آموزشهای صفحهی نوشتن پرامپت برای مبتدیان نقطهی شروع خوبی است.

۴. کنترل فریم آغاز و پایان و حرکت دوربین
قابلیت تعیین فریم آغاز و پایان به سازندههای محتوا اجازه میدهد دو تصویر مشخص را بهعنوان نقطهی شروع و پایان یک کلیپ تعیین کنند و مدل، حرکت طبیعی میان آن دو تصویر را تولید کند. این ویژگی بهخصوص برای تدوینگرانی که به دنبال کنترل دقیقتر روی روایت تصویری هستند بسیار کاربردی است.
در کنار آن، کنترل دوربین هم به مجموعهی ابزارها اضافه شده؛ شامل حرکتهای داربی (نزدیک و دور شدن نرم دوربین)، زوم سریع و چرخش حول یک لحظهی ثابت. تا پیش از این، این نوع کنترلهای حرفهای معمولاً تنها در نرمافزارهای تخصصی تدوین ویدیو در دسترس بود، نه در ابزارهای تولید محتوا با هوش مصنوعی.
۵. قیمتگذاری جدید: پیشنمایش ارزان ۳۶۰ پیکسلی
گوگل در کنار ویژگیهای فنی، یک ردهی قیمتی تازه هم معرفی کرده است: پیشنمایش ۳۶۰ پیکسلی. این رده حدود یکسوم هزینهی نسخهی ۷۲۰ پیکسلی را دارد و تا ۶۰ درصد سریعتر تولید میشود؛ گزینهای مناسب برای کسانی که میخواهند پیش از صرف هزینهی بالا برای خروجی نهایی، ایدههای مختلف را سریع آزمایش کنند. نسخههای ۷۲۰ پیکسلی، ۱۰۸۰ پیکسلی و ۴K هم بر پایهی هر ثانیه از ویدیوی تولیدشده قیمتگذاری میشوند و هزینهی نسخهی نهایی ۴K بهمراتب بیشتر از نسخههای پایینتر است.
برای کسبوکارهایی که تولید محتوای ویدیویی بخشی از استراتژی بازاریابی آنهاست، این نوع ابزارهای مقرونبهصرفه میتواند تأثیر قابلتوجهی روی هزینههای تولید محتوا داشته باشد؛ موضوعی که در مقالهی اهمیت هوش مصنوعی در کسبوکار هم بررسی شده است.
۶. مقایسه با Veo و رقبای دیگر
در مقایسه با مدل ویدیویی دیگر گوگل یعنی Veo، قیمت ردهی ۷۲۰ پیکسلی جمینای امنی ۱.۱ فلش با نسخهی سریع Veo برابر است، اما ردهی ۱۰۸۰ پیکسلی آن میان دو نسخهی سبک و سریع Veo قرار میگیرد و ردهی ۴K هم دقیقاً همقیمت نسخهی سریع Veo است. به بیان دیگر، این مدل لزوماً از نظر قیمت ارزانتر از رقبای داخلی گوگل نیست؛ مزیت اصلی آن، ردهی جدید ۳۶۰ پیکسلی و یکپارچگی کل چرخهی تولید محتوا در یک ابزار است، نه لزوماً قیمت پایینتر.
در سطح گستردهتر بازار، ابزارهای رقیب از جمله مدلهای ویدیویی برخی آزمایشگاههای نوظهور نیز به همین سمت حرکت میکنند: تمرکز بر پیوستگی صحنه، ویرایش با دستور طبیعیزبان و کاهش نیاز به مهارت فنی. این موضوع نشان میدهد که رقابت واقعی دیگر تنها بر سر کیفیت تصویر خام نیست، بلکه بر سر تجربهی کاربری کامل، از ایده تا خروجی نهایی، در جریان است.
رقابت میان مدلهای مختلف هوش مصنوعی، چه در حوزهی متن و چه در حوزهی ویدیو، این روزها به یکی از داغترین موضوعات فناوری تبدیل شده است؛ روندی که پیشتر در مقالهی مقایسهی چتجیپیتی و دیپسیک هم به آن پرداختهایم.

۷. کجا میتوان از این مدل استفاده کرد؟
جمینای امنی ۱.۱ فلش هماکنون برای توسعهدهندگان از طریق گوگل ایآی استودیو و پلتفرم عاملهای سازمانی جمینای در دسترس است. کاربران عادی هم میتوانند از طریق گوگل فلو و همچنین اپلیکیشن جمینای، مشروط به داشتن اشتراک پلاس، پرو یا اولترا، از قابلیت ادامهی صحنه استفاده کنند. البته باید توجه داشت که در حال حاضر زبان انگلیسی تنها زبانی است که بهطور کامل پشتیبانی میشود و سایر زبانها از جمله فارسی هنوز بهطور رسمی ارزیابی و پشتیبانی نشدهاند.
همچنین در منطقهی اتحادیهی اروپا، سوئیس و بریتانیا، محدودیتهایی برای ویرایش و ادامهدادن ویدیوهای آپلودشده از خارج اعمال شده که نشان میدهد گوگل همچنان با احتیاط بیشتری در این مناطق پیش میرود.
۸. همکاری با ادوبی، فیگما و رانوی
یکی از نشانههای جدی گرفتهشدن این مدل در صنعت، همکاری شرکتهای بزرگی مانند ادوبی فایرفلای، فیگما ویو، رانوی و جیامآی کلاود است که اعلام کردهاند این فناوری را در محصولات خود ادغام کردهاند. این نوع همکاریها نشان میدهد که ابزارهای تولید ویدیوی هوش مصنوعی گوگل دیگر تنها محصولی مستقل نیستند، بلکه بهعنوان یک زیرساخت در اختیار سایر پلتفرمهای خلاقانه هم قرار گرفتهاند.
برای کسبوکارهای کوچک و فریلنسرهایی که میخواهند از این نوع ابزارها بهدرستی استفاده کنند، آشنایی با تفاوت میان کار یک توسعهدهندهی واقعی و استفادهی سطحی از هوش مصنوعی هم اهمیت دارد؛ موضوعی که در مقالهی توهم هوش مصنوعی در برابر مهندسی واقعی بررسی شده است.
۹. محدودیتها و نکات مهمی که باید بدانید
با وجود همهی این پیشرفتها، جمینای امنی ۱.۱ فلش هنوز محدودیتهای مشخصی دارد. این مدل نمیتواند صحنهای را در وسط یک کلیپ اضافه کند یا ویدیو را به عقب ادامه دهد؛ ادامهی صحنه فقط از انتهای کلیپ ممکن است. همچنین ویدیوهای خارجی که برای ادامه یا ویرایش آپلود میشوند، باید حداکثر ده ثانیه باشند و مدل از ادامهدادن ویدیوهایی که فرد در حال صحبتکردن است با دیالوگ تازه پشتیبانی نمیکند.
واترمارک نامرئی سینتید هم روی تمام خروجیها اعمال میشود تا محتوای تولیدشده با هوش مصنوعی قابل شناسایی باشد؛ اقدامی که در راستای شفافیت و مسئولیتپذیری در قبال محتوای مصنوعی صورت گرفته است. کسانی که تازه با این نوع ابزارها آشنا میشوند، میتوانند برای درک بهتر مفاهیم پایه، سری آموزشهای صفحهی آموزش چتجیپیتی را هم مطالعه کنند.
پرسشهای پرتکرار دربارهی جمینای امنی ۱.۱ فلش
آیا جمینای امنی ۱.۱ فلش رایگان است؟ خیر؛ این مدل بر پایهی هزینهی هر ثانیه از ویدیوی تولیدشده قیمتگذاری میشود، هرچند ردهی پیشنمایش ۳۶۰ پیکسلی گزینهای ارزانتر برای آزمایش سریع ایدههاست.
آیا این مدل واقعاً یک ویدیوی ۴۰ ثانیهای را یکجا میسازد؟ خیر؛ خروجی در بازههای دهثانیهای تولید و بهصورت پیوسته ادامه داده میشود، نه در یک مرحلهی واحد.
آیا کاربران عادی هم میتوانند از آن استفاده کنند؟ بله؛ از طریق گوگل فلو و اپلیکیشن جمینای، مشروط به داشتن اشتراک پلاس، پرو یا اولترا، امکان استفاده از قابلیت ادامهی صحنه فراهم است.
چه زبانهایی پشتیبانی میشوند؟ در حال حاضر تنها زبان انگلیسی بهطور کامل پشتیبانی میشود و ارزیابی رسمی برای سایر زبانها هنوز منتشر نشده است.