فهم عاملی ویدیو؛ جمینای گوگل تحلیل ویدیو را تا ۸۸ درصد ارزان‌تر کرد

اخبار · هوش مصنوعی

گوگل با معرفی «فهم عاملی ویدیو» در خانواده جمینای، قواعد بازی تحلیل ویدیو را عوض کرده است: مصرف توکن تا ۸۸ درصد پایین آمده و دقت هم تا ۷ درصد بالا رفته.

چکیده. شرکت گوگل قابلیت تازه‌ای به نام «فهم عاملی ویدیو» (Agentic Video Understanding) را برای مدل‌های جمینای ۳.۷ فلش، ۳.۶ فلش و ۳.۵ فلش-لایت عرضه کرده است. برخلاف روش قدیمی که ویدیو را با نرخ فریم ثابت پردازش می‌کرد، مدل جدید مثل یک تحلیل‌گر انسانی رفتار می‌کند: خودش تصمیم می‌گیرد کدام لحظه از ویدیو مهم است و باید با چه دقتی بررسی شود. نتیجه این تغییر، کاهش تا ۸۸ درصدی مصرف توکن، افت تا ۶۶ درصدی هزینه هر پرس‌وجو و در عین حال بهبود تا ۷ درصدی دقت تحلیل است.
فهم عاملی ویدیو در جمینای گوگل با کاهش ۸۸ درصدی مصرف توکن

۱. پایان عصر «نگاه ثابت» به ویدیو

تا پیش از این، مدل‌های زبانی بزرگ ویدیو را تقریباً مثل یک آلبوم عکس پیوسته می‌دیدند: هر ویدیو با یک نرخ فریم ثابت — معمولاً یک فریم در ثانیه — به تصاویر جداگانه تبدیل می‌شد و همه آن‌ها به مدل داده می‌شد. این روش برای کلیپ‌های کوتاه مشکلی ایجاد نمی‌کرد، اما برای ویدیوهای چند ساعته — مثل ضبط دوربین امنیتی یا یک وبینار طولانی — عملاً غیرقابل استفاده بود، چون یا باید توکن‌های زیادی خرج می‌شد یا با کاهش نرخ فریم، جزئیات مهم از دست می‌رفت.

گوگل در تازه‌ترین اخبار هوش مصنوعی خود اعلام کرده این مشکل را با یک تغییر معماری حل کرده است. به‌جای پردازش «کور» همه فریم‌ها، مدل جمینای اکنون یک حلقه عاملی (agentic loop) اجرا می‌کند: ابزار داخلی خودش را فرا می‌خواند تا فقط بخش‌های مرتبط با پرسش کاربر را از فایل ویدیویی بارگذاری کند.

۲. فهم عاملی ویدیو دقیقاً چگونه کار می‌کند؟

در قلب این فناوری، یک تصمیم‌گیری هوشمند نشسته است. مدل جمینای پیش از پاسخ دادن، مسیر خودش را طی می‌کند: نگاه کلی به ویدیو می‌اندازد، می‌فهمد سؤال کاربر به کدام بخش مربوط است، و بعد با نرخ فریم متغیر — گاهی خیلی کند و گاهی خیلی تند — دقیقاً همان بخش را با جزئیات کامل بررسی می‌کند.

این مدل همچنین بین سه حالت ورودی جابه‌جا می‌شود: فریم‌های تصویری، صدای ویدیو، یا رونوشت متنی گفت‌وگو. برای مثال اگر سؤال درباره یک دیالوگ خاص باشد، مدل ممکن است بیشتر روی صدا و متن تمرکز کند، اما اگر سؤال درباره یک حرکت یا تغییر صحنه باشد، سراغ فریم‌های تصویری با نرخ بالا می‌رود. این انعطاف همان چیزی است که گوگل آن را «فهم عاملی» می‌نامد.

۳. عدد‌ها چه می‌گویند؟

طبق داده‌های منتشرشده از سوی گوگل، در آزمون‌های استاندارد، فهم عاملی ویدیو توانسته مصرف توکن را تا ۸۸ درصد کاهش دهد. این یعنی برای تحلیل یک ویدیوی طولانی، مدل به‌جای میلیون‌ها توکن، تنها بخش کوچکی از آن را مصرف می‌کند. همین کاهش مصرف مستقیماً روی هزینه هم اثر گذاشته و طبق اعلام گوگل، هزینه هر پرس‌وجو تا ۶۶ درصد پایین آمده است.

نکته مهم‌تر اما این است که این صرفه‌جویی به قیمت افت کیفیت تمام نشده. گوگل مدعی است دقت تحلیل، به‌ویژه در ویدیوهای چند ساعته، تا ۷ درصد هم بهبود پیدا کرده است. در آزمون‌های مقایسه‌ای مثل 1H-VideoQA و LVBench، مدل جمینای ۳.۷ فلش توانسته با کمترین هزینه به دقتی نزدیک ۹۰ درصد برسد که آن را در «نقطه بهینه هزینه به کیفیت» قرار می‌دهد.

مدل جمینای ۳.۷ فلش گوگل با بهترین نسبت دقت به هزینه در تحلیل ویدیو

۴. چرا این تغییر برای صنعت مهم است؟

ویدیو دیرزمانی است که به‌عنوان «آخرین مرز» تحلیل داده توسط هوش مصنوعی شناخته می‌شود. متن و تصویر ثابت سال‌هاست که مدل‌های زبانی به‌خوبی از پس آن‌ها برمی‌آیند، اما ویدیو به‌خاطر حجم بالای اطلاعات — ترکیبی از تصویر متحرک، صدا و زمان — همیشه گران‌ترین و کندترین نوع ورودی برای این مدل‌ها بوده است. کاهش چشمگیر هزینه در این حوزه می‌تواند دری تازه به روی کاربردهایی باز کند که تا امروز از نظر اقتصادی توجیه‌پذیر نبودند.

برای مثال، شرکت‌های کوچک‌تر که آرشیو بزرگی از ضبط دوربین‌های مداربسته یا وبینارهای آموزشی دارند، تا پیش از این توان مالی تحلیل خودکار همه آن محتوا را نداشتند. با کاهش تا ۶۶ درصدی هزینه هر پرس‌وجو، این نوع تحلیل برای طیف گسترده‌تری از کسب‌وکارها در دسترس می‌شود؛ موضوعی که مستقیماً به بحث اهمیت هوش مصنوعی در کسب‌وکار گره می‌خورد.

۵. کدام مدل‌های جمینای این قابلیت را دارند؟

در حال حاضر سه مدل از خانواده جمینای از فهم عاملی ویدیو پشتیبانی می‌کنند: جمینای ۳.۷ فلش، جمینای ۳.۶ فلش و جمینای ۳.۵ فلش-لایت. انتخاب گوگل برای شروع این قابلیت از رده «فلش» — یعنی مدل‌های سریع‌تر و ارزان‌تر خانواده جمینای — نشان می‌دهد هدف اصلی، در دسترس قرار دادن تحلیل ویدیوی مقرون‌به‌صرفه برای حجم بالای درخواست‌هاست، نه صرفاً یک نمایش فنی روی گران‌ترین مدل.

تفاوت با نسل قبلی جمینای

نسل‌های قبلی جمینای هم توانایی تحلیل ویدیو داشتند، اما همیشه با همان روش نرخ فریم ثابت کار می‌کردند. تفاوت اصلی نسل تازه در همین «تصمیم‌گیری پویا» است؛ چیزی که اگر بخواهیم آن را برای مقایسه با نمونه‌های مشابه در سایر حوزه‌ها ببینیم، شبیه تفاوت بین یک دوربین مداربسته ساده و یک تحلیل‌گر امنیتی باتجربه است که می‌داند دقیقاً کجا باید دقت بیشتری به خرج دهد.

۶. کاربردهای عملی: از تدوین ویدیو تا امنیت

فهرست کاربردهایی که گوگل برای این فناوری معرفی کرده، گسترده است. یکی از مهم‌ترین‌ها، بازیابی لحظه‌ای زیر یک ثانیه است؛ یعنی پیدا کردن یک صحنه دقیق در میان ساعت‌ها فیلم برای تدوین خودکار. کاربرد دیگر، جست‌وجوی «سوزن در انبار کاه» در ویدیوهای چند ساعته است، مثلاً پیدا کردن یک لحظه خاص در ضبط یک دوربین امنیتی یا یک جلسه طولانی.

تشخیص ناهنجاری هم یکی دیگر از کاربردهاست: مدل می‌تواند با نمونه‌برداری پویا از نرخ فریم، رفتارهای غیرعادی را در یک فیلم شناسایی کند. علاوه بر این، شمارش دقیق اشیا و حرکات تکراری در طول زمان — کاری که تا پیش از این برای مدل‌های زبانی بسیار پرهزینه بود — حالا با هزینه‌ای بسیار پایین‌تر ممکن شده است. کسب‌وکارهایی که به دنبال اهمیت هوش مصنوعی در کسب‌وکار هستند، می‌توانند این قابلیت را مستقیماً روی داده‌های ویدیویی خودشان امتحان کنند.

۷. در دسترس بودن و قیمت‌گذاری

این قابلیت هم‌اکنون از طریق Gemini API در Google AI Studio و همچنین پلتفرم Gemini Enterprise Agent در دسترس توسعه‌دهنده‌هاست. نکته مهم برای کسب‌وکارها این است که گوگل هیچ هزینه اضافه‌ای برای این ویژگی در نظر نگرفته و طبق همان قیمت‌گذاری استاندارد توکن جمینای محاسبه می‌شود. به‌این‌ترتیب، هر کسی که همین حالا از API جمینای استفاده می‌کند، بدون تغییر در قیمت‌گذاری، از کاهش هزینه بهره‌مند خواهد شد.

گوگل همچنین اعلام کرده این قابلیت به‌تدریج وارد اپلیکیشن جمینای برای کاربران عادی می‌شود و قرار است در قابلیت «از یوتیوب بپرس» هم به کار گرفته شود؛ یعنی کاربران یوتیوب می‌توانند درباره محتوای دقیق یک ویدیوی طولانی سؤال بپرسند بدون آنکه لازم باشد کل آن را تماشا کنند.

کاربردهای فهم عاملی ویدیوی جمینای در تدوین و امنیت و تحلیل ویدیوهای طولانی

۸. جای گوگل در رقابت هوش مصنوعی

تحلیل ویدیو یکی از سنگین‌ترین و پرهزینه‌ترین انواع داده برای مدل‌های زبانی بزرگ است، چون حجم اطلاعات آن به‌مراتب بیشتر از متن یا حتی تصویر ثابت است. رقبای اصلی گوگل در این حوزه هم بی‌کار ننشسته‌اند؛ برای آشنایی بیشتر با جایگاه هرکدام از بازیگران این میدان، می‌توانید مروری بر شرکت OpenAI و محصولاتش یا مقایسه‌ای مثل مقایسه ChatGPT با DeepSeek را در سایت ما بخوانید.

با این حال، تمرکز گوگل روی «کاهش هزینه بدون افت کیفیت» یک نکته راهبردی مهم است. در شرایطی که بسیاری از شرکت‌ها روی بزرگ‌تر کردن مدل‌ها رقابت می‌کنند، گوگل با این اعلامیه نشان داد بخش بزرگی از پیشرفت می‌تواند از مهندسی هوشمندانه‌تر — نه صرفاً مدل‌های بزرگ‌تر — بیاید.

۹. محدودیت‌ها و نکات مهم برای توسعه‌دهنده‌ها

با وجود اعداد چشمگیر، این فناوری هنوز کامل نیست. گوگل خودش هم اذعان دارد که «فهم عاملی ویدیو» فعلاً روی مدل‌های رده فلش عرضه شده و هنوز به مدل‌های سنگین‌تر و گران‌قیمت‌تر خانواده جمینای نرسیده است. همچنین، مثل هر سیستم مبتنی بر تصمیم‌گیری خودکار، احتمال دارد در برخی موارد خاص مدل بخش نادرستی از ویدیو را برای بررسی انتخاب کند. توسعه‌دهنده‌هایی که می‌خواهند این قابلیت را در محصول خودشان پیاده کنند، بهتر است ابتدا با مطالعه راهنماهایی مثل نوشتن پرامپت برای مبتدیان نحوه طراحی سؤال درست برای مدل را یاد بگیرند، چون کیفیت خروجی همچنان به وضوح سؤال کاربر وابسته است.

از سوی دیگر، بحث پتانسیل واقعی و محدودیت‌های هوش مصنوعی اینجا هم صدق می‌کند: قابلیت‌های جدید همیشه دستاورد قطعی و بی‌نقص نیستند و باید در کاربردهای حساس — مثل تحلیل تصویربرداری امنیتی — با احتیاط و آزمایش کافی به کار گرفته شوند.

۱۰. سوالات متداول

فهم عاملی ویدیو چیست؟

فناوری تازه‌ای از گوگل است که به مدل‌های جمینای اجازه می‌دهد به‌جای پردازش ثابت و یکنواخت، خودشان تصمیم بگیرند کدام بخش از یک ویدیو را با چه دقتی بررسی کنند.

چقدر در مصرف توکن صرفه‌جویی می‌شود؟

بر اساس اعلام گوگل، مصرف توکن در آزمون‌های استاندارد تا ۸۸ درصد کاهش پیدا کرده و هزینه هر پرس‌وجو هم تا ۶۶ درصد پایین آمده است.

این قابلیت روی کدام مدل‌ها فعال است؟

در حال حاضر روی جمینای ۳.۷ فلش، جمینای ۳.۶ فلش و جمینای ۳.۵ فلش-لایت در دسترس است.

چگونه می‌توان از آن استفاده کرد؟

توسعه‌دهنده‌ها همین حالا از طریق Gemini API و Google AI Studio به آن دسترسی دارند و کاربران عادی هم به‌تدریج آن را در اپلیکیشن جمینای و یوتیوب خواهند دید.

جمع‌بندی: گوگل با «فهم عاملی ویدیو» نشان داد آینده تحلیل ویدیو با هوش مصنوعی، دیگر پردازش کور همه فریم‌ها نیست، بلکه تصمیم‌گیری هوشمند درباره اینکه «کجا نگاه کنیم» است. برای دنبال کردن ادامه این رقابت و اخبار تازه هوش مصنوعی، کانال ما آموزش‌های چت‌جی‌پی‌تی را هم از دست ندهید و در تلگرام به ما بپیوندید: @MrChatGPT_IR

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *