گوگل با معرفی «فهم عاملی ویدیو» در خانواده جمینای، قواعد بازی تحلیل ویدیو را عوض کرده است: مصرف توکن تا ۸۸ درصد پایین آمده و دقت هم تا ۷ درصد بالا رفته.

لیست مطالب
۱. پایان عصر «نگاه ثابت» به ویدیو
تا پیش از این، مدلهای زبانی بزرگ ویدیو را تقریباً مثل یک آلبوم عکس پیوسته میدیدند: هر ویدیو با یک نرخ فریم ثابت — معمولاً یک فریم در ثانیه — به تصاویر جداگانه تبدیل میشد و همه آنها به مدل داده میشد. این روش برای کلیپهای کوتاه مشکلی ایجاد نمیکرد، اما برای ویدیوهای چند ساعته — مثل ضبط دوربین امنیتی یا یک وبینار طولانی — عملاً غیرقابل استفاده بود، چون یا باید توکنهای زیادی خرج میشد یا با کاهش نرخ فریم، جزئیات مهم از دست میرفت.
گوگل در تازهترین اخبار هوش مصنوعی خود اعلام کرده این مشکل را با یک تغییر معماری حل کرده است. بهجای پردازش «کور» همه فریمها، مدل جمینای اکنون یک حلقه عاملی (agentic loop) اجرا میکند: ابزار داخلی خودش را فرا میخواند تا فقط بخشهای مرتبط با پرسش کاربر را از فایل ویدیویی بارگذاری کند.
۲. فهم عاملی ویدیو دقیقاً چگونه کار میکند؟
در قلب این فناوری، یک تصمیمگیری هوشمند نشسته است. مدل جمینای پیش از پاسخ دادن، مسیر خودش را طی میکند: نگاه کلی به ویدیو میاندازد، میفهمد سؤال کاربر به کدام بخش مربوط است، و بعد با نرخ فریم متغیر — گاهی خیلی کند و گاهی خیلی تند — دقیقاً همان بخش را با جزئیات کامل بررسی میکند.
این مدل همچنین بین سه حالت ورودی جابهجا میشود: فریمهای تصویری، صدای ویدیو، یا رونوشت متنی گفتوگو. برای مثال اگر سؤال درباره یک دیالوگ خاص باشد، مدل ممکن است بیشتر روی صدا و متن تمرکز کند، اما اگر سؤال درباره یک حرکت یا تغییر صحنه باشد، سراغ فریمهای تصویری با نرخ بالا میرود. این انعطاف همان چیزی است که گوگل آن را «فهم عاملی» مینامد.
۳. عددها چه میگویند؟
طبق دادههای منتشرشده از سوی گوگل، در آزمونهای استاندارد، فهم عاملی ویدیو توانسته مصرف توکن را تا ۸۸ درصد کاهش دهد. این یعنی برای تحلیل یک ویدیوی طولانی، مدل بهجای میلیونها توکن، تنها بخش کوچکی از آن را مصرف میکند. همین کاهش مصرف مستقیماً روی هزینه هم اثر گذاشته و طبق اعلام گوگل، هزینه هر پرسوجو تا ۶۶ درصد پایین آمده است.
نکته مهمتر اما این است که این صرفهجویی به قیمت افت کیفیت تمام نشده. گوگل مدعی است دقت تحلیل، بهویژه در ویدیوهای چند ساعته، تا ۷ درصد هم بهبود پیدا کرده است. در آزمونهای مقایسهای مثل 1H-VideoQA و LVBench، مدل جمینای ۳.۷ فلش توانسته با کمترین هزینه به دقتی نزدیک ۹۰ درصد برسد که آن را در «نقطه بهینه هزینه به کیفیت» قرار میدهد.

۴. چرا این تغییر برای صنعت مهم است؟
ویدیو دیرزمانی است که بهعنوان «آخرین مرز» تحلیل داده توسط هوش مصنوعی شناخته میشود. متن و تصویر ثابت سالهاست که مدلهای زبانی بهخوبی از پس آنها برمیآیند، اما ویدیو بهخاطر حجم بالای اطلاعات — ترکیبی از تصویر متحرک، صدا و زمان — همیشه گرانترین و کندترین نوع ورودی برای این مدلها بوده است. کاهش چشمگیر هزینه در این حوزه میتواند دری تازه به روی کاربردهایی باز کند که تا امروز از نظر اقتصادی توجیهپذیر نبودند.
برای مثال، شرکتهای کوچکتر که آرشیو بزرگی از ضبط دوربینهای مداربسته یا وبینارهای آموزشی دارند، تا پیش از این توان مالی تحلیل خودکار همه آن محتوا را نداشتند. با کاهش تا ۶۶ درصدی هزینه هر پرسوجو، این نوع تحلیل برای طیف گستردهتری از کسبوکارها در دسترس میشود؛ موضوعی که مستقیماً به بحث اهمیت هوش مصنوعی در کسبوکار گره میخورد.
۵. کدام مدلهای جمینای این قابلیت را دارند؟
در حال حاضر سه مدل از خانواده جمینای از فهم عاملی ویدیو پشتیبانی میکنند: جمینای ۳.۷ فلش، جمینای ۳.۶ فلش و جمینای ۳.۵ فلش-لایت. انتخاب گوگل برای شروع این قابلیت از رده «فلش» — یعنی مدلهای سریعتر و ارزانتر خانواده جمینای — نشان میدهد هدف اصلی، در دسترس قرار دادن تحلیل ویدیوی مقرونبهصرفه برای حجم بالای درخواستهاست، نه صرفاً یک نمایش فنی روی گرانترین مدل.
تفاوت با نسل قبلی جمینای
نسلهای قبلی جمینای هم توانایی تحلیل ویدیو داشتند، اما همیشه با همان روش نرخ فریم ثابت کار میکردند. تفاوت اصلی نسل تازه در همین «تصمیمگیری پویا» است؛ چیزی که اگر بخواهیم آن را برای مقایسه با نمونههای مشابه در سایر حوزهها ببینیم، شبیه تفاوت بین یک دوربین مداربسته ساده و یک تحلیلگر امنیتی باتجربه است که میداند دقیقاً کجا باید دقت بیشتری به خرج دهد.
۶. کاربردهای عملی: از تدوین ویدیو تا امنیت
فهرست کاربردهایی که گوگل برای این فناوری معرفی کرده، گسترده است. یکی از مهمترینها، بازیابی لحظهای زیر یک ثانیه است؛ یعنی پیدا کردن یک صحنه دقیق در میان ساعتها فیلم برای تدوین خودکار. کاربرد دیگر، جستوجوی «سوزن در انبار کاه» در ویدیوهای چند ساعته است، مثلاً پیدا کردن یک لحظه خاص در ضبط یک دوربین امنیتی یا یک جلسه طولانی.
تشخیص ناهنجاری هم یکی دیگر از کاربردهاست: مدل میتواند با نمونهبرداری پویا از نرخ فریم، رفتارهای غیرعادی را در یک فیلم شناسایی کند. علاوه بر این، شمارش دقیق اشیا و حرکات تکراری در طول زمان — کاری که تا پیش از این برای مدلهای زبانی بسیار پرهزینه بود — حالا با هزینهای بسیار پایینتر ممکن شده است. کسبوکارهایی که به دنبال اهمیت هوش مصنوعی در کسبوکار هستند، میتوانند این قابلیت را مستقیماً روی دادههای ویدیویی خودشان امتحان کنند.
۷. در دسترس بودن و قیمتگذاری
این قابلیت هماکنون از طریق Gemini API در Google AI Studio و همچنین پلتفرم Gemini Enterprise Agent در دسترس توسعهدهندههاست. نکته مهم برای کسبوکارها این است که گوگل هیچ هزینه اضافهای برای این ویژگی در نظر نگرفته و طبق همان قیمتگذاری استاندارد توکن جمینای محاسبه میشود. بهاینترتیب، هر کسی که همین حالا از API جمینای استفاده میکند، بدون تغییر در قیمتگذاری، از کاهش هزینه بهرهمند خواهد شد.
گوگل همچنین اعلام کرده این قابلیت بهتدریج وارد اپلیکیشن جمینای برای کاربران عادی میشود و قرار است در قابلیت «از یوتیوب بپرس» هم به کار گرفته شود؛ یعنی کاربران یوتیوب میتوانند درباره محتوای دقیق یک ویدیوی طولانی سؤال بپرسند بدون آنکه لازم باشد کل آن را تماشا کنند.

۸. جای گوگل در رقابت هوش مصنوعی
تحلیل ویدیو یکی از سنگینترین و پرهزینهترین انواع داده برای مدلهای زبانی بزرگ است، چون حجم اطلاعات آن بهمراتب بیشتر از متن یا حتی تصویر ثابت است. رقبای اصلی گوگل در این حوزه هم بیکار ننشستهاند؛ برای آشنایی بیشتر با جایگاه هرکدام از بازیگران این میدان، میتوانید مروری بر شرکت OpenAI و محصولاتش یا مقایسهای مثل مقایسه ChatGPT با DeepSeek را در سایت ما بخوانید.
با این حال، تمرکز گوگل روی «کاهش هزینه بدون افت کیفیت» یک نکته راهبردی مهم است. در شرایطی که بسیاری از شرکتها روی بزرگتر کردن مدلها رقابت میکنند، گوگل با این اعلامیه نشان داد بخش بزرگی از پیشرفت میتواند از مهندسی هوشمندانهتر — نه صرفاً مدلهای بزرگتر — بیاید.
۹. محدودیتها و نکات مهم برای توسعهدهندهها
با وجود اعداد چشمگیر، این فناوری هنوز کامل نیست. گوگل خودش هم اذعان دارد که «فهم عاملی ویدیو» فعلاً روی مدلهای رده فلش عرضه شده و هنوز به مدلهای سنگینتر و گرانقیمتتر خانواده جمینای نرسیده است. همچنین، مثل هر سیستم مبتنی بر تصمیمگیری خودکار، احتمال دارد در برخی موارد خاص مدل بخش نادرستی از ویدیو را برای بررسی انتخاب کند. توسعهدهندههایی که میخواهند این قابلیت را در محصول خودشان پیاده کنند، بهتر است ابتدا با مطالعه راهنماهایی مثل نوشتن پرامپت برای مبتدیان نحوه طراحی سؤال درست برای مدل را یاد بگیرند، چون کیفیت خروجی همچنان به وضوح سؤال کاربر وابسته است.
از سوی دیگر، بحث پتانسیل واقعی و محدودیتهای هوش مصنوعی اینجا هم صدق میکند: قابلیتهای جدید همیشه دستاورد قطعی و بینقص نیستند و باید در کاربردهای حساس — مثل تحلیل تصویربرداری امنیتی — با احتیاط و آزمایش کافی به کار گرفته شوند.
۱۰. سوالات متداول
فهم عاملی ویدیو چیست؟
فناوری تازهای از گوگل است که به مدلهای جمینای اجازه میدهد بهجای پردازش ثابت و یکنواخت، خودشان تصمیم بگیرند کدام بخش از یک ویدیو را با چه دقتی بررسی کنند.
چقدر در مصرف توکن صرفهجویی میشود؟
بر اساس اعلام گوگل، مصرف توکن در آزمونهای استاندارد تا ۸۸ درصد کاهش پیدا کرده و هزینه هر پرسوجو هم تا ۶۶ درصد پایین آمده است.
این قابلیت روی کدام مدلها فعال است؟
در حال حاضر روی جمینای ۳.۷ فلش، جمینای ۳.۶ فلش و جمینای ۳.۵ فلش-لایت در دسترس است.
چگونه میتوان از آن استفاده کرد؟
توسعهدهندهها همین حالا از طریق Gemini API و Google AI Studio به آن دسترسی دارند و کاربران عادی هم بهتدریج آن را در اپلیکیشن جمینای و یوتیوب خواهند دید.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
