جمینای ۳.۵ ترنسکرایب گوگل؛ مدلی که صدا را با دقت خیره‌کننده به متن تبدیل می‌کند

اخبار · هوش مصنوعی

شرکت گوگل یک مدل تازه برای تبدیل گفتار به متن معرفی کرده که به گفته‌ی خودش، دیگر فقط «می‌شنود» بلکه «می‌فهمد». نامش جمینای ۳.۵ ترنسکرایب است و قرار است رونویسی صدا را برای همیشه عوض کند.

چکیده. گوگل مدل جدیدی به نام Gemini 3.5 Transcribe منتشر کرده که صدا را به متنی تمیز، فرمت‌شده و قابل‌فهم تبدیل می‌کند. این مدل علاوه بر رونویسی دقیق، احساس و لحن گوینده را هم تشخیص می‌دهد، بیش از ۸۵ زبان را پشتیبانی می‌کند و نرخ خطای آن به کمتر از سه درصد رسیده است. این مدل هم‌اکنون در چند محصول گوگل فعال شده و به‌زودی وارد مرورگر کروم هم می‌شود.
لوگوی جمینای گوگل در کنار عنوان معرفی مدل رونویسی صدا به متن Gemini 3.5 Transcribe

۱. جمینای ۳.۵ ترنسکرایب دقیقاً چیست؟

شرکت گوگل در بیانیه‌ی رسمی خود، Gemini 3.5 Transcribe را مدلی برای «تبدیل صدای خام به متنی دقیق، تمیز و فرمت‌شده» معرفی کرده است. تفاوت اصلی آن با ابزارهای سنتی رونویسی این‌جاست که این مدل صرفاً کلمه‌به‌کلمه گوش نمی‌دهد؛ خودش تصحیح می‌کند، خودش تمیزکاری می‌کند و خودش تصمیم می‌گیرد چه چیزی در متن نهایی بماند.

این رویکرد، ادامه‌ی مسیری است که غول‌های فناوری چند سال است روی آن سرمایه‌گذاری می‌کنند: جایگزینی «تشخیص صدا» با «فهم صدا». پیش‌تر ابزارهای رونویسی صرفاً امواج صوتی را به نزدیک‌ترین کلمه‌ی ممکن تبدیل می‌کردند و اصلاح خطاها، ویرایش نگارشی و پاک‌سازی متن به‌طور کامل بر عهده‌ی کاربر بود. اکنون بخش بزرگی از همین زحمت را خود مدل انجام می‌دهد و در عمل، فاصله‌ی میان «فایل صوتی خام» و «متن نهایی قابل انتشار» به‌شدت کوتاه شده است.

برای مثال اگر گوینده‌ای بگوید «سه‌شنبه همدیگر رو ببینیم… نه ببخشید چهارشنبه بهتره»، مدل به‌جای نوشتن عین همین جمله‌ی پر از تردید، نسخه‌ی اصلاح‌شده و نهایی را ثبت می‌کند: قرار ملاقات برای چهارشنبه. کلمات پرکننده مثل «اِ» و «ام» هم به‌طور خودکار حذف می‌شوند تا متن نهایی روان و قابل‌استناد باشد. برای آشنایی بیشتر با کاربرد عملی چنین ابزارهایی در کارهای روزمره، می‌توانید سری آموزش‌های چت‌جی‌پی‌تی را هم دنبال کنید.

۲. چرا این مدل با نسخه‌های قبلی گوگل فرق دارد؟

نسل قبلی موتور رونویسی گوگل با نام Chirp 3 شناخته می‌شد؛ مدلی که عملکرد قابل قبولی داشت اما در مواجهه با اصطلاحات تخصصی، لهجه‌های ناآشنا و مکالمات پرنویز، محدودیت‌های زیادی نشان می‌داد. جمینای ۳.۵ ترنسکرایب روی همان پایه ساخته شده، اما گوگل مدعی است بهبود چشمگیری در سرعت و دقت داشته است.

یکی از اعداد جالبی که در معرفی این مدل منتشر شده، کاهش ۷۰ درصدی «زمان رسیدن به رونویسی نهایی» است. یعنی مدل نه‌تنها دقیق‌تر شده، بلکه خروجی را هم سریع‌تر از قبل تحویل می‌دهد. این مدل همچنین می‌تواند واژگان اختصاصی و اصطلاحات تخصصی یک سازمان را یاد بگیرد و در رونویسی‌های بعدی از همان واژگان استفاده کند؛ ویژگی‌ای که برای شرکت‌های حقوقی، پزشکی و فنی بسیار کاربردی است.

۳. تشخیص احساس و شناسایی گوینده؛ ویژگی که رقبا هنوز ندارند

نکته‌ای که این مدل را از اغلب رقبا متمایز می‌کند، توانایی تشخیص احساس گوینده است. اکثر ابزارهای رونویسی فقط روی دقت کلمه‌به‌کلمه تمرکز دارند، اما جمینای ۳.۵ ترنسکرایب می‌تواند در یک تماس یا جلسه، لحظه‌ی دقیقی را که مشتری عصبانی یا ناراضی شده مشخص کند. برای یک مرکز تماس یا تیم پشتیبانی، این یعنی به‌جای خواندن صفحه‌ها متن، فقط کافی است به همان لحظه‌ی مشخص‌شده مراجعه کنند.

در کنار این، مدل قابلیت شناسایی چند گوینده را هم دارد؛ در حالت استاندارد تا سه نفر و به‌صورت آزمایشی حتی بیشتر از آن را از هم تشخیص می‌دهد و برای هرکدام برچسب زمانی دقیق (به فرمت دقیقه:ثانیه) ثبت می‌کند. این قابلیت، ساخت خلاصه‌ی جلسات کاری چندنفره را به‌شکل قابل توجهی ساده‌تر می‌کند. اگر می‌خواهید بدانید چنین ابزارهایی چطور می‌توانند در کسب‌وکار واقعی اثرگذار باشند، مقاله‌ی اهمیت هوش مصنوعی برای کسب‌وکار در سال ۲۰۲۵ را از دست ندهید.

مقایسه دقت رونویسی صدا به متن مدل جمینای گوگل با ویسپر اوپن‌ای‌آی

۴. اعداد و دقت: پشت پرده‌ی عملکرد مدل

گوگل چند رقم مشخص برای دقت این مدل منتشر کرده است. نرخ خطای کلمه‌ای (WER) در حالت جریانی به ۴.۰ درصد و در حالت غیرجریانی به ۲.۶ درصد رسیده؛ یعنی از هر صد کلمه، تنها دو تا چهار کلمه احتمال اشتباه دارند. در آزمون چندزبانه‌ی FLEURS نیز نرخ خطا به‌ترتیب ۵.۵۰ و ۵.۰۴ درصد گزارش شده که برای مدلی با پشتیبانی از بیش از ۸۵ زبان، عدد قابل توجهی است.

از نظر ظرفیت پردازش، این مدل با یک پنجره‌ی زمینه‌ی ۹۶ هزار توکنی کار می‌کند که تقریباً معادل یک ساعت صدای پیوسته است؛ یعنی یک جلسه‌ی کاری استاندارد را می‌توان بدون تکه‌تکه‌کردن فایل صوتی، یک‌جا پردازش کرد. فرمت‌های رایج صوتی مثل MP3 هم از طریق Gemini API، گوگل ای‌آی استودیو و اپلیکیشن مک قابل آپلود هستند.

۵. کجا همین حالا می‌توان از این مدل استفاده کرد؟

گوگل این مدل را به‌تدریج در محصولات مختلف خودش فعال کرده است. در کیبورد Gboard اندروید، قابلیت Rambler از همین موتور استفاده می‌کند. در اپلیکیشن جمینای برای مک، ویژگی تازه‌ای با نام «صحبت با پنجره» امکان دیکته‌ی مستقیم متن در هر برنامه‌ای را فراهم کرده است. جعبه‌ی پرامپت Google Antigravity هم از همین مدل برای ورودی صوتی بهره می‌برد.

ورود این مدل به مرورگر کروم برای تایپ صوتی در فیلدهای وب هم اعلام شده و به‌زودی در دسترس قرار می‌گیرد. با این روند، احتمالاً بخش زیادی از کاربران روزمره‌ی گوگل، بدون این‌که حتی متوجه شوند، از این مدل استفاده خواهند کرد.

۶. دسترسی برای توسعه‌دهندگان و سازمان‌ها

برای توسعه‌دهندگانی که می‌خواهند این قابلیت را در محصول خودشان بگنجانند، گوگل دسترسی پیش‌نمایش عمومی از طریق Gemini API در Google AI Studio و Google Antigravity فراهم کرده است. اگر تازه با نوشتن دستور برای مدل‌های هوش مصنوعی آشنا می‌شوید، راهنمای نوشتن پرامپت برای مبتدی‌ها نقطه‌ی خوبی برای شروع است.

در سطح سازمانی هم، این مدل از طریق پلتفرم Gemini Enterprise Agent در دسترس شرکت‌هاست و به‌زودی وارد Gemini Enterprise for Customer Experience هم خواهد شد؛ یعنی مراکز تماس و تیم‌های پشتیبانی مشتری می‌توانند مستقیماً از آن در جریان کاری خودشان استفاده کنند. گوگل هنوز جزییات قیمت‌گذاری این سرویس را اعلام نکرده است.

تفاوت با نسخه‌ی بلادرنگ

نکته‌ی مهمی که کاربران فنی باید بدانند این است که Gemini 3.5 Transcribe برای رونویسی فایل‌های آپلودشده و کاربردهای غیرزمان‌واقعی طراحی شده، نه پخش زنده. برای رونویسی بلادرنگ (مثل زیرنویس زنده)، گوگل همچنان کاربران را به Cloud Speech-to-Text API و Live API ارجاع می‌دهد؛ یعنی این دو مسیر از نظر معماری از هم جدا نگه داشته شده‌اند تا تأخیر پردازش برای کاربردهای حساس به زمان کمینه بماند.

کاربرد هوش مصنوعی جمینای در خلاصه‌سازی جلسات کاری و تشخیص لحن گوینده

۷. مقایسه با ویسپر اوپن‌ای‌آی و رقبای دیگر

تا پیش از این، Whisper اوپن‌ای‌آی یکی از شناخته‌شده‌ترین گزینه‌ها برای رونویسی صدا به متن بود. تفاوت اصلی جمینای ۳.۵ ترنسکرایب این‌جاست که علاوه بر رونویسی خام، ترجمه، خلاصه‌سازی و حتی فراخوانی سایر مدل‌های جمینای (مثل تولید تصویر یا تحلیل فایل) را هم در یک بسته‌ی واحد ارائه می‌دهد. به بیان دیگر، قابلیت‌هایی که پیش‌تر نیازمند چند ابزار تخصصی جداگانه بودند، حالا در یک API عمومی جمع شده‌اند. برای درک بهتر این‌که شرکت اوپن‌ای‌آی چطور کار خودش را شروع کرد و چه جایگاهی در این رقابت دارد، مقاله‌ی اوپن‌ای‌آی چیست را بخوانید.

رقابت میان غول‌های هوش مصنوعی محدود به رونویسی صدا نیست؛ در حوزه‌های دیگر مثل استدلال و بازی هم این رقابت ادامه دارد. نمونه‌اش را می‌توانید در مقایسه‌ی چت‌جی‌پی‌تی در برابر دیپ‌سیک ببینید. آنچه مشخص است این‌که هرکدام از این شرکت‌ها روی یک نقطه‌ی قوت متفاوت سرمایه‌گذاری می‌کنند و کاربر نهایی از این رقابت سود می‌برد.

۸. این تغییر چه معنایی برای کسب‌وکارها و تولیدکنندگان محتوا دارد؟

برای پادکسترها، خبرنگاران، تیم‌های فروش و مدیران پروژه، ابزار رونویسی دقیق یعنی صرفه‌جویی واقعی در زمان. دیگر نیازی نیست کسی ساعت‌ها بنشیند و مصاحبه یا جلسه را از روی فایل صوتی تایپ کند. با این حال، مثل هر فناوری جدید دیگری، باید انتظارات را واقع‌بینانه نگه داشت؛ این مدل قدرتمند است، اما جایگزین کامل قضاوت انسانی در موقعیت‌های حساس نیست. برای نگاهی صادقانه به توانایی‌ها و محدودیت‌های واقعی هوش مصنوعی، مقاله‌ی پتانسیل و محدودیت‌های واقعی هوش مصنوعی را پیشنهاد می‌کنیم.

نکته‌ی دیگر این‌که وجود چنین ابزارهایی به‌معنای بی‌نیازی از مهارت انسانی نیست. کسی که بداند چطور از خروجی این ابزارها استفاده کند و آن را ویرایش و راستی‌آزمایی کند، همچنان یک قدم جلوتر خواهد بود. برای تفاوت میان استفاده‌ی سطحی و استفاده‌ی حرفه‌ای از این ابزارها، مقاله‌ی توهم هوش مصنوعی؛ توسعه‌دهنده‌ی تنها در برابر مهندس واقعی خواندنی است.

در نهایت، آنچه این مدل را برای مخاطب عمومی جذاب می‌کند، سادگی استفاده از آن است. کاربر نیازی به دانش فنی ندارد؛ کافی است فایل صوتی را در یکی از محصولات گوگل بارگذاری کند تا متن نهایی آماده شود. همین سادگی است که باعث می‌شود چنین فناوری‌هایی خیلی سریع‌تر از حد انتظار وارد زندگی روزمره‌ی میلیون‌ها کاربر شوند، درست همان‌طور که چت‌بات‌های مکالمه‌ای طی دو سه سال گذشته این اتفاق را تجربه کردند.

سوالات متداول درباره‌ی جمینای ۳.۵ ترنسکرایب

آیا جمینای ۳.۵ ترنسکرایب رایگان است؟
گوگل تا امروز جزییات قیمت‌گذاری این سرویس را اعلام نکرده است. دسترسی توسعه‌دهندگان از طریق Gemini API فعلاً در مرحله‌ی پیش‌نمایش عمومی است.

این مدل چند زبان را پشتیبانی می‌کند؟
بیش از ۸۵ زبان، همراه با توانایی تشخیص لهجه‌های منطقه‌ای مختلف در همان زبان.

آیا برای رونویسی زنده و بلادرنگ هم مناسب است؟
خیر؛ برای کاربردهای بلادرنگ، گوگل کاربران را به سرویس‌های جداگانه‌ی Cloud Speech-to-Text و Live API ارجاع می‌دهد.

چه تعداد گوینده را می‌تواند از هم تشخیص دهد؟
در حالت استاندارد تا سه گوینده، و به‌صورت آزمایشی تعداد بیشتری هم پشتیبانی می‌شود.

آیا این مدل جایگزین Whisper اوپن‌ای‌آی می‌شود؟
هنوز زود است برای قضاوت قطعی، اما از نظر مجموعه‌قابلیت‌ها (رونویسی، ترجمه، خلاصه‌سازی و تشخیص احساس در یک بسته)، رقیب جدی‌ای به‌حساب می‌آید.

جمع‌بندی. جمینای ۳.۵ ترنسکرایب نشان می‌دهد رونویسی صدا به متن دیگر فقط یک کار مکانیکی نیست؛ گوگل با افزودن تشخیص احساس، شناسایی گوینده و دقت بالا، این ابزار را به یک دستیار واقعی برای کسب‌وکارها تبدیل کرده است. برای دنبال‌کردن آخرین اخبار هوش مصنوعی و تحلیل‌های مشابه، سری اخبار هوش مصنوعی سایت را از دست ندهید و کانال تلگرام @MrChatGPT_IR را هم دنبال کنید.
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *