شرکت گوگل یک مدل تازه برای تبدیل گفتار به متن معرفی کرده که به گفتهی خودش، دیگر فقط «میشنود» بلکه «میفهمد». نامش جمینای ۳.۵ ترنسکرایب است و قرار است رونویسی صدا را برای همیشه عوض کند.

لیست مطالب
۱. جمینای ۳.۵ ترنسکرایب دقیقاً چیست؟
شرکت گوگل در بیانیهی رسمی خود، Gemini 3.5 Transcribe را مدلی برای «تبدیل صدای خام به متنی دقیق، تمیز و فرمتشده» معرفی کرده است. تفاوت اصلی آن با ابزارهای سنتی رونویسی اینجاست که این مدل صرفاً کلمهبهکلمه گوش نمیدهد؛ خودش تصحیح میکند، خودش تمیزکاری میکند و خودش تصمیم میگیرد چه چیزی در متن نهایی بماند.
این رویکرد، ادامهی مسیری است که غولهای فناوری چند سال است روی آن سرمایهگذاری میکنند: جایگزینی «تشخیص صدا» با «فهم صدا». پیشتر ابزارهای رونویسی صرفاً امواج صوتی را به نزدیکترین کلمهی ممکن تبدیل میکردند و اصلاح خطاها، ویرایش نگارشی و پاکسازی متن بهطور کامل بر عهدهی کاربر بود. اکنون بخش بزرگی از همین زحمت را خود مدل انجام میدهد و در عمل، فاصلهی میان «فایل صوتی خام» و «متن نهایی قابل انتشار» بهشدت کوتاه شده است.
برای مثال اگر گویندهای بگوید «سهشنبه همدیگر رو ببینیم… نه ببخشید چهارشنبه بهتره»، مدل بهجای نوشتن عین همین جملهی پر از تردید، نسخهی اصلاحشده و نهایی را ثبت میکند: قرار ملاقات برای چهارشنبه. کلمات پرکننده مثل «اِ» و «ام» هم بهطور خودکار حذف میشوند تا متن نهایی روان و قابلاستناد باشد. برای آشنایی بیشتر با کاربرد عملی چنین ابزارهایی در کارهای روزمره، میتوانید سری آموزشهای چتجیپیتی را هم دنبال کنید.
۲. چرا این مدل با نسخههای قبلی گوگل فرق دارد؟
نسل قبلی موتور رونویسی گوگل با نام Chirp 3 شناخته میشد؛ مدلی که عملکرد قابل قبولی داشت اما در مواجهه با اصطلاحات تخصصی، لهجههای ناآشنا و مکالمات پرنویز، محدودیتهای زیادی نشان میداد. جمینای ۳.۵ ترنسکرایب روی همان پایه ساخته شده، اما گوگل مدعی است بهبود چشمگیری در سرعت و دقت داشته است.
یکی از اعداد جالبی که در معرفی این مدل منتشر شده، کاهش ۷۰ درصدی «زمان رسیدن به رونویسی نهایی» است. یعنی مدل نهتنها دقیقتر شده، بلکه خروجی را هم سریعتر از قبل تحویل میدهد. این مدل همچنین میتواند واژگان اختصاصی و اصطلاحات تخصصی یک سازمان را یاد بگیرد و در رونویسیهای بعدی از همان واژگان استفاده کند؛ ویژگیای که برای شرکتهای حقوقی، پزشکی و فنی بسیار کاربردی است.
۳. تشخیص احساس و شناسایی گوینده؛ ویژگی که رقبا هنوز ندارند
نکتهای که این مدل را از اغلب رقبا متمایز میکند، توانایی تشخیص احساس گوینده است. اکثر ابزارهای رونویسی فقط روی دقت کلمهبهکلمه تمرکز دارند، اما جمینای ۳.۵ ترنسکرایب میتواند در یک تماس یا جلسه، لحظهی دقیقی را که مشتری عصبانی یا ناراضی شده مشخص کند. برای یک مرکز تماس یا تیم پشتیبانی، این یعنی بهجای خواندن صفحهها متن، فقط کافی است به همان لحظهی مشخصشده مراجعه کنند.
در کنار این، مدل قابلیت شناسایی چند گوینده را هم دارد؛ در حالت استاندارد تا سه نفر و بهصورت آزمایشی حتی بیشتر از آن را از هم تشخیص میدهد و برای هرکدام برچسب زمانی دقیق (به فرمت دقیقه:ثانیه) ثبت میکند. این قابلیت، ساخت خلاصهی جلسات کاری چندنفره را بهشکل قابل توجهی سادهتر میکند. اگر میخواهید بدانید چنین ابزارهایی چطور میتوانند در کسبوکار واقعی اثرگذار باشند، مقالهی اهمیت هوش مصنوعی برای کسبوکار در سال ۲۰۲۵ را از دست ندهید.

۴. اعداد و دقت: پشت پردهی عملکرد مدل
گوگل چند رقم مشخص برای دقت این مدل منتشر کرده است. نرخ خطای کلمهای (WER) در حالت جریانی به ۴.۰ درصد و در حالت غیرجریانی به ۲.۶ درصد رسیده؛ یعنی از هر صد کلمه، تنها دو تا چهار کلمه احتمال اشتباه دارند. در آزمون چندزبانهی FLEURS نیز نرخ خطا بهترتیب ۵.۵۰ و ۵.۰۴ درصد گزارش شده که برای مدلی با پشتیبانی از بیش از ۸۵ زبان، عدد قابل توجهی است.
از نظر ظرفیت پردازش، این مدل با یک پنجرهی زمینهی ۹۶ هزار توکنی کار میکند که تقریباً معادل یک ساعت صدای پیوسته است؛ یعنی یک جلسهی کاری استاندارد را میتوان بدون تکهتکهکردن فایل صوتی، یکجا پردازش کرد. فرمتهای رایج صوتی مثل MP3 هم از طریق Gemini API، گوگل ایآی استودیو و اپلیکیشن مک قابل آپلود هستند.
۵. کجا همین حالا میتوان از این مدل استفاده کرد؟
گوگل این مدل را بهتدریج در محصولات مختلف خودش فعال کرده است. در کیبورد Gboard اندروید، قابلیت Rambler از همین موتور استفاده میکند. در اپلیکیشن جمینای برای مک، ویژگی تازهای با نام «صحبت با پنجره» امکان دیکتهی مستقیم متن در هر برنامهای را فراهم کرده است. جعبهی پرامپت Google Antigravity هم از همین مدل برای ورودی صوتی بهره میبرد.
ورود این مدل به مرورگر کروم برای تایپ صوتی در فیلدهای وب هم اعلام شده و بهزودی در دسترس قرار میگیرد. با این روند، احتمالاً بخش زیادی از کاربران روزمرهی گوگل، بدون اینکه حتی متوجه شوند، از این مدل استفاده خواهند کرد.
۶. دسترسی برای توسعهدهندگان و سازمانها
برای توسعهدهندگانی که میخواهند این قابلیت را در محصول خودشان بگنجانند، گوگل دسترسی پیشنمایش عمومی از طریق Gemini API در Google AI Studio و Google Antigravity فراهم کرده است. اگر تازه با نوشتن دستور برای مدلهای هوش مصنوعی آشنا میشوید، راهنمای نوشتن پرامپت برای مبتدیها نقطهی خوبی برای شروع است.
در سطح سازمانی هم، این مدل از طریق پلتفرم Gemini Enterprise Agent در دسترس شرکتهاست و بهزودی وارد Gemini Enterprise for Customer Experience هم خواهد شد؛ یعنی مراکز تماس و تیمهای پشتیبانی مشتری میتوانند مستقیماً از آن در جریان کاری خودشان استفاده کنند. گوگل هنوز جزییات قیمتگذاری این سرویس را اعلام نکرده است.
تفاوت با نسخهی بلادرنگ
نکتهی مهمی که کاربران فنی باید بدانند این است که Gemini 3.5 Transcribe برای رونویسی فایلهای آپلودشده و کاربردهای غیرزمانواقعی طراحی شده، نه پخش زنده. برای رونویسی بلادرنگ (مثل زیرنویس زنده)، گوگل همچنان کاربران را به Cloud Speech-to-Text API و Live API ارجاع میدهد؛ یعنی این دو مسیر از نظر معماری از هم جدا نگه داشته شدهاند تا تأخیر پردازش برای کاربردهای حساس به زمان کمینه بماند.

۷. مقایسه با ویسپر اوپنایآی و رقبای دیگر
تا پیش از این، Whisper اوپنایآی یکی از شناختهشدهترین گزینهها برای رونویسی صدا به متن بود. تفاوت اصلی جمینای ۳.۵ ترنسکرایب اینجاست که علاوه بر رونویسی خام، ترجمه، خلاصهسازی و حتی فراخوانی سایر مدلهای جمینای (مثل تولید تصویر یا تحلیل فایل) را هم در یک بستهی واحد ارائه میدهد. به بیان دیگر، قابلیتهایی که پیشتر نیازمند چند ابزار تخصصی جداگانه بودند، حالا در یک API عمومی جمع شدهاند. برای درک بهتر اینکه شرکت اوپنایآی چطور کار خودش را شروع کرد و چه جایگاهی در این رقابت دارد، مقالهی اوپنایآی چیست را بخوانید.
رقابت میان غولهای هوش مصنوعی محدود به رونویسی صدا نیست؛ در حوزههای دیگر مثل استدلال و بازی هم این رقابت ادامه دارد. نمونهاش را میتوانید در مقایسهی چتجیپیتی در برابر دیپسیک ببینید. آنچه مشخص است اینکه هرکدام از این شرکتها روی یک نقطهی قوت متفاوت سرمایهگذاری میکنند و کاربر نهایی از این رقابت سود میبرد.
۸. این تغییر چه معنایی برای کسبوکارها و تولیدکنندگان محتوا دارد؟
برای پادکسترها، خبرنگاران، تیمهای فروش و مدیران پروژه، ابزار رونویسی دقیق یعنی صرفهجویی واقعی در زمان. دیگر نیازی نیست کسی ساعتها بنشیند و مصاحبه یا جلسه را از روی فایل صوتی تایپ کند. با این حال، مثل هر فناوری جدید دیگری، باید انتظارات را واقعبینانه نگه داشت؛ این مدل قدرتمند است، اما جایگزین کامل قضاوت انسانی در موقعیتهای حساس نیست. برای نگاهی صادقانه به تواناییها و محدودیتهای واقعی هوش مصنوعی، مقالهی پتانسیل و محدودیتهای واقعی هوش مصنوعی را پیشنهاد میکنیم.
نکتهی دیگر اینکه وجود چنین ابزارهایی بهمعنای بینیازی از مهارت انسانی نیست. کسی که بداند چطور از خروجی این ابزارها استفاده کند و آن را ویرایش و راستیآزمایی کند، همچنان یک قدم جلوتر خواهد بود. برای تفاوت میان استفادهی سطحی و استفادهی حرفهای از این ابزارها، مقالهی توهم هوش مصنوعی؛ توسعهدهندهی تنها در برابر مهندس واقعی خواندنی است.
در نهایت، آنچه این مدل را برای مخاطب عمومی جذاب میکند، سادگی استفاده از آن است. کاربر نیازی به دانش فنی ندارد؛ کافی است فایل صوتی را در یکی از محصولات گوگل بارگذاری کند تا متن نهایی آماده شود. همین سادگی است که باعث میشود چنین فناوریهایی خیلی سریعتر از حد انتظار وارد زندگی روزمرهی میلیونها کاربر شوند، درست همانطور که چتباتهای مکالمهای طی دو سه سال گذشته این اتفاق را تجربه کردند.
سوالات متداول دربارهی جمینای ۳.۵ ترنسکرایب
آیا جمینای ۳.۵ ترنسکرایب رایگان است؟
گوگل تا امروز جزییات قیمتگذاری این سرویس را اعلام نکرده است. دسترسی توسعهدهندگان از طریق Gemini API فعلاً در مرحلهی پیشنمایش عمومی است.
این مدل چند زبان را پشتیبانی میکند؟
بیش از ۸۵ زبان، همراه با توانایی تشخیص لهجههای منطقهای مختلف در همان زبان.
آیا برای رونویسی زنده و بلادرنگ هم مناسب است؟
خیر؛ برای کاربردهای بلادرنگ، گوگل کاربران را به سرویسهای جداگانهی Cloud Speech-to-Text و Live API ارجاع میدهد.
چه تعداد گوینده را میتواند از هم تشخیص دهد؟
در حالت استاندارد تا سه گوینده، و بهصورت آزمایشی تعداد بیشتری هم پشتیبانی میشود.
آیا این مدل جایگزین Whisper اوپنایآی میشود؟
هنوز زود است برای قضاوت قطعی، اما از نظر مجموعهقابلیتها (رونویسی، ترجمه، خلاصهسازی و تشخیص احساس در یک بسته)، رقیب جدیای بهحساب میآید.