رونویسی صوتی سالها ابزار کارِ خبرنگارها و پزشکها بود؛ حالا دارد به یک لایهی پیشفرض در همهی دستگاهها تبدیل میشود. شرکت گوگل تازهترین مدل گفتاربهمتن خود را با نام جمینای ۳.۵ ترنسکرایب معرفی کرده و آن را دقیقترین سامانهی رونویسی تاریخ این شرکت خوانده است. این مدل بیش از ۸۵ زبان را خودکار تشخیص میدهد، وسط جمله زبان عوض میکند و مکثها و «اِمم» گفتنها را خودش پاک میکند. پرسش این است که این پرش کیفی، در عمل چه چیزی را تغییر میدهد.

لیست مطالب
۱) چه چیزی معرفی شد
مدل تازه در دو نسخه عرضه شده است: یک نسخه برای رونویسی زنده و بیدرنگ، و یک نسخه برای فایلهای صوتی از پیش ضبطشده. این تفکیک منطقی است، چون نیازهای این دو حالت با هم فرق دارد؛ در حالت زنده تأخیر کم مهمتر است و در حالت غیرزنده، دقت نهایی.
گوگل این مدل را دقیقترین سامانهی رونویسی صوتی خود توصیف کرده است. ادعایی از این جنس را باید با احتیاط خواند، اما ارقام منتشرشده دستکم نشان میدهد فاصلهی معناداری با نسل پیشین ایجاد شده است.
۲) دقت و سرعت؛ خواندن درست اعداد
نرخ خطای واژه، معیار استاندارد سنجش کیفیت رونویسی است: هرچه کمتر، بهتر. برای این مدل، نرخ خطا در حالت زنده حدود ۴ درصد و در حالت غیرزنده حدود ۲٫۶ درصد اعلام شده است. در سنجهی چندزبانهی مستقلتر، این ارقام به ترتیب حدود ۵٫۵ و ۵ درصد گزارش شدهاند.
تفاوت این دو دسته عدد، نکتهی مهمی را نشان میدهد: کیفیت رونویسی بهشدت به زبان، لهجه و کیفیت صدا وابسته است. عددی که روی صوت تمیز انگلیسی به دست میآید، لزوماً روی یک جلسهی پرهمهمهی فارسی تکرار نمیشود.
در کنار دقت، سرعت هم تغییر کرده است. گوگل میگوید زمان رسیدن به متن نهایی نسبت به مدل پیشین خود تا ۷۰ درصد کاهش یافته است؛ همان عاملی که تجربهی زیرنویس زنده را از حالت آزاردهنده به حالت طبیعی میبرد.
۳) پشتیبانی از بیش از ۸۵ زبان و جابهجایی وسط جمله
مدل بیش از ۸۵ زبان را بهصورت خودکار تشخیص میدهد و نیازی نیست کاربر از پیش زبان را انتخاب کند. مهمتر از تعداد زبان، توانایی جابهجایی میان زبانها در میانهی یک مکالمه است.
این ویژگی برای فارسیزبانها اهمیت ویژهای دارد. گفتار روزمرهی بسیاری از کاربران ترکیبی از فارسی و اصطلاحات انگلیسی است و مدلهای نسل قبل معمولاً در همین نقطه رشتهی کلام را گم میکردند و کلمهی انگلیسی را با تلفظ فارسی و غلط ثبت میکردند.

۴) حذف مکث و کلمات پرکننده؛ ویرایشگر پنهان
یکی از تفاوتهای کلیدی این مدل با رونویسگرهای سنتی، این است که خروجی را ویرایش هم میکند. کلمات پرکننده مثل «اِمم» و «خب» حذف میشوند، تکرارها پاک میشوند و حتی خودتصحیح گوینده هم اعمال میشود؛ اگر کسی بگوید سهشنبه، نه چهارشنبه، خروجی نهایی چهارشنبه خواهد بود.
این رفتار مزیت بزرگی است اما یک هشدار هم دارد. در کاربردهایی که متن باید عیناً بازتاب گفتار باشد، مثل مستندسازی حقوقی یا پژوهش زبانشناسی، حذف خودکار میتواند مشکلساز باشد. ابزار هوشمند در اینجا تصمیم میگیرد چه چیزی مهم است و چه چیزی نیست.
مدل همچنین متن را قالببندی میکند، واژگان سفارشی را میشناسد و برچسب زمانی در سطح واژه میدهد؛ قابلیتی که برای ساخت زیرنویس دقیق ضروری است.
۵) تشخیص گوینده؛ تا سه نفر
مدل میتواند گفتار افراد مختلف را از هم تفکیک کند و تا سه گوینده را بهطور رسمی پشتیبانی میکند؛ پشتیبانی از تعداد بیشتر فعلاً آزمایشی است. برای جلسههای دونفره و مصاحبهها این کافی است، اما برای جلسههای پرجمعیت هنوز محدودیت جدی به شمار میآید.
تشخیص گوینده از نظر فنی سختتر از رونویسی است، چون به تحلیل ویژگیهای صوتی و نه صرفاً واژگان نیاز دارد. همپوشانی صدای دو نفر که همزمان حرف میزنند، همچنان نقطهی ضعف مشترک تقریباً همهی سامانههای امروزی است.
۶) کجا میتوان از آن استفاده کرد
این فناوری هماکنون در چند محصول فعال شده است: ابزار املای صوتی صفحهکلید گوگل روی اندروید در کشورها و زبانهای منتخب، اپلیکیشن جمینای روی مک، و محیط توسعهی انتیگرویتی. گوگل اعلام کرده مرورگر کروم هم بهزودی به این فهرست اضافه میشود.
برای توسعهدهندگان، مدل از طریق رابط برنامهنویسی جمینای در دسترس است؛ یک مسیر برای جریان زنده و یک مسیر برای فایلهای ضبطشده. برای سازمانها هم نسخهای در پلتفرم سازمانی گوگل در حالت پیشنمایش عمومی ارائه شده است.

۷) رقابت در بازار رونویسی صوتی
بازار گفتاربهمتن در دو سال گذشته به یکی از فشردهترین میدانهای رقابت تبدیل شده است. مدلهای متنباز، سرویسهای ابری اختصاصی و ابزارهای رونویسی جلسات، همگی سراغ همان کاربران رفتهاند و تفاوت کیفیت میانشان کم شده است.
در چنین بازاری، مزیت رقابتی از دقت خام به سمت یکپارچگی جابهجا میشود. گوگل مزیتی دارد که رقبا ندارند: صفحهکلید، مرورگر و سیستمعامل موبایل. وقتی رونویسی بهجای یک اپلیکیشن جداگانه، بخشی از صفحهکلید باشد، رقابت دیگر بر سر کیفیت مدل نیست. الگوی مشابهی را در رقابتهای پیشین این حوزه، از جمله آنچه در نبرد چتجیپیتی و دیپسیک بررسی کردهایم، هم دیدهایم.
نکتهی مهم دیگر برای کسبوکارها، هزینه است. رونویسی خودکار جلسات، پشتیبانی تلفنی و محتوای ویدیویی تا همین چند سال پیش یا گران بود یا نیازمند بازبینی انسانی سنگین. با رسیدن نرخ خطا به این محدوده، بخش زیادی از آن بازبینی حذف میشود و همان صرفهجویی است که در اهمیت هوش مصنوعی در کسبوکار بهعنوان یکی از ملموسترین بازدهیهای هوش مصنوعی در سازمانها بررسی شده است.
۸) این خبر برای کاربر فارسیزبان چه معنایی دارد
خبر خوب این است که فارسی معمولاً در فهرست زبانهای پشتیبانیشدهی مدلهای بزرگ گوگل قرار دارد و پشتیبانی از جابهجایی زبان، دقیقاً به الگوی گفتار روزمرهی کاربران فارسی نزدیک است.
خبر محتاطانهتر این است که در دسترس بودن یک قابلیت، به منطقه و زبان بستگی دارد و برخی از این محصولات در همهی کشورها فعال نیستند. تا زمان انتشار گستردهتر، بهترین کار آزمودن روی نمونهی صوتی واقعی خودتان است، نه اتکا به عددهای اعلامشده.
کاربردهای عملی این فناوری کم نیست: رونویسی جلسات کاری، ساخت زیرنویس ویدیو، یادداشتبرداری صوتی و تبدیل گفتار به متن برای ورودی مدلهای زبانی. اگر خروجی رونویسی را بهعنوان ورودی یک مدل زبانی به کار میبرید، مرور راهنمای سادهی پرامپتنویسی کمک میکند نتیجهی بهمراتب دقیقتری بگیرید. آموزشهای عملی مرتبط را هم میتوانید در آموزشهای چتجیپیتی دنبال کنید.
در نهایت یک ملاحظهی عملی هم هست: کیفیت میکروفون و محیط ضبط، هنوز تعیینکنندهتر از انتخاب مدل است. یک ضبط تمیز با میکروفون معمولی، نتیجهی بهتری از ضبط پرهمهمه با بهترین مدل میدهد. پیش از آنکه سراغ مقایسهی سرویسها بروید، ارزش دارد چند دقیقه روی شرایط ضبط وقت بگذارید؛ بازدهی این کار معمولاً از هر تغییر نرمافزاری بیشتر است.
۹) چرا رونویسی بهتر، به معنای هوش مصنوعی بهتر است
ارزش این خبر فقط در راحتی یادداشتبرداری خلاصه نمیشود. گفتار، طبیعیترین رابط انسان با ماشین است و هر بهبودی در تبدیل آن به متن، مستقیماً به کیفیت دستیارهای صوتی میرسد. اگر مدل زبانی ورودی غلط دریافت کند، خروجی درست هم تولید نمیکند؛ خطای رونویسی در ابتدای زنجیره، تا انتها ضرب میشود.
از این زاویه، مدلهای رونویسی نقش دروازهبان را دارند. کاهش نرخ خطا از هشت درصد به چهار درصد، در ظاهر یک عدد کوچک است، اما در یک مکالمهی هزار کلمهای یعنی چهل خطای کمتر که هرکدام میتوانست مسیر پاسخ دستیار را عوض کند. همین تفاوت، بخشی از محدودیتهای عملی است که در توان و محدودیتهای واقعی هوش مصنوعی هم به آن اشاره کردهایم.
نکتهی سوم به حریم خصوصی برمیگردد. هرچه رونویسی روی خود دستگاه ممکنتر شود، صدای کاربر کمتر به سرور فرستاده میشود. بخشی از این مدلها هنوز ابریاند، اما جهت حرکت صنعت به سمت پردازش محلی است.
پرسشهای پرتکرار دربارهی مدل گفتاربهمتن تازهی گوگل
این مدل از چند زبان پشتیبانی میکند؟
بیش از ۸۵ زبان، با تشخیص خودکار زبان و امکان جابهجایی میان زبانها در میانهی مکالمه.
نرخ خطای آن چقدر است؟
حدود ۴ درصد در حالت زنده و حدود ۲٫۶ درصد در حالت غیرزنده گزارش شده است. در سنجههای چندزبانهی مستقلتر، این ارقام کمی بالاتر است.
آیا کلمات پرکننده را حذف میکند؟
بله. مدل کلمات پرکننده، تکرارها و خودتصحیحهای گوینده را حذف میکند و متن را قالببندی میکند. برای کاربردهایی که به متن عیناً نیاز دارند، این رفتار باید در نظر گرفته شود.
چند گوینده را از هم تشخیص میدهد؟
تا سه گوینده بهطور رسمی پشتیبانی میشوند و پشتیبانی از تعداد بیشتر فعلاً در مرحلهی آزمایشی است.
از کجا میتوان به آن دسترسی داشت؟
از طریق ابزار املای صوتی صفحهکلید گوگل روی اندروید، اپلیکیشن جمینای روی مک، محیط انتیگرویتی و رابط برنامهنویسی جمینای؛ پشتیبانی از مرورگر کروم هم اعلام شده است.