جمینای ۳.۵ ترنسکرایب؛ دقیق‌ترین مدل گفتار‌به‌متن گوگل

اخبار · هوش مصنوعی

رونویسی صوتی سال‌ها ابزار کارِ خبرنگارها و پزشک‌ها بود؛ حالا دارد به یک لایه‌ی پیش‌فرض در همه‌ی دستگاه‌ها تبدیل می‌شود. شرکت گوگل تازه‌ترین مدل گفتار‌به‌متن خود را با نام جمینای ۳.۵ ترنسکرایب معرفی کرده و آن را دقیق‌ترین سامانه‌ی رونویسی تاریخ این شرکت خوانده است. این مدل بیش از ۸۵ زبان را خودکار تشخیص می‌دهد، وسط جمله زبان عوض می‌کند و مکث‌ها و «اِمم» گفتن‌ها را خودش پاک می‌کند. پرسش این است که این پرش کیفی، در عمل چه چیزی را تغییر می‌دهد.

چکیده. مدل تازه‌ی گوگل بیش از ۸۵ زبان را پشتیبانی می‌کند و به‌طور خودکار زبان گوینده را تشخیص می‌دهد. نرخ خطای واژه در حالت زنده حدود ۴ درصد و در حالت غیرزنده حدود ۲٫۶ درصد گزارش شده و زمان رسیدن به متن نهایی نسبت به نسل پیشین تا ۷۰ درصد کوتاه‌تر شده است. مدل، خودتصحیح‌های گوینده و کلمات پرکننده را حذف و متن را قالب‌بندی می‌کند و تا سه گوینده را از هم تشخیص می‌دهد. این فناوری هم‌اکنون در چند محصول گوگل فعال است و به‌زودی به مرورگر کروم هم می‌رسد.
معرفی مدل گفتار به متن جمینای ۳.۵ ترنسکرایب با پشتیبانی از بیش از ۸۵ زبان

۱) چه چیزی معرفی شد

مدل تازه در دو نسخه عرضه شده است: یک نسخه برای رونویسی زنده و بی‌درنگ، و یک نسخه برای فایل‌های صوتی از پیش ضبط‌شده. این تفکیک منطقی است، چون نیازهای این دو حالت با هم فرق دارد؛ در حالت زنده تأخیر کم مهم‌تر است و در حالت غیرزنده، دقت نهایی.

گوگل این مدل را دقیق‌ترین سامانه‌ی رونویسی صوتی خود توصیف کرده است. ادعایی از این جنس را باید با احتیاط خواند، اما ارقام منتشرشده دست‌کم نشان می‌دهد فاصله‌ی معناداری با نسل پیشین ایجاد شده است.

۲) دقت و سرعت؛ خواندن درست اعداد

نرخ خطای واژه، معیار استاندارد سنجش کیفیت رونویسی است: هرچه کمتر، بهتر. برای این مدل، نرخ خطا در حالت زنده حدود ۴ درصد و در حالت غیرزنده حدود ۲٫۶ درصد اعلام شده است. در سنجه‌ی چندزبانه‌ی مستقل‌تر، این ارقام به ترتیب حدود ۵٫۵ و ۵ درصد گزارش شده‌اند.

تفاوت این دو دسته عدد، نکته‌ی مهمی را نشان می‌دهد: کیفیت رونویسی به‌شدت به زبان، لهجه و کیفیت صدا وابسته است. عددی که روی صوت تمیز انگلیسی به دست می‌آید، لزوماً روی یک جلسه‌ی پرهمهمه‌ی فارسی تکرار نمی‌شود.

در کنار دقت، سرعت هم تغییر کرده است. گوگل می‌گوید زمان رسیدن به متن نهایی نسبت به مدل پیشین خود تا ۷۰ درصد کاهش یافته است؛ همان عاملی که تجربه‌ی زیرنویس زنده را از حالت آزاردهنده به حالت طبیعی می‌برد.

۳) پشتیبانی از بیش از ۸۵ زبان و جابه‌جایی وسط جمله

مدل بیش از ۸۵ زبان را به‌صورت خودکار تشخیص می‌دهد و نیازی نیست کاربر از پیش زبان را انتخاب کند. مهم‌تر از تعداد زبان، توانایی جابه‌جایی میان زبان‌ها در میانه‌ی یک مکالمه است.

این ویژگی برای فارسی‌زبان‌ها اهمیت ویژه‌ای دارد. گفتار روزمره‌ی بسیاری از کاربران ترکیبی از فارسی و اصطلاحات انگلیسی است و مدل‌های نسل قبل معمولاً در همین نقطه رشته‌ی کلام را گم می‌کردند و کلمه‌ی انگلیسی را با تلفظ فارسی و غلط ثبت می‌کردند.

نرخ خطای واژه و بهبود سرعت مدل گفتار به متن تازه‌ی گوگل

۴) حذف مکث و کلمات پرکننده؛ ویرایشگر پنهان

یکی از تفاوت‌های کلیدی این مدل با رونویس‌گرهای سنتی، این است که خروجی را ویرایش هم می‌کند. کلمات پرکننده مثل «اِمم» و «خب» حذف می‌شوند، تکرارها پاک می‌شوند و حتی خودتصحیح گوینده هم اعمال می‌شود؛ اگر کسی بگوید سه‌شنبه، نه چهارشنبه، خروجی نهایی چهارشنبه خواهد بود.

این رفتار مزیت بزرگی است اما یک هشدار هم دارد. در کاربردهایی که متن باید عیناً بازتاب گفتار باشد، مثل مستندسازی حقوقی یا پژوهش زبان‌شناسی، حذف خودکار می‌تواند مشکل‌ساز باشد. ابزار هوشمند در اینجا تصمیم می‌گیرد چه چیزی مهم است و چه چیزی نیست.

مدل همچنین متن را قالب‌بندی می‌کند، واژگان سفارشی را می‌شناسد و برچسب زمانی در سطح واژه می‌دهد؛ قابلیتی که برای ساخت زیرنویس دقیق ضروری است.

۵) تشخیص گوینده؛ تا سه نفر

مدل می‌تواند گفتار افراد مختلف را از هم تفکیک کند و تا سه گوینده را به‌طور رسمی پشتیبانی می‌کند؛ پشتیبانی از تعداد بیشتر فعلاً آزمایشی است. برای جلسه‌های دونفره و مصاحبه‌ها این کافی است، اما برای جلسه‌های پرجمعیت هنوز محدودیت جدی به شمار می‌آید.

تشخیص گوینده از نظر فنی سخت‌تر از رونویسی است، چون به تحلیل ویژگی‌های صوتی و نه صرفاً واژگان نیاز دارد. همپوشانی صدای دو نفر که هم‌زمان حرف می‌زنند، همچنان نقطه‌ی ضعف مشترک تقریباً همه‌ی سامانه‌های امروزی است.

۶) کجا می‌توان از آن استفاده کرد

این فناوری هم‌اکنون در چند محصول فعال شده است: ابزار املای صوتی صفحه‌کلید گوگل روی اندروید در کشورها و زبان‌های منتخب، اپلیکیشن جمینای روی مک، و محیط توسعه‌ی انتی‌گرویتی. گوگل اعلام کرده مرورگر کروم هم به‌زودی به این فهرست اضافه می‌شود.

برای توسعه‌دهندگان، مدل از طریق رابط برنامه‌نویسی جمینای در دسترس است؛ یک مسیر برای جریان زنده و یک مسیر برای فایل‌های ضبط‌شده. برای سازمان‌ها هم نسخه‌ای در پلتفرم سازمانی گوگل در حالت پیش‌نمایش عمومی ارائه شده است.

محصولاتی که مدل گفتار به متن تازه‌ی گوگل در آن‌ها فعال شده است

۷) رقابت در بازار رونویسی صوتی

بازار گفتار‌به‌متن در دو سال گذشته به یکی از فشرده‌ترین میدان‌های رقابت تبدیل شده است. مدل‌های متن‌باز، سرویس‌های ابری اختصاصی و ابزارهای رونویسی جلسات، همگی سراغ همان کاربران رفته‌اند و تفاوت کیفیت میانشان کم شده است.

در چنین بازاری، مزیت رقابتی از دقت خام به سمت یکپارچگی جابه‌جا می‌شود. گوگل مزیتی دارد که رقبا ندارند: صفحه‌کلید، مرورگر و سیستم‌عامل موبایل. وقتی رونویسی به‌جای یک اپلیکیشن جداگانه، بخشی از صفحه‌کلید باشد، رقابت دیگر بر سر کیفیت مدل نیست. الگوی مشابهی را در رقابت‌های پیشین این حوزه، از جمله آنچه در نبرد چت‌جی‌پی‌تی و دیپ‌سیک بررسی کرده‌ایم، هم دیده‌ایم.

نکته‌ی مهم دیگر برای کسب‌وکارها، هزینه است. رونویسی خودکار جلسات، پشتیبانی تلفنی و محتوای ویدیویی تا همین چند سال پیش یا گران بود یا نیازمند بازبینی انسانی سنگین. با رسیدن نرخ خطا به این محدوده، بخش زیادی از آن بازبینی حذف می‌شود و همان صرفه‌جویی است که در اهمیت هوش مصنوعی در کسب‌وکار به‌عنوان یکی از ملموس‌ترین بازدهی‌های هوش مصنوعی در سازمان‌ها بررسی شده است.

۸) این خبر برای کاربر فارسی‌زبان چه معنایی دارد

خبر خوب این است که فارسی معمولاً در فهرست زبان‌های پشتیبانی‌شده‌ی مدل‌های بزرگ گوگل قرار دارد و پشتیبانی از جابه‌جایی زبان، دقیقاً به الگوی گفتار روزمره‌ی کاربران فارسی نزدیک است.

خبر محتاطانه‌تر این است که در دسترس بودن یک قابلیت، به منطقه و زبان بستگی دارد و برخی از این محصولات در همه‌ی کشورها فعال نیستند. تا زمان انتشار گسترده‌تر، بهترین کار آزمودن روی نمونه‌ی صوتی واقعی خودتان است، نه اتکا به عددهای اعلام‌شده.

کاربردهای عملی این فناوری کم نیست: رونویسی جلسات کاری، ساخت زیرنویس ویدیو، یادداشت‌برداری صوتی و تبدیل گفتار به متن برای ورودی مدل‌های زبانی. اگر خروجی رونویسی را به‌عنوان ورودی یک مدل زبانی به کار می‌برید، مرور راهنمای ساده‌ی پرامپت‌نویسی کمک می‌کند نتیجه‌ی به‌مراتب دقیق‌تری بگیرید. آموزش‌های عملی مرتبط را هم می‌توانید در آموزش‌های چت‌جی‌پی‌تی دنبال کنید.

در نهایت یک ملاحظه‌ی عملی هم هست: کیفیت میکروفون و محیط ضبط، هنوز تعیین‌کننده‌تر از انتخاب مدل است. یک ضبط تمیز با میکروفون معمولی، نتیجه‌ی بهتری از ضبط پرهمهمه با بهترین مدل می‌دهد. پیش از آن‌که سراغ مقایسه‌ی سرویس‌ها بروید، ارزش دارد چند دقیقه روی شرایط ضبط وقت بگذارید؛ بازدهی این کار معمولاً از هر تغییر نرم‌افزاری بیشتر است.

۹) چرا رونویسی بهتر، به معنای هوش مصنوعی بهتر است

ارزش این خبر فقط در راحتی یادداشت‌برداری خلاصه نمی‌شود. گفتار، طبیعی‌ترین رابط انسان با ماشین است و هر بهبودی در تبدیل آن به متن، مستقیماً به کیفیت دستیارهای صوتی می‌رسد. اگر مدل زبانی ورودی غلط دریافت کند، خروجی درست هم تولید نمی‌کند؛ خطای رونویسی در ابتدای زنجیره، تا انتها ضرب می‌شود.

از این زاویه، مدل‌های رونویسی نقش دروازه‌بان را دارند. کاهش نرخ خطا از هشت درصد به چهار درصد، در ظاهر یک عدد کوچک است، اما در یک مکالمه‌ی هزار کلمه‌ای یعنی چهل خطای کمتر که هرکدام می‌توانست مسیر پاسخ دستیار را عوض کند. همین تفاوت، بخشی از محدودیت‌های عملی است که در توان و محدودیت‌های واقعی هوش مصنوعی هم به آن اشاره کرده‌ایم.

نکته‌ی سوم به حریم خصوصی برمی‌گردد. هرچه رونویسی روی خود دستگاه ممکن‌تر شود، صدای کاربر کمتر به سرور فرستاده می‌شود. بخشی از این مدل‌ها هنوز ابری‌اند، اما جهت حرکت صنعت به سمت پردازش محلی است.

پرسش‌های پرتکرار درباره‌ی مدل گفتار‌به‌متن تازه‌ی گوگل

این مدل از چند زبان پشتیبانی می‌کند؟

بیش از ۸۵ زبان، با تشخیص خودکار زبان و امکان جابه‌جایی میان زبان‌ها در میانه‌ی مکالمه.

نرخ خطای آن چقدر است؟

حدود ۴ درصد در حالت زنده و حدود ۲٫۶ درصد در حالت غیرزنده گزارش شده است. در سنجه‌های چندزبانه‌ی مستقل‌تر، این ارقام کمی بالاتر است.

آیا کلمات پرکننده را حذف می‌کند؟

بله. مدل کلمات پرکننده، تکرارها و خودتصحیح‌های گوینده را حذف می‌کند و متن را قالب‌بندی می‌کند. برای کاربردهایی که به متن عیناً نیاز دارند، این رفتار باید در نظر گرفته شود.

چند گوینده را از هم تشخیص می‌دهد؟

تا سه گوینده به‌طور رسمی پشتیبانی می‌شوند و پشتیبانی از تعداد بیشتر فعلاً در مرحله‌ی آزمایشی است.

از کجا می‌توان به آن دسترسی داشت؟

از طریق ابزار املای صوتی صفحه‌کلید گوگل روی اندروید، اپلیکیشن جمینای روی مک، محیط انتی‌گرویتی و رابط برنامه‌نویسی جمینای؛ پشتیبانی از مرورگر کروم هم اعلام شده است.

جمع‌بندی. رونویسی صوتی به نقطه‌ای رسیده که دیگر مسئله‌ی اصلی، درست شنیدن کلمات نیست؛ مسئله این است که خروجی چقدر بی‌واسطه قابل استفاده باشد. مدل تازه‌ی گوگل دقیقاً روی همین نقطه کار کرده است. تازه‌ترین خبرهای این حوزه را در بخش اخبار بخوانید و برای دریافت سریع‌تر آن‌ها به @MrChatGPT_IR بپیوندید.
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *