Notice: Function _load_textdomain_just_in_time was called incorrectly. Translation loading for the woosidebars domain was triggered too early. This is usually an indicator for some code in the plugin or theme running too early. Translations should be loaded at the init action or later. Please see Debugging in WordPress for more information. (This message was added in version 6.7.0.) in /var/www/html/wp-includes/functions.php on line 6260 متا Muse Voice Transcribe؛ رونویسی صوتی زنده معرفی شد
معرفی مدل Muse Voice Transcribe متا برای رونویسی صوتی زنده و بلادرنگ

متا از Muse Voice Transcribe رونمایی کرد؛ رونویسی صوتی زنده با خطای ۳٫۱ درصد

اخبار · هوش مصنوعی

متا از مدل Muse Voice Transcribe رونمایی کرد؛ اولین مدل ادراک صوتی بلادرنگ این شرکت که رونویسی، تشخیص گوینده و مرزبندی جمله را در یک قدم و بدون تأخیر انجام می‌دهد.

چکیده. آزمایشگاه‌های سوپرینتلیجنس متا مدل تازه‌ای به نام Muse Voice Transcribe معرفی کرده‌اند که صدا را در قطعه‌های ۸۰ میلی‌ثانیه‌ای پردازش می‌کند، بیش از ۲۰ گوینده را در یک فایل تشخیص می‌دهد، روی بیش از ۷۰ زبان کار می‌کند و نرخ خطای رونویسی‌اش تنها ۳٫۱ درصد است. این مدل از همین حالا در اپلیکیشن Meta AI برای مک، محیط Muse Code و رابط برنامه‌نویسی Meta Model API در دسترس است.
معرفی مدل Muse Voice Transcribe متا برای رونویسی صوتی زنده و بلادرنگ

۱. چه اتفاقی افتاد؟

متا روز دوشنبه، ۱۰ شهریور ۱۴۰۵ (برابر با ۱ سپتامبر ۲۰۲۶)، از طریق وبلاگ پژوهشی خود مدل Muse Voice Transcribe را معرفی کرد. این مدل نخستین محصول ادراک صوتی بلادرنگ متا است و بخشی از خانوادهٔ مدل‌های Muse Spark محسوب می‌شود؛ همان خانواده‌ای که پیش‌تر با Muse Code برای برنامه‌نویسی و Muse Glimmer برای اجرای محلی روی گوشی معرفی شده بود. تفاوت اصلی این عضو تازه با اعضای قبلی خانواده، تمرکز کامل روی صداست: تبدیل گفتار به متن، شناسایی این‌که چه کسی در حال صحبت است و تشخیص این‌که یک جمله کجا تمام می‌شود، همه در یک مدل واحد و بدون هیچ مرحلهٔ پردازش جداگانه بعد از ضبط.

نکتهٔ مهم این عرضه، زمان‌بندی آن است. بازار ابزارهای رونویسی و زیرنویس‌سازی این روزها یکی از داغ‌ترین بخش‌های هوش مصنوعی کاربردی است؛ از تولیدکنندگان محتوا و پادکسترها گرفته تا تیم‌های حرفه‌ای که جلسات را مستندسازی می‌کنند. متا با این عرضه مستقیماً وارد رقابتی می‌شود که پیش از این بیشتر در اختیار ابزارهایی مانند Whisper از OpenAI و راهکارهای گوگل بود. اگر پیش‌تر دربارهٔ اوپن‌ای‌آی و مدل‌های آن خوانده باشید، می‌دانید رقابت میان شرکت‌های بزرگ هوش مصنوعی معمولاً روی چند جبههٔ هم‌زمان پیش می‌رود؛ صدا حالا یکی از تازه‌ترین این جبهه‌هاست.

۲. Muse Voice Transcribe دقیقاً چیست؟

در یک جمله: مدلی است که صدا را می‌شنود و هم‌زمان با شنیدن، متن تولید می‌کند. برخلاف بسیاری از ابزارهای رونویسی رایج که ابتدا کل فایل صوتی را ضبط می‌کنند و سپس آن را برای پردازش می‌فرستند، Muse Voice Transcribe از همان لحظهٔ شروع صحبت، متن را روی صفحه می‌آورد. این ویژگی برای کاربردهایی مثل زیرنویس زندهٔ استریم، دستیارهای صوتی و دیکتهٔ بلادرنگ حیاتی است، چون کاربر منتظر پایان ضبط نمی‌ماند.

معماری مدل به‌صورت خودبازگشتی (autoregressive) و چندوجهی طراحی شده؛ یعنی همان رویکردی که در مدل‌های زبانی متنی رایج است، اما این‌بار روی جریان صوتی پیاده شده. این طراحی به متا اجازه داده یک مدل واحد بسازد که هم رونویسی می‌کند، هم گوینده‌ها را از هم جدا می‌کند و هم می‌داند کِی یک جمله یا یک نوبت صحبت تمام شده — کاری که معمولاً به سه مدل یا سه مرحلهٔ پردازش جداگانه نیاز داشت.

۳. معماری فنی: چطور صدا را به متن تبدیل می‌کند؟

هستهٔ فنی مدل بر پایهٔ پردازش قطعه‌به‌قطعهٔ صداست. ورودی صوتی به بخش‌های ۸۰ میلی‌ثانیه‌ای تقسیم می‌شود و هر قطعه به‌صورت «توکن نرم» (soft token) به مدل داده می‌شود. در هر قطعه، مدل یکی از دو کار را انجام می‌دهد: یا یک توکن متنی تولید می‌کند، یا با یک توکن ویژه به نام next_audio اعلام می‌کند که همچنان در حال گوش دادن است و آماده نیست چیزی بنویسد. این تصمیم‌گیری قطعه‌به‌قطعه همان چیزی است که به مدل اجازه می‌دهد بدون تأخیر محسوس کار کند.

بخش جالب‌تر، «تأخیر تطبیقی» (adaptive delay) است. مدل با یادگیری تقویتی آموزش دیده که هم‌زمان دو پاداش را بهینه کند: دقت رونویسی و کوتاه بودن تأخیر. این دو پاداش به‌صورت ضربی ترکیب می‌شوند، نه جمعی؛ یعنی مدل نمی‌تواند با فدا کردن شدید دقت، فقط سرعت را بالا ببرد. نتیجه این شده که برای جملات ساده، مدل خیلی زود متن را می‌نویسد و برای بخش‌های پیچیده‌تر یا مبهم، کمی بیشتر صبر می‌کند تا مطمئن شود — دقیقاً همان کاری که یک انسان هنگام گوش دادن دقیق انجام می‌دهد.

۴. تشخیص گوینده و رونویسی هم‌زمان چند نفر

برای تشخیص گوینده، مدل از توکن‌های ویژه‌ای مثل start_of_turn برای علامت‌گذاری تغییر احتمالی گوینده و برچسب‌هایی مثل speaker_A تا speaker_Z برای متمایز کردن صداها استفاده می‌کند. این روش به مدل اجازه می‌دهد بیش از ۲۰ گوینده را در یک فایل صوتی طولانی‌تر از یک ساعت، بدون هیچ پردازش جداگانه یا مرحلهٔ پس‌پردازش، از هم تفکیک کند. برای مقایسه، بسیاری از ابزارهای رایج رونویسی نیاز به یک مدل جداگانهٔ «دیاریزیشن» دارند که بعد از رونویسی روی متن اجرا می‌شود؛ متا این دو مرحله را در یک مدل واحد ادغام کرده است.

تشخیص مرز جمله و نوبت صحبت هم با توکن‌های مشابهی مثل speech_onset و speech_endpoint انجام می‌شود. این یعنی مدل نه‌تنها می‌داند چه کسی صحبت می‌کند، بلکه می‌داند کِی یک نفر صحبتش را تمام کرده و نوبت به نفر بعدی رسیده — قابلیتی که برای رونویسی جلسات چندنفره یا مصاحبه‌های گروهی اهمیت زیادی دارد.

نمودار دقت و نرخ خطای پایین مدل صوتی Muse Voice Transcribe متا

۵. دقت و رکوردهای بنچمارک

در بخش عملکرد، متا چند عدد مشخص اعلام کرده است. نرخ خطای کلمه‌ای (WER) در حالت بلادرنگ ۳٫۱ درصد گزارش شده که طبق ادعای متا، در تاریخ عرضه بهترین رقم در جدول رتبه‌بندی Artificial Analysis برای گفتار-به-متن بلادرنگ بوده است. نرخ خطای دیاریزیشن (DER) هم به‌طور میانگین روی سه مجموعه‌دادهٔ استاندارد AMI-IHM، AMI-SDM و VoxConverse برابر ۱۷٫۵ درصد اندازه‌گیری شده. از نظر تأخیر، مدل در حدود ۰٫۱۶ ثانیه به رونوشت نهایی می‌رسد.

این اعداد باید با احتیاط خوانده شوند؛ بنچمارک‌های شرکت‌ها معمولاً در شرایط کنترل‌شده اندازه‌گیری می‌شوند و ممکن است در استفادهٔ روزمره، با نویز محیط، لهجه‌های متنوع یا کیفیت پایین میکروفون، نتایج واقعی کمی متفاوت باشد. با این حال، ترکیب دقت بالا و تأخیر پایین در یک مدل واحد، دستاورد فنی قابل‌توجهی است که می‌تواند محدودیت‌های واقعی هوش مصنوعی در کاربرد عملی را کمی کمتر کند؛ موضوعی که در این مقاله دربارهٔ توان و محدودیت‌های واقعی هوش مصنوعی هم بررسی شده است.

۶. زبان‌ها و قابلیت کدسوییچینگ

Muse Voice Transcribe روی بیش از ۷۰ زبان دنیا آموزش دیده و عملکرد آن در ۲۵ زبان به‌طور کامل تأیید شده، از جمله فرانسه، هندی، ژاپنی، اسپانیایی، ویتنامی و چینی ماندارین. یکی از قابلیت‌های کاربردی‌اش «کدسوییچینگ» است؛ یعنی وقتی گوینده وسط یک جمله بین دو زبان جابه‌جا می‌شود (چیزی که در گفت‌وگوهای روزمرهٔ بسیاری از فارسی‌زبانانِ دوزبانه هم رایج است)، مدل نیازی به تشخیص زبان جداگانه ندارد و به‌طور طبیعی هر دو زبان را رونویسی می‌کند.

مدل همچنین از قابلیت‌های شخصی‌سازی مثل «سوگیری زبانی»، تشخیص کلمات کلیدی خاص و سوگیری متنی پشتیبانی می‌کند؛ یعنی می‌توان به مدل نام‌های خاص، اصطلاحات فنی یا واژه‌های نامتعارف را از پیش معرفی کرد تا دقت رونویسی برای آن‌ها بالاتر برود.

۷. در دسترس بودن، قیمت و پلتفرم‌ها

متا این مدل را از سه مسیر در دسترس قرار داده: اپلیکیشن Meta AI برای مک (با نگه داشتن کلید Fn برای دیکتهٔ صوتی زنده در هر برنامه‌ای)، محیط توسعهٔ Muse Code، و رابط برنامه‌نویسی Meta Model API برای توسعه‌دهندگان. قیمت دسترسی از طریق API حدود سه دلار به ازای هر هزار دقیقهٔ صدا (معادل تقریبی ۰٫۱۸ دلار در ساعت) اعلام شده است. متا در دموی رسمی این مدل تأکید کرده صدای کاربر فقط برای تولید رونوشت پردازش می‌شود و ذخیره نمی‌شود.

این نوع دسترسی چندگانه — هم در اپلیکیشن مصرفی، هم در ابزار توسعه، هم از طریق API — نشان می‌دهد متا قصد دارد این فناوری را هم به کاربران عادی و هم به کسب‌وکارها عرضه کند. برای کسب‌وکارهایی که به دنبال ابزارهای عملی هوش مصنوعی هستند، چنین مدل‌هایی می‌توانند مستقیماً در گردش کار جلسات، پشتیبانی مشتری و تولید محتوا استفاده شوند؛ نمونه‌ای از همان روندی که در اهمیت هوش مصنوعی برای کسب‌وکارها شرح داده شده است.

قابلیت تشخیص چند گوینده و پشتیبانی چندزبانه مدل صوتی متا

۸. این مدل چه فرقی با ویسپر و رقبا دارد؟

بیشتر ابزارهای رونویسی که کاربران فارسی‌زبان با آن‌ها آشنا هستند — از جمله مدل‌های خانوادهٔ Whisper از OpenAI — معمولاً برای دقت بالاتر، فایل کامل صوتی را دریافت و سپس پردازش می‌کنند، یا اگر حالت بلادرنگ دارند، دقتشان معمولاً افت محسوسی نسبت به حالت آفلاین پیدا می‌کند. ادعای اصلی متا این است که Muse Voice Transcribe این مصالحه را تا حد زیادی از بین برده: هم بلادرنگ است، هم (طبق بنچمارک‌های خودشان) دقتش در ردهٔ بالای جدول قرار دارد. ادغام دیاریزیشن و رونویسی در یک مدل واحد هم یک تفاوت معماری مهم است که در بسیاری از رقبا هنوز به‌صورت دو مرحلهٔ جدا انجام می‌شود.

البته باید در نظر داشت که این مقایسه بر اساس اعداد منتشرشده از سوی خود متا انجام شده و بنچمارک‌های مستقل و آزمایش‌های کاربران واقعی معمولاً کمی بعدتر منتشر می‌شوند. تجربهٔ نشان داده در صنعت هوش مصنوعی، فاصلهٔ میان ادعای رسمی شرکت‌ها و عملکرد واقعی محصول گاهی قابل‌توجه است؛ نکته‌ای که در بحث‌های مربوط به توهم توانمندی در پروژه‌های هوش مصنوعی هم به آن اشاره شده است. اگر برای کار حرفه‌ای به این مدل نیاز دارید، بهتر است پیش از جایگزینی کامل ابزار فعلی‌تان، آن را روی نمونه‌های واقعی صدای خودتان امتحان کنید.

کاربرد برای فارسی‌زبان‌ها

نکتهٔ مهم برای مخاطب فارسی‌زبان این است که فارسی هنوز جزو ۲۵ زبانی نیست که متا آن را «به‌طور کامل تأیید شده» اعلام کرده، هرچند در فهرست ۷۰+ زبان آموزشی مدل قرار دارد. یعنی رونویسی فارسی ممکن است در همین نسخهٔ اول در دسترس باشد، اما دقتش لزوماً هم‌تراز زبان‌هایی مثل انگلیسی یا اسپانیایی نخواهد بود. برای کسانی که با زیرنویس‌سازی فارسی سروکار دارند، ترکیب این ابزار با راهکارهای اختصاصی فارسی هنوز منطقی‌تر به نظر می‌رسد.

۹. پرسش‌های پرتکرار

Muse Voice Transcribe رایگان است؟
در اپلیکیشن Meta AI برای مک و Muse Code به‌صورت داخلی در دسترس است؛ دسترسی برنامه‌نویسی از طریق API حدود سه دلار به ازای هر هزار دقیقهٔ صدا هزینه دارد.

آیا از زبان فارسی پشتیبانی می‌کند؟
فارسی در فهرست بلندِ زبان‌های آموزشی مدل هست، اما جزو ۲۵ زبانی نیست که متا دقت آن را به‌طور کامل تأیید کرده؛ نتیجه ممکن است نسبت به زبان‌های اصلی ضعیف‌تر باشد.

چه فرقی با ابزارهای رونویسی معمولی دارد؟
رونویسی، تشخیص گوینده و تشخیص مرز جمله را هم‌زمان و بدون تأخیر انجام می‌دهد، در حالی که بیشتر ابزارهای رقیب این کارها را در مراحل جدا انجام می‌دهند.

صدای کاربران ذخیره می‌شود؟
طبق اعلام متا، صدا فقط برای تولید رونوشت پردازش می‌شود و ذخیره نمی‌شود.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

جمع‌بندی. Muse Voice Transcribe نشان می‌دهد رقابت هوش مصنوعی از تولید متن و تصویر فراتر رفته و حالا صدا هم به میدان اصلی رقابت شرکت‌های بزرگ تبدیل شده است. برای دنبال کردن این‌جور اخبار به محض انتشار، به کانال تلگرام @MrChatGPT_IR بپیوندید و آموزش‌های عملی هوش مصنوعی را در بخش آموزش‌های مستر چت‌جی‌پی‌تی دنبال کنید.
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *