متا از مدل Muse Voice Transcribe رونمایی کرد؛ اولین مدل ادراک صوتی بلادرنگ این شرکت که رونویسی، تشخیص گوینده و مرزبندی جمله را در یک قدم و بدون تأخیر انجام میدهد.

لیست مطالب
۱. چه اتفاقی افتاد؟
متا روز دوشنبه، ۱۰ شهریور ۱۴۰۵ (برابر با ۱ سپتامبر ۲۰۲۶)، از طریق وبلاگ پژوهشی خود مدل Muse Voice Transcribe را معرفی کرد. این مدل نخستین محصول ادراک صوتی بلادرنگ متا است و بخشی از خانوادهٔ مدلهای Muse Spark محسوب میشود؛ همان خانوادهای که پیشتر با Muse Code برای برنامهنویسی و Muse Glimmer برای اجرای محلی روی گوشی معرفی شده بود. تفاوت اصلی این عضو تازه با اعضای قبلی خانواده، تمرکز کامل روی صداست: تبدیل گفتار به متن، شناسایی اینکه چه کسی در حال صحبت است و تشخیص اینکه یک جمله کجا تمام میشود، همه در یک مدل واحد و بدون هیچ مرحلهٔ پردازش جداگانه بعد از ضبط.
نکتهٔ مهم این عرضه، زمانبندی آن است. بازار ابزارهای رونویسی و زیرنویسسازی این روزها یکی از داغترین بخشهای هوش مصنوعی کاربردی است؛ از تولیدکنندگان محتوا و پادکسترها گرفته تا تیمهای حرفهای که جلسات را مستندسازی میکنند. متا با این عرضه مستقیماً وارد رقابتی میشود که پیش از این بیشتر در اختیار ابزارهایی مانند Whisper از OpenAI و راهکارهای گوگل بود. اگر پیشتر دربارهٔ اوپنایآی و مدلهای آن خوانده باشید، میدانید رقابت میان شرکتهای بزرگ هوش مصنوعی معمولاً روی چند جبههٔ همزمان پیش میرود؛ صدا حالا یکی از تازهترین این جبهههاست.
۲. Muse Voice Transcribe دقیقاً چیست؟
در یک جمله: مدلی است که صدا را میشنود و همزمان با شنیدن، متن تولید میکند. برخلاف بسیاری از ابزارهای رونویسی رایج که ابتدا کل فایل صوتی را ضبط میکنند و سپس آن را برای پردازش میفرستند، Muse Voice Transcribe از همان لحظهٔ شروع صحبت، متن را روی صفحه میآورد. این ویژگی برای کاربردهایی مثل زیرنویس زندهٔ استریم، دستیارهای صوتی و دیکتهٔ بلادرنگ حیاتی است، چون کاربر منتظر پایان ضبط نمیماند.
معماری مدل بهصورت خودبازگشتی (autoregressive) و چندوجهی طراحی شده؛ یعنی همان رویکردی که در مدلهای زبانی متنی رایج است، اما اینبار روی جریان صوتی پیاده شده. این طراحی به متا اجازه داده یک مدل واحد بسازد که هم رونویسی میکند، هم گویندهها را از هم جدا میکند و هم میداند کِی یک جمله یا یک نوبت صحبت تمام شده — کاری که معمولاً به سه مدل یا سه مرحلهٔ پردازش جداگانه نیاز داشت.
۳. معماری فنی: چطور صدا را به متن تبدیل میکند؟
هستهٔ فنی مدل بر پایهٔ پردازش قطعهبهقطعهٔ صداست. ورودی صوتی به بخشهای ۸۰ میلیثانیهای تقسیم میشود و هر قطعه بهصورت «توکن نرم» (soft token) به مدل داده میشود. در هر قطعه، مدل یکی از دو کار را انجام میدهد: یا یک توکن متنی تولید میکند، یا با یک توکن ویژه به نام next_audio اعلام میکند که همچنان در حال گوش دادن است و آماده نیست چیزی بنویسد. این تصمیمگیری قطعهبهقطعه همان چیزی است که به مدل اجازه میدهد بدون تأخیر محسوس کار کند.
بخش جالبتر، «تأخیر تطبیقی» (adaptive delay) است. مدل با یادگیری تقویتی آموزش دیده که همزمان دو پاداش را بهینه کند: دقت رونویسی و کوتاه بودن تأخیر. این دو پاداش بهصورت ضربی ترکیب میشوند، نه جمعی؛ یعنی مدل نمیتواند با فدا کردن شدید دقت، فقط سرعت را بالا ببرد. نتیجه این شده که برای جملات ساده، مدل خیلی زود متن را مینویسد و برای بخشهای پیچیدهتر یا مبهم، کمی بیشتر صبر میکند تا مطمئن شود — دقیقاً همان کاری که یک انسان هنگام گوش دادن دقیق انجام میدهد.
۴. تشخیص گوینده و رونویسی همزمان چند نفر
برای تشخیص گوینده، مدل از توکنهای ویژهای مثل start_of_turn برای علامتگذاری تغییر احتمالی گوینده و برچسبهایی مثل speaker_A تا speaker_Z برای متمایز کردن صداها استفاده میکند. این روش به مدل اجازه میدهد بیش از ۲۰ گوینده را در یک فایل صوتی طولانیتر از یک ساعت، بدون هیچ پردازش جداگانه یا مرحلهٔ پسپردازش، از هم تفکیک کند. برای مقایسه، بسیاری از ابزارهای رایج رونویسی نیاز به یک مدل جداگانهٔ «دیاریزیشن» دارند که بعد از رونویسی روی متن اجرا میشود؛ متا این دو مرحله را در یک مدل واحد ادغام کرده است.
تشخیص مرز جمله و نوبت صحبت هم با توکنهای مشابهی مثل speech_onset و speech_endpoint انجام میشود. این یعنی مدل نهتنها میداند چه کسی صحبت میکند، بلکه میداند کِی یک نفر صحبتش را تمام کرده و نوبت به نفر بعدی رسیده — قابلیتی که برای رونویسی جلسات چندنفره یا مصاحبههای گروهی اهمیت زیادی دارد.

۵. دقت و رکوردهای بنچمارک
در بخش عملکرد، متا چند عدد مشخص اعلام کرده است. نرخ خطای کلمهای (WER) در حالت بلادرنگ ۳٫۱ درصد گزارش شده که طبق ادعای متا، در تاریخ عرضه بهترین رقم در جدول رتبهبندی Artificial Analysis برای گفتار-به-متن بلادرنگ بوده است. نرخ خطای دیاریزیشن (DER) هم بهطور میانگین روی سه مجموعهدادهٔ استاندارد AMI-IHM، AMI-SDM و VoxConverse برابر ۱۷٫۵ درصد اندازهگیری شده. از نظر تأخیر، مدل در حدود ۰٫۱۶ ثانیه به رونوشت نهایی میرسد.
این اعداد باید با احتیاط خوانده شوند؛ بنچمارکهای شرکتها معمولاً در شرایط کنترلشده اندازهگیری میشوند و ممکن است در استفادهٔ روزمره، با نویز محیط، لهجههای متنوع یا کیفیت پایین میکروفون، نتایج واقعی کمی متفاوت باشد. با این حال، ترکیب دقت بالا و تأخیر پایین در یک مدل واحد، دستاورد فنی قابلتوجهی است که میتواند محدودیتهای واقعی هوش مصنوعی در کاربرد عملی را کمی کمتر کند؛ موضوعی که در این مقاله دربارهٔ توان و محدودیتهای واقعی هوش مصنوعی هم بررسی شده است.
۶. زبانها و قابلیت کدسوییچینگ
Muse Voice Transcribe روی بیش از ۷۰ زبان دنیا آموزش دیده و عملکرد آن در ۲۵ زبان بهطور کامل تأیید شده، از جمله فرانسه، هندی، ژاپنی، اسپانیایی، ویتنامی و چینی ماندارین. یکی از قابلیتهای کاربردیاش «کدسوییچینگ» است؛ یعنی وقتی گوینده وسط یک جمله بین دو زبان جابهجا میشود (چیزی که در گفتوگوهای روزمرهٔ بسیاری از فارسیزبانانِ دوزبانه هم رایج است)، مدل نیازی به تشخیص زبان جداگانه ندارد و بهطور طبیعی هر دو زبان را رونویسی میکند.
مدل همچنین از قابلیتهای شخصیسازی مثل «سوگیری زبانی»، تشخیص کلمات کلیدی خاص و سوگیری متنی پشتیبانی میکند؛ یعنی میتوان به مدل نامهای خاص، اصطلاحات فنی یا واژههای نامتعارف را از پیش معرفی کرد تا دقت رونویسی برای آنها بالاتر برود.
۷. در دسترس بودن، قیمت و پلتفرمها
متا این مدل را از سه مسیر در دسترس قرار داده: اپلیکیشن Meta AI برای مک (با نگه داشتن کلید Fn برای دیکتهٔ صوتی زنده در هر برنامهای)، محیط توسعهٔ Muse Code، و رابط برنامهنویسی Meta Model API برای توسعهدهندگان. قیمت دسترسی از طریق API حدود سه دلار به ازای هر هزار دقیقهٔ صدا (معادل تقریبی ۰٫۱۸ دلار در ساعت) اعلام شده است. متا در دموی رسمی این مدل تأکید کرده صدای کاربر فقط برای تولید رونوشت پردازش میشود و ذخیره نمیشود.
این نوع دسترسی چندگانه — هم در اپلیکیشن مصرفی، هم در ابزار توسعه، هم از طریق API — نشان میدهد متا قصد دارد این فناوری را هم به کاربران عادی و هم به کسبوکارها عرضه کند. برای کسبوکارهایی که به دنبال ابزارهای عملی هوش مصنوعی هستند، چنین مدلهایی میتوانند مستقیماً در گردش کار جلسات، پشتیبانی مشتری و تولید محتوا استفاده شوند؛ نمونهای از همان روندی که در اهمیت هوش مصنوعی برای کسبوکارها شرح داده شده است.

۸. این مدل چه فرقی با ویسپر و رقبا دارد؟
بیشتر ابزارهای رونویسی که کاربران فارسیزبان با آنها آشنا هستند — از جمله مدلهای خانوادهٔ Whisper از OpenAI — معمولاً برای دقت بالاتر، فایل کامل صوتی را دریافت و سپس پردازش میکنند، یا اگر حالت بلادرنگ دارند، دقتشان معمولاً افت محسوسی نسبت به حالت آفلاین پیدا میکند. ادعای اصلی متا این است که Muse Voice Transcribe این مصالحه را تا حد زیادی از بین برده: هم بلادرنگ است، هم (طبق بنچمارکهای خودشان) دقتش در ردهٔ بالای جدول قرار دارد. ادغام دیاریزیشن و رونویسی در یک مدل واحد هم یک تفاوت معماری مهم است که در بسیاری از رقبا هنوز بهصورت دو مرحلهٔ جدا انجام میشود.
البته باید در نظر داشت که این مقایسه بر اساس اعداد منتشرشده از سوی خود متا انجام شده و بنچمارکهای مستقل و آزمایشهای کاربران واقعی معمولاً کمی بعدتر منتشر میشوند. تجربهٔ نشان داده در صنعت هوش مصنوعی، فاصلهٔ میان ادعای رسمی شرکتها و عملکرد واقعی محصول گاهی قابلتوجه است؛ نکتهای که در بحثهای مربوط به توهم توانمندی در پروژههای هوش مصنوعی هم به آن اشاره شده است. اگر برای کار حرفهای به این مدل نیاز دارید، بهتر است پیش از جایگزینی کامل ابزار فعلیتان، آن را روی نمونههای واقعی صدای خودتان امتحان کنید.
کاربرد برای فارسیزبانها
نکتهٔ مهم برای مخاطب فارسیزبان این است که فارسی هنوز جزو ۲۵ زبانی نیست که متا آن را «بهطور کامل تأیید شده» اعلام کرده، هرچند در فهرست ۷۰+ زبان آموزشی مدل قرار دارد. یعنی رونویسی فارسی ممکن است در همین نسخهٔ اول در دسترس باشد، اما دقتش لزوماً همتراز زبانهایی مثل انگلیسی یا اسپانیایی نخواهد بود. برای کسانی که با زیرنویسسازی فارسی سروکار دارند، ترکیب این ابزار با راهکارهای اختصاصی فارسی هنوز منطقیتر به نظر میرسد.
۹. پرسشهای پرتکرار
Muse Voice Transcribe رایگان است؟
در اپلیکیشن Meta AI برای مک و Muse Code بهصورت داخلی در دسترس است؛ دسترسی برنامهنویسی از طریق API حدود سه دلار به ازای هر هزار دقیقهٔ صدا هزینه دارد.
آیا از زبان فارسی پشتیبانی میکند؟
فارسی در فهرست بلندِ زبانهای آموزشی مدل هست، اما جزو ۲۵ زبانی نیست که متا دقت آن را بهطور کامل تأیید کرده؛ نتیجه ممکن است نسبت به زبانهای اصلی ضعیفتر باشد.
چه فرقی با ابزارهای رونویسی معمولی دارد؟
رونویسی، تشخیص گوینده و تشخیص مرز جمله را همزمان و بدون تأخیر انجام میدهد، در حالی که بیشتر ابزارهای رقیب این کارها را در مراحل جدا انجام میدهند.
صدای کاربران ذخیره میشود؟
طبق اعلام متا، صدا فقط برای تولید رونوشت پردازش میشود و ذخیره نمیشود.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
