مایکروسافت با رونمایی از مدل MAI-Transcribe-2، رونویسی صوتی را در ۶۰ زبان زندهی دنیا هم سریعتر کرد، هم دقیقتر و هم بهمراتب ارزانتر از اوپنایآی و گوگل.

لیست مطالب
۱. مقدمه: رقابت تازه در بازار رونویسی صوتی
در حالی که بیشتر خبرهای هوش مصنوعی این روزها حول محور مدلهای متنی و چندوجهی بزرگ میچرخد، مایکروسافت با رونمایی از MAI-Transcribe-2 نشان داد جبههی دیگری از این رقابت، یعنی تبدیل صدا به متن، هم به همان اندازه داغ شده است. شرکتهای بزرگ فناوری از مدتها پیش میدانستند که رونویسی دقیق و ارزان صدا، ستون فقرات بسیاری از محصولات روزمره از جمله دستیارهای صوتی، ابزارهای زیرنویس، نرمافزارهای پزشکی و سامانههای مرکز تماس است. حالا مایکروسافت با یک حرکت قیمتی و فنی همزمان، تلاش کرده جای پای محکمی در این بازار باز کند.
برای آشنایی بیشتر با نقش اینگونه رقابتها در اکوسیستم هوش مصنوعی، میتوانید معرفی کامل اوپنایآی را در سایت Mr ChatGPT بخوانید تا تصویر روشنتری از بازیگران اصلی این میدان داشته باشید.
۲. مدل MAI-Transcribe-2 دقیقاً چه کاری انجام میدهد؟
مایکروسافت این مدل را جانشین نسل قبلی خانوادهی MAI-Transcribe معرفی کرده و آن را برای وظیفهی مشخص «تبدیل گفتار به متن» بهینه کرده است. برخلاف مدلهای عمومی زبانی که رونویسی تنها یکی از قابلیتهای جانبی آنهاست، این مدل بهطور اختصاصی برای درک گفتار طبیعی، تشخیص گویندههای مختلف، برچسبگذاری زمانی کلمهبهکلمه و مدیریت شرایط صوتی پرنویز طراحی شده است. این تمرکز باعث شده مایکروسافت بتواند همزمان روی سه محور دقت، سرعت و هزینه پیشرفت محسوسی ثبت کند؛ چیزی که در گذشته معمولاً باید یکی را فدای دیگری میکرد.
۳. رکورد دقت در آزمون FLEURS؛ چرا این عدد مهم است؟
آزمون FLEURS یکی از معتبرترین معیارهای سنجش کیفیت رونویسی چندزبانه در صنعت هوش مصنوعی است و عملکرد مدلها را در دهها زبان زندهی دنیا، از فارسی و عربی گرفته تا زبانهای کمرواجتر، اندازه میگیرد. مایکروسافت اعلام کرده MAI-Transcribe-2 در این آزمون روی ۶۰ زبان رتبهی نخست را از آن خود کرده و میانگین نرخ خطای کلمهای آن تنها ۵.۲ درصد است. این یعنی از هر صد کلمهی گفتهشده، کمتر از شش کلمه بهاشتباه رونویسی میشود؛ رقمی که برای زبانهایی با ساختار پیچیده یا لهجههای متنوع، دستاورد قابلتوجهی به شمار میرود.
۳.۱. کد-سوییچینگ و زبانهای ترکیبی
یکی از ویژگیهای جالب این مدل، توانایی آن در مدیریت مکالماتی است که گوینده بین دو زبان جابهجا میشود؛ نمونههای شناختهشدهی این پدیده در جهان انگلیسی-هندی یا انگلیسی-اسپانیایی هستند، اما همین معماری میتواند برای ترکیبهای فارسی-انگلیسی که در محیطهای کاری و دانشگاهی ایران هم رایج است، کارایی مشابهی داشته باشد.
۴. سرعت: چرا این موتور رقبا را جا گذاشت؟
در کنار دقت بالا، آنچه MAI-Transcribe-2 را متمایز میکند سرعت پردازش آن است. بر پایهی دادههای منتشرشده توسط مایکروسافت، این مدل حدود ده برابر سریعتر از مدل رونویسی اوپنایآی موسوم به GPT-Transcribe، هفت برابر سریعتر از Scribe v2 شرکت الونلبز و پنج برابر سریعتر از Gemini 3.5 Transcribe گوگل عمل میکند. مایکروسافت مدعی است این سرعت بالا با افت کیفیت همراه نیست و مدل همچنان در صدر یا نزدیک صدر جدول دقت باقی میماند؛ ترکیبی که در تحلیلهای فنی از آن با عنوان «مرز پارتو» دقت و تأخیر یاد شده است.

۵. قیمتگذاری: هزینهای که میدان رقابت را عوض کرد
شاید جنجالیترین بخش این رونمایی، سیاست قیمتگذاری مایکروسافت باشد. این شرکت اعلام کرده تا پایان سال جاری میلادی، استفاده از MAI-Transcribe-2 تنها یکدهم دلار برای هر ساعت صدا هزینه دارد؛ رقمی که بهگفتهی تحلیلگران صنعت، بهطور قابلتوجهی پایینتر از هزینهی برآوردی مدلهای رقیب است. چنین قیمت تهاجمیای معمولاً نشانهی تلاش یک شرکت برای جذب سریع توسعهدهندگان و کسب سهم بازار در مرحلهی اولیهی عرضهی یک محصول است، پیش از آنکه قیمت نهایی و پایدار آن اعلام شود.
برای کسبوکارهایی که بهدنبال کاهش هزینههای عملیاتی خود با کمک ابزارهای هوش مصنوعی هستند، این نوع رقابت قیمتی میتواند فرصت مناسبی باشد. در همین راستا، مطلب چرا هوش مصنوعی برای کسبوکارها اهمیت دارد در سایت Mr ChatGPT، دیدی جامعتر از این فرصتها ارائه میدهد.
۶. قابلیتها و ویژگیهای فنی مدل
در کنار دقت، سرعت و قیمت، MAI-Transcribe-2 مجموعهای از قابلیتهای عملی را هم در اختیار توسعهدهندگان قرار میدهد: تشخیص خودکار گوینده در مکالمات چندنفره، برچسبگذاری زمانی دقیق برای هر کلمه، امکان اولویتبندی واژگان تخصصی یک حوزه (مثلاً اصطلاحات پزشکی یا حقوقی)، دو حالت رونویسی «عینی» و «پاکسازیشده»، و عملکرد پایدار حتی در محیطهای پرسروصدا. این ترکیب از قابلیتها، مدل را برای طیف وسیعی از کاربردهای صنعتی و سازمانی مناسب میکند، نه فقط برای رونویسی سادهی یک فایل صوتی کوتاه.
ویژگی تشخیص گوینده بهویژه برای صنایعی مثل مراکز تماس و جلسات چندنفره اهمیت زیادی دارد؛ جایی که دانستن اینکه «چه کسی چه چیزی گفت» به همان اندازهی متن گفتهشده مهم است. حالت رونویسی «پاکسازیشده» هم برای تولید محتوایی کاربردی است، مثل زیرنویسهای خوانا برای ویدیو، جایی که مکثها، تکرارها و صداهای پرکننده مثل «اِ» و «آمم» حذف میشوند، در حالی که حالت «عینی» برای مستندسازی دقیق حقوقی یا پزشکی، هر آنچه گفته شده را بدون هیچ تغییری ثبت میکند. مایکروسافت میگوید این دو حالت را میتوان بسته به نوع کاربرد، بهسادگی از طریق تنظیمات API انتخاب کرد.
۷. کاربردهای عملی: از پزشکی تا زیرنویس خودکار
مایکروسافت چند حوزهی کاربردی مشخص را برای این مدل معرفی کرده است: یادداشتبرداری خودکار در مطبهای پزشکی، مستندسازی جلسات حقوقی، تولید زیرنویس خودکار برای ویدیوها و پادکستها، و ابزارهای دسترسپذیری برای افراد کمشنوا یا ناشنوا. در هر یک از این حوزهها، ترکیب دقت بالا و هزینهی پایین میتواند مانع اصلی پیشین یعنی گرانبودن رونویسی حرفهای صوتی را از میان بردارد و آن را در دسترس کسبوکارهای کوچکتر هم قرار دهد.
توسعهدهندگانی که میخواهند این مدل را در ابزارهای خود ادغام کنند، میتوانند از راهنمای نوشتن پرامپت برای مبتدیان در سایت Mr ChatGPT هم برای بهینهسازی تعامل با مدلهای زبانی مکمل این سامانه بهره ببرند.

۸. مقایسه با رقبا: اوپنایآی، گوگل و الونلبز کجا ایستادهاند؟
رقابت در حوزهی رونویسی صوتی هوش مصنوعی، بازتاب کوچکتری از همان نبردی است که در مدلهای زبانی بزرگ میان اوپنایآی، گوگل، آنتروپیک و شرکتهای دیگر جریان دارد. اگر پیشتر با نبردهایی مثل مقایسهی چتجیپیتی و دیپسیک آشنا شده باشید، الگوی مشابهی را اینجا هم میبینید: هر بار یک شرکت با ترکیبی از قیمت پایینتر یا عملکرد بهتر، فشار تازهای به رقبا وارد میکند و آنها را مجبور به واکنش سریع میسازد. گوگل و اوپنایآی هنوز واکنش رسمی مشخصی به این رونمایی نشان ندادهاند، اما با توجه به سابقهی این بازار، بعید نیست بهزودی شاهد کاهش قیمت یا معرفی نسخههای بهروزشده از مدلهای رقیب باشیم.
۹. تحلیل: این خبر برای توسعهدهندگان و کسبوکارها چه معنایی دارد؟
فراتر از رقابت میان غولهای فناوری، نکتهی مهمتر برای کاربران نهایی این است که هزینهی ورود به دنیای رونویسی خودکار حرفهای دارد بهسرعت پایین میآید. این روند با آنچه پیشتر در مطلب پتانسیل واقعی و محدودیتهای هوش مصنوعی در سایت Mr ChatGPT بررسی کردیم همراستاست: فناوریهای هوش مصنوعی وقتی از آزمایشگاه به محصولات روزمره میرسند، تازه تأثیر واقعی خود را نشان میدهند. با این حال، توسعهدهندگانی که میخواهند این ابزارها را در محصولات خود بهکار بگیرند، باید همچنان مرز میان کار مهندسی واقعی و اتکای صرف به ابزارهای آماده را بشناسند؛ موضوعی که در مطلب توهم توسعهدهندهی تکنفره در برابر مهندس واقعی بهتفصیل به آن پرداختهایم.
نکتهی دیگری که کمتر به آن توجه میشود، تأثیر این نوع رقابت قیمتی بر بازارهای غیرانگلیسیزبان است. بسیاری از ابزارهای رونویسی صوتی در گذشته بهترین عملکرد خود را تنها برای زبان انگلیسی ارائه میدادند و کاربران زبانهای دیگر، از جمله فارسی، عربی یا هندی، معمولاً با افت محسوس دقت روبهرو میشدند. حالا که شرکتهای بزرگ برای اثبات برتری خود، آزمونهای چندزبانه مثل FLEURS را معیار اصلی رقابت قرار دادهاند، انتظار میرود کیفیت رونویسی برای زبانهای کمرواجتر هم بهمرور بهبود پیدا کند؛ روندی که در نهایت به سود کاربران و توسعهدهندگان فارسیزبان هم خواهد بود.
سوالات متداول دربارهی MAI-Transcribe-2
مدل MAI-Transcribe-2 چه زمانی عرضه شد؟
مایکروسافت این مدل را در سوم سپتامبر ۲۰۲۶ بهطور رسمی معرفی کرد.
هزینهی استفاده از این مدل چقدر است؟
طبق اعلام مایکروسافت، تا پایان سال جاری میلادی، هزینهی استفاده تنها یکدهم دلار برای هر ساعت صداست.
این مدل از چه زبانهایی پشتیبانی میکند؟
بر اساس نتایج آزمون FLEURS، این مدل در ۶۰ زبان زندهی دنیا با دقت بالا عمل میکند و از تشخیص خودکار زبان هم پشتیبانی میکند.
چطور میتوان به این مدل دسترسی داشت؟
این مدل هماکنون از طریق مایکروسافت فاندری، محیط آزمایشی MAI Playground و پلتفرم اپنروتر در دسترس توسعهدهندگان قرار دارد.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
