تصویر مفهومی رونمایی مایکروسافت از مدل هوش مصنوعی رونویسی صوتی MAI-Transcribe-2

مایکروسافت مدل رونویسی صوتی MAI-Transcribe-2 را رونمایی کرد؛ ارزان‌تر و سریع‌تر از OpenAI و Google

اخبار · هوش مصنوعی

مایکروسافت با رونمایی از مدل MAI-Transcribe-2، رونویسی صوتی را در ۶۰ زبان زنده‌ی دنیا هم سریع‌تر کرد، هم دقیق‌تر و هم به‌مراتب ارزان‌تر از اوپن‌ای‌آی و گوگل.

چکیده. مایکروسافت روز سوم سپتامبر ۲۰۲۶ از مدل تازه‌ی رونویسی صوتی خود با نام MAI-Transcribe-2 رونمایی کرد؛ مدلی که به گفته‌ی این شرکت هم‌زمان سریع‌ترین، دقیق‌ترین و ارزان‌ترین موتور رونویسی جهان است. این مدل روی آزمون معتبر FLEURS در ۶۰ زبان رتبه‌ی نخست را گرفته، نرخ خطایش تنها ۵.۲ درصد است و هزینه‌ی استفاده از آن تا پایان سال جاری تنها یک‌دهم دلار برای هر ساعت صداست؛ رقمی که رقبایی مثل اوپن‌ای‌آی، گوگل و الون‌لبز فعلاً به آن نرسیده‌اند.
تصویر مفهومی رونمایی مایکروسافت از مدل هوش مصنوعی رونویسی صوتی MAI-Transcribe-2

۱. مقدمه: رقابت تازه در بازار رونویسی صوتی

در حالی که بیشتر خبرهای هوش مصنوعی این روزها حول محور مدل‌های متنی و چندوجهی بزرگ می‌چرخد، مایکروسافت با رونمایی از MAI-Transcribe-2 نشان داد جبهه‌ی دیگری از این رقابت، یعنی تبدیل صدا به متن، هم به همان اندازه داغ شده است. شرکت‌های بزرگ فناوری از مدت‌ها پیش می‌دانستند که رونویسی دقیق و ارزان صدا، ستون فقرات بسیاری از محصولات روزمره از جمله دستیارهای صوتی، ابزارهای زیرنویس، نرم‌افزارهای پزشکی و سامانه‌های مرکز تماس است. حالا مایکروسافت با یک حرکت قیمتی و فنی هم‌زمان، تلاش کرده جای پای محکمی در این بازار باز کند.

برای آشنایی بیشتر با نقش این‌گونه رقابت‌ها در اکوسیستم هوش مصنوعی، می‌توانید معرفی کامل اوپن‌ای‌آی را در سایت Mr ChatGPT بخوانید تا تصویر روشن‌تری از بازیگران اصلی این میدان داشته باشید.

۲. مدل MAI-Transcribe-2 دقیقاً چه کاری انجام می‌دهد؟

مایکروسافت این مدل را جانشین نسل قبلی خانواده‌ی MAI-Transcribe معرفی کرده و آن را برای وظیفه‌ی مشخص «تبدیل گفتار به متن» بهینه کرده است. برخلاف مدل‌های عمومی زبانی که رونویسی تنها یکی از قابلیت‌های جانبی آن‌هاست، این مدل به‌طور اختصاصی برای درک گفتار طبیعی، تشخیص گوینده‌های مختلف، برچسب‌گذاری زمانی کلمه‌به‌کلمه و مدیریت شرایط صوتی پرنویز طراحی شده است. این تمرکز باعث شده مایکروسافت بتواند هم‌زمان روی سه محور دقت، سرعت و هزینه پیشرفت محسوسی ثبت کند؛ چیزی که در گذشته معمولاً باید یکی را فدای دیگری می‌کرد.

۳. رکورد دقت در آزمون FLEURS؛ چرا این عدد مهم است؟

آزمون FLEURS یکی از معتبرترین معیارهای سنجش کیفیت رونویسی چندزبانه در صنعت هوش مصنوعی است و عملکرد مدل‌ها را در ده‌ها زبان زنده‌ی دنیا، از فارسی و عربی گرفته تا زبان‌های کم‌رواج‌تر، اندازه می‌گیرد. مایکروسافت اعلام کرده MAI-Transcribe-2 در این آزمون روی ۶۰ زبان رتبه‌ی نخست را از آن خود کرده و میانگین نرخ خطای کلمه‌ای آن تنها ۵.۲ درصد است. این یعنی از هر صد کلمه‌ی گفته‌شده، کمتر از شش کلمه به‌اشتباه رونویسی می‌شود؛ رقمی که برای زبان‌هایی با ساختار پیچیده یا لهجه‌های متنوع، دستاورد قابل‌توجهی به شمار می‌رود.

۳.۱. کد-سوییچینگ و زبان‌های ترکیبی

یکی از ویژگی‌های جالب این مدل، توانایی آن در مدیریت مکالماتی است که گوینده بین دو زبان جابه‌جا می‌شود؛ نمونه‌های شناخته‌شده‌ی این پدیده در جهان انگلیسی-هندی یا انگلیسی-اسپانیایی هستند، اما همین معماری می‌تواند برای ترکیب‌های فارسی-انگلیسی که در محیط‌های کاری و دانشگاهی ایران هم رایج است، کارایی مشابهی داشته باشد.

۴. سرعت: چرا این موتور رقبا را جا گذاشت؟

در کنار دقت بالا، آنچه MAI-Transcribe-2 را متمایز می‌کند سرعت پردازش آن است. بر پایه‌ی داده‌های منتشرشده توسط مایکروسافت، این مدل حدود ده برابر سریع‌تر از مدل رونویسی اوپن‌ای‌آی موسوم به GPT-Transcribe، هفت برابر سریع‌تر از Scribe v2 شرکت الون‌لبز و پنج برابر سریع‌تر از Gemini 3.5 Transcribe گوگل عمل می‌کند. مایکروسافت مدعی است این سرعت بالا با افت کیفیت همراه نیست و مدل همچنان در صدر یا نزدیک صدر جدول دقت باقی می‌ماند؛ ترکیبی که در تحلیل‌های فنی از آن با عنوان «مرز پارتو» دقت و تأخیر یاد شده است.

مقایسه هزینه و سرعت مدل رونویسی صوتی مایکروسافت با مدل‌های اوپن‌ای‌آی و گوگل

۵. قیمت‌گذاری: هزینه‌ای که میدان رقابت را عوض کرد

شاید جنجالی‌ترین بخش این رونمایی، سیاست قیمت‌گذاری مایکروسافت باشد. این شرکت اعلام کرده تا پایان سال جاری میلادی، استفاده از MAI-Transcribe-2 تنها یک‌دهم دلار برای هر ساعت صدا هزینه دارد؛ رقمی که به‌گفته‌ی تحلیلگران صنعت، به‌طور قابل‌توجهی پایین‌تر از هزینه‌ی برآوردی مدل‌های رقیب است. چنین قیمت تهاجمی‌ای معمولاً نشانه‌ی تلاش یک شرکت برای جذب سریع توسعه‌دهندگان و کسب سهم بازار در مرحله‌ی اولیه‌ی عرضه‌ی یک محصول است، پیش از آنکه قیمت نهایی و پایدار آن اعلام شود.

برای کسب‌وکارهایی که به‌دنبال کاهش هزینه‌های عملیاتی خود با کمک ابزارهای هوش مصنوعی هستند، این نوع رقابت قیمتی می‌تواند فرصت مناسبی باشد. در همین راستا، مطلب چرا هوش مصنوعی برای کسب‌وکارها اهمیت دارد در سایت Mr ChatGPT، دیدی جامع‌تر از این فرصت‌ها ارائه می‌دهد.

۶. قابلیت‌ها و ویژگی‌های فنی مدل

در کنار دقت، سرعت و قیمت، MAI-Transcribe-2 مجموعه‌ای از قابلیت‌های عملی را هم در اختیار توسعه‌دهندگان قرار می‌دهد: تشخیص خودکار گوینده در مکالمات چندنفره، برچسب‌گذاری زمانی دقیق برای هر کلمه، امکان اولویت‌بندی واژگان تخصصی یک حوزه (مثلاً اصطلاحات پزشکی یا حقوقی)، دو حالت رونویسی «عینی» و «پاک‌سازی‌شده»، و عملکرد پایدار حتی در محیط‌های پرسروصدا. این ترکیب از قابلیت‌ها، مدل را برای طیف وسیعی از کاربردهای صنعتی و سازمانی مناسب می‌کند، نه فقط برای رونویسی ساده‌ی یک فایل صوتی کوتاه.

ویژگی تشخیص گوینده به‌ویژه برای صنایعی مثل مراکز تماس و جلسات چندنفره اهمیت زیادی دارد؛ جایی که دانستن اینکه «چه کسی چه چیزی گفت» به همان اندازه‌ی متن گفته‌شده مهم است. حالت رونویسی «پاک‌سازی‌شده» هم برای تولید محتوایی کاربردی است، مثل زیرنویس‌های خوانا برای ویدیو، جایی که مکث‌ها، تکرارها و صداهای پرکننده مثل «اِ» و «آمم» حذف می‌شوند، در حالی که حالت «عینی» برای مستندسازی دقیق حقوقی یا پزشکی، هر آنچه گفته شده را بدون هیچ تغییری ثبت می‌کند. مایکروسافت می‌گوید این دو حالت را می‌توان بسته به نوع کاربرد، به‌سادگی از طریق تنظیمات API انتخاب کرد.

۷. کاربردهای عملی: از پزشکی تا زیرنویس خودکار

مایکروسافت چند حوزه‌ی کاربردی مشخص را برای این مدل معرفی کرده است: یادداشت‌برداری خودکار در مطب‌های پزشکی، مستندسازی جلسات حقوقی، تولید زیرنویس خودکار برای ویدیوها و پادکست‌ها، و ابزارهای دسترس‌پذیری برای افراد کم‌شنوا یا ناشنوا. در هر یک از این حوزه‌ها، ترکیب دقت بالا و هزینه‌ی پایین می‌تواند مانع اصلی پیشین یعنی گران‌بودن رونویسی حرفه‌ای صوتی را از میان بردارد و آن را در دسترس کسب‌وکارهای کوچک‌تر هم قرار دهد.

توسعه‌دهندگانی که می‌خواهند این مدل را در ابزارهای خود ادغام کنند، می‌توانند از راهنمای نوشتن پرامپت برای مبتدیان در سایت Mr ChatGPT هم برای بهینه‌سازی تعامل با مدل‌های زبانی مکمل این سامانه بهره ببرند.

پشتیبانی مدل رونویسی صوتی مایکروسافت از ۶۰ زبان و کاربرد آن در پزشکی و حقوق

۸. مقایسه با رقبا: اوپن‌ای‌آی، گوگل و الون‌لبز کجا ایستاده‌اند؟

رقابت در حوزه‌ی رونویسی صوتی هوش مصنوعی، بازتاب کوچک‌تری از همان نبردی است که در مدل‌های زبانی بزرگ میان اوپن‌ای‌آی، گوگل، آنتروپیک و شرکت‌های دیگر جریان دارد. اگر پیش‌تر با نبردهایی مثل مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک آشنا شده باشید، الگوی مشابهی را اینجا هم می‌بینید: هر بار یک شرکت با ترکیبی از قیمت پایین‌تر یا عملکرد بهتر، فشار تازه‌ای به رقبا وارد می‌کند و آن‌ها را مجبور به واکنش سریع می‌سازد. گوگل و اوپن‌ای‌آی هنوز واکنش رسمی مشخصی به این رونمایی نشان نداده‌اند، اما با توجه به سابقه‌ی این بازار، بعید نیست به‌زودی شاهد کاهش قیمت یا معرفی نسخه‌های به‌روزشده از مدل‌های رقیب باشیم.

۹. تحلیل: این خبر برای توسعه‌دهندگان و کسب‌وکارها چه معنایی دارد؟

فراتر از رقابت میان غول‌های فناوری، نکته‌ی مهم‌تر برای کاربران نهایی این است که هزینه‌ی ورود به دنیای رونویسی خودکار حرفه‌ای دارد به‌سرعت پایین می‌آید. این روند با آنچه پیش‌تر در مطلب پتانسیل واقعی و محدودیت‌های هوش مصنوعی در سایت Mr ChatGPT بررسی کردیم هم‌راستاست: فناوری‌های هوش مصنوعی وقتی از آزمایشگاه به محصولات روزمره می‌رسند، تازه تأثیر واقعی خود را نشان می‌دهند. با این حال، توسعه‌دهندگانی که می‌خواهند این ابزارها را در محصولات خود به‌کار بگیرند، باید همچنان مرز میان کار مهندسی واقعی و اتکای صرف به ابزارهای آماده را بشناسند؛ موضوعی که در مطلب توهم توسعه‌دهنده‌ی تک‌نفره در برابر مهندس واقعی به‌تفصیل به آن پرداخته‌ایم.

نکته‌ی دیگری که کمتر به آن توجه می‌شود، تأثیر این نوع رقابت قیمتی بر بازارهای غیرانگلیسی‌زبان است. بسیاری از ابزارهای رونویسی صوتی در گذشته بهترین عملکرد خود را تنها برای زبان انگلیسی ارائه می‌دادند و کاربران زبان‌های دیگر، از جمله فارسی، عربی یا هندی، معمولاً با افت محسوس دقت روبه‌رو می‌شدند. حالا که شرکت‌های بزرگ برای اثبات برتری خود، آزمون‌های چندزبانه مثل FLEURS را معیار اصلی رقابت قرار داده‌اند، انتظار می‌رود کیفیت رونویسی برای زبان‌های کم‌رواج‌تر هم به‌مرور بهبود پیدا کند؛ روندی که در نهایت به سود کاربران و توسعه‌دهندگان فارسی‌زبان هم خواهد بود.

سوالات متداول درباره‌ی MAI-Transcribe-2

مدل MAI-Transcribe-2 چه زمانی عرضه شد؟
مایکروسافت این مدل را در سوم سپتامبر ۲۰۲۶ به‌طور رسمی معرفی کرد.

هزینه‌ی استفاده از این مدل چقدر است؟
طبق اعلام مایکروسافت، تا پایان سال جاری میلادی، هزینه‌ی استفاده تنها یک‌دهم دلار برای هر ساعت صداست.

این مدل از چه زبان‌هایی پشتیبانی می‌کند؟
بر اساس نتایج آزمون FLEURS، این مدل در ۶۰ زبان زنده‌ی دنیا با دقت بالا عمل می‌کند و از تشخیص خودکار زبان هم پشتیبانی می‌کند.

چطور می‌توان به این مدل دسترسی داشت؟
این مدل هم‌اکنون از طریق مایکروسافت فاندری، محیط آزمایشی MAI Playground و پلتفرم اپن‌روتر در دسترس توسعه‌دهندگان قرار دارد.

جمع‌بندی: رونمایی مایکروسافت از MAI-Transcribe-2 نشان می‌دهد رقابت هوش مصنوعی دیگر فقط به مدل‌های متنی و تصویری محدود نیست و حوزه‌ی صدا هم وارد فاز جدی‌تری از رقابت قیمتی و فنی شده است. برای پیگیری اخبار به‌روز، تحلیل‌های تخصصی و آموزش‌های عملی هوش مصنوعی به زبان فارسی، صفحه‌ی اخبار هوش مصنوعی و بخش آموزش‌های چت‌جی‌پی‌تی سایت Mr ChatGPT را دنبال کنید و کانال تلگرام @MrChatGPT_IR را نیز از دست ندهید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *