مایکروسافت با معرفی سه مدل تازهی هوش مصنوعی صوتی، فاصلهی میان صحبتکردن با یک ماشین و صحبتکردن با یک انسان را به کمتر از یک ثانیه رساند.

لیست مطالب
۱. مایکروسافت دقیقا چه چیزی را معرفی کرد؟
شرکت مایکروسافت در یکم اکتبر ۲۰۲۶ از طریق بخش تحقیقاتی خود، سه مدل تازه در حوزهی هوش مصنوعی صوتی را بهصورت پیشنمایش عمومی منتشر کرد. این سه مدل عبارتاند از یک مدل رونویسی لحظهای با نام مای ترنسکرایب ۲ و دو مدل تولید گفتار با نامهای مای وویس ۲.۱ و نسخهی سریعتر آن یعنی مای وویس ۲.۱-فلش. نکتهی مهم این عرضه، این نیست که هر مدل بهتنهایی چه کاری انجام میدهد، بلکه این است که مایکروسافت برای نخستینبار هر سه بخش یک دستیار صوتی — شنیدن، تصمیمگیری و صحبتکردن — را بهصورت یکجا و هماهنگ عرضه کرده است.
هدف اعلامشدهی مایکروسافت، رساندن کل این فرآیند به زیر یک ثانیه است. در دنیای دستیاران صوتی، این عدد اهمیت زیادی دارد، چون مکالمهی انسانی معمولا در همین بازهی زمانی جریان دارد. اگر فاصلهی میان صحبتکردن کاربر و پاسخ ماشین بیشتر از یک ثانیه شود، گفتگو غیرطبیعی و پرمکث به نظر میرسد؛ همان مشکلی که بسیاری از دستیاران صوتی قدیمیتر با آن دستوپنجه نرم میکردند.
۲. مدل رونویسی لحظهای مای ترنسکرایب ۲ چگونه کار میکند؟
مدل مای ترنسکرایب ۲ نخستین مدل رونویسی لحظهای مایکروسافت است. این مدل با معماری ترنسفورمر رمزگذار-رمزگشا و مکانیزم توجه تکهای ساخته شده؛ یعنی بهجای اینکه منتظر بماند تا گوینده جملهاش را کامل کند، صدا را بهصورت تکههای کوچک و همزمان با رسیدن از طریق وبساکت پردازش میکند. نتیجهی این طراحی، ظاهرشدن نخستین فرضیههای متنی تنها حدود ۱۰۰ میلیثانیه پس از شروع صحبت است.
از نظر دقت، مایکروسافت اعلام کرده این مدل در آزمونهای داخلی نرخ خطای واژهای ۲.۵ درصد ثبت کرده و روی پایگاه ارزیابی آرتیفیشال آنالیسیس هم رتبهی نخست را، هم برای دقت متن نهایی و هم برای دقت متن موقت، به دست آورده است. زمان تاخیر از پایان گفتار تا دریافت رونوشت نهایی تنها ۱۳۰ میلیثانیه گزارش شده که به گفتهی مایکروسافت نزدیک به دو برابر سریعتر از نزدیکترین رقیب برای کاربردهایی مثل دیکتهی زنده و زیرنویسگذاری است.
پوشش زبانی و محدودیت فعلی
این مدل از ۶۰ زبان دنیا پشتیبانی میکند و تشخیص زبان را بهطور کامل و خودکار انجام میدهد؛ یعنی کاربر لازم نیست پیش از شروع گفتگو زبان خود را انتخاب کند. با این حال، قابلیت تفکیک گویندگان یا همان speaker diarization هنوز برای نسخهی لحظهای این مدل بهطور رسمی اعلام نشده و احتمالا در عرضههای بعدی اضافه خواهد شد.
۳. مدلهای تولید گفتار مای وویس ۲.۱ و نسخهی فلش
در کنار مدل رونویسی، مایکروسافت دو مدل تولید گفتار را هم معرفی کرد تا نیمهی دوم حلقهی گفتگو، یعنی پاسخدادن، تکمیل شود. مدل مای وویس ۲.۱ که تمرکز اصلی آن روی کیفیت بالای صداست، از ۲۳ زبان در ۲۶ گویش مختلف پشتیبانی میکند. یکی از ویژگیهای جالب این مدل، حفظ هویت صوتی میان زبانهای گوناگون است؛ یعنی اگر یک صدا در زبان فارسی لحن و شخصیت خاصی داشته باشد، همان شخصیت هنگام تغییر زبان هم حفظ میشود. این مدل همچنین امکان شبیهسازی صدا را دارد، البته با فرآیندی برای تایید رضایت فرد صاحب صدا.
نسخهی دوم با نام مای وویس ۲.۱-فلش برای سرعت بالا طراحی شده است. این مدل تنها در ۱۵۰ میلیثانیه نخستین بخش صدای خروجی را تولید میکند، عددی که آن را حدود ۵۵ درصد سریعتر از نسخهی استاندارد میکند. چنین سرعتی برای گفتگوهای زنده و پرحجم، مثل مرکزهای تماس یا دستیاران همراه، بسیار مناسبتر از نسخهی باکیفیتتر است، هرچند ممکن است در ازای سرعت، کمی از ظرافت صوتی کاسته شود.

۴. محاسبهی تاخیر کامل: چرا زیر یک ثانیه مهم است؟
وقتی این سه مدل در کنار هم قرار میگیرند، یک زنجیرهی کامل شکل میگیرد: نخست تاخیر رونویسی حدود ۱۳۰ میلیثانیه، سپس زمان تصمیمگیری مدل زبانی که معمولا بین ۳۵۰ تا ۵۰۰ میلیثانیه طول میکشد، و در پایان تاخیر تولید گفتار حدود ۱۵۰ میلیثانیه. جمع این سه مرحله به بازهای میان ۵۸۰ تا ۷۸۰ میلیثانیه میرسد؛ یعنی یک نوبت کامل گفتگو، از لحظهی سکوت گوینده تا شروع پاسخ صوتی ماشین، در کمتر از یک ثانیه انجام میشود.
این عدد برای کسی که با دستیاران صوتی قدیمیتر کار کرده، تفاوت بزرگی محسوب میشود. تاخیرهای دو تا سه ثانیهای در نسلهای قبلی، باعث میشد کاربر احساس کند با یک ماشین حرف میزند، نه با یک همکار یا دستیار واقعی. رسیدن به زیر یک ثانیه، مرز میان این دو تجربه را بهطور قابلتوجهی کمرنگتر میکند.
۵. کاربردهای عملی این فناوری در کسبوکار و رسانه
کاربرد اصلی این مجموعه، ساخت دستیاران پشتیبانی مشتری است که میتوانند بهصورت طبیعی و بدون مکث آزاردهنده با کاربران صحبت کنند. علاوه بر این، پلتفرمهای آموزش تعاملی میتوانند از این فناوری برای ساخت معلمهای صوتی هوش مصنوعی استفاده کنند که بلادرنگ به سوالهای دانشآموز پاسخ میدهند. حوزهی دیگر، زیرنویسگذاری زندهی رسانهای و ابزارهای ارتباطی بلادرنگ است، جایی که دقت و سرعت رونویسی اهمیت زیادی دارد.
برای کسبوکارهایی که به دنبال بهبود تجربهی مشتری و افزایش دیدهشدن در نتایج جستوجو با کمک ابزارهای هوش مصنوعی هستند، آشنایی با این نوع فناوریها اهمیت زیادی دارد؛ موضوعی که در نقش هوش مصنوعی در کسبوکار امروز هم بهتفصیل بررسی شده است. همچنین برای کسانی که میخواهند با مفهوم طراحی پرامپت برای دستیاران صوتی و متنی بیشتر آشنا شوند، راهنمای نوشتن پرامپت برای مبتدیان نقطهی شروع خوبی است.
۶. قیمتگذاری و نحوهی دسترسی به مدلها
هر سه مدل از یکم اکتبر ۲۰۲۶ بهصورت پیشنمایش عمومی از طریق مایکروسافت فاندری و سرویس آژور اسپیچ در دسترس قرار گرفتهاند. مدل رونویسی همچنین با یک واسط وبساکت سازگار با استاندارد بلادرنگ شناختهشده در صنعت عرضه شده تا توسعهدهندگانی که قبلا با چنین واسطهایی کار کردهاند، راحتتر به آن مهاجرت کنند. دو مدل تولید گفتار هم از طریق چند پلتفرم دیگر قابل دسترسیاند و پشتیبانی از ابزارهای بیشتر هم بهزودی اضافه خواهد شد.
نرخ معرفی مدل رونویسی تا پایان سال ۲۰۲۶ تنها ۰.۵۴ دلار برای هر ساعت صداست. مدل مای وویس ۲.۱ به ازای هر یک میلیون کاراکتر ۲۲ دلار هزینه دارد و نسخهی فلش آن با قیمت ۱۵ دلار، حدود ۶۰ درصد ارزانتر از نمونههای مشابه در بازار قیمتگذاری شده است. چنین قیمتگذاری رقابتی میتواند تصمیمگیری تیمهای فنی برای انتخاب ارائهدهنده را به نفع مایکروسافت تغییر دهد.

۷. محدودیتها و نکاتی که باید مراقب آنها بود
باید به یاد داشت که این مدلها هنوز در وضعیت پیشنمایش عمومی قرار دارند، به این معنی که هیچ توافق سطح خدمات رسمی برایشان ارائه نشده و مشخصات فنی ممکن است پیش از عرضهی نهایی تغییر کند. ارزیابی مستقل و عمومی از رتبهی اول ادعاشده روی آرتیفیشال آنالیسیس هم هنوز بهطور کامل تکرار و تایید نشده و باید منتظر ماند تا توسعهدهندگان مستقل این نتایج را بازتولید کنند.
نبود رسمی قابلیت تفکیک گوینده در نسخهی لحظهای هم میتواند برای کاربردهایی مثل جلسات چندنفره، مصاحبههای گروهی یا پادکستهای چند مهمانه محدودیت ایجاد کند، تا زمانی که این ویژگی بهطور رسمی به مدل اضافه شود. کسبوکارهایی که قصد استفادهی جدی از این فناوری دارند، بهتر است ابتدا در محیط آزمایشی آن را ارزیابی کنند.
۸. این عرضه در رقابت جهانی دستیارهای صوتی کجا میایستد؟
رقابت میان شرکتهای بزرگ هوش مصنوعی برای ساخت بهترین دستیار صوتی و زبانی، در ماههای اخیر بهشدت بالا گرفته است؛ از رقابت میان مدلهای زبانی بزرگ که در مقایسهی چتجیپیتی و دیپسیک هم به آن اشاره شده، تا بحثهای گستردهتر دربارهی شرکت اوپنایآی و نقش آن در این صنعت. ورود جدی مایکروسافت به حوزهی مدلهای صوتی اختصاصی نشان میدهد این شرکت دیگر صرفا به عرضهی دستیار متنی کوپایلات بسنده نمیکند و میخواهد زیرساخت صوتی خودش را هم در اختیار داشته باشد.
این موضوع در کنار بحثهای گستردهتر دربارهی قابلیتها و محدودیتهای واقعی هوش مصنوعی در دنیای امروز قرار میگیرد. برای دنبالکردن روزانهی چنین اخباری، صفحهی اخبار هوش مصنوعی سایت امآرچتجیپیتی و همچنین آموزشهای کاربردی چتجیپیتی منابع خوبی برای بهروز ماندن هستند.
۹. سوالات متداول
مدل مای ترنسکرایب ۲ دقیقا چه کاری انجام میدهد؟
این مدل صدای ورودی کاربر را بهصورت لحظهای و با تاخیری حدود ۱۳۰ میلیثانیه به متن تبدیل میکند و از ۶۰ زبان پشتیبانی میکند.
تفاوت مای وویس ۲.۱ با نسخهی فلش آن چیست؟
نسخهی استاندارد روی کیفیت صدا و حفظ هویت صوتی تمرکز دارد، در حالی که نسخهی فلش برای سرعت بالاتر و تاخیر کمتر طراحی شده است.
آیا این مدلها هماکنون برای همه در دسترساند؟
بله، هر سه مدل از یکم اکتبر ۲۰۲۶ بهصورت پیشنمایش عمومی از طریق مایکروسافت فاندری و چند پلتفرم دیگر در دسترس قرار گرفتهاند، اما بدون توافق سطح خدمات رسمی.
این فناوری چه تاثیری روی دستیاران هوش مصنوعی خواهد داشت؟
رسیدن تاخیر کل گفتگو به کمتر از یک ثانیه میتواند تجربهی مکالمه با دستیاران صوتی را به مکالمهی طبیعی انسانی نزدیکتر کند.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
