مایکروسافت با سه مدل صوتی تازه، گفتگو با هوش مصنوعی را به زمان واقعی رساند

اخبار · هوش مصنوعی

مایکروسافت با معرفی سه مدل تازه‌ی هوش مصنوعی صوتی، فاصله‌ی میان صحبت‌کردن با یک ماشین و صحبت‌کردن با یک انسان را به کمتر از یک ثانیه رساند.

چکیده. شرکت مایکروسافت در یکم اکتبر ۲۰۲۶ یک خانواده‌ی کامل از مدل‌های صوتی را معرفی کرد: مدل رونویسی لحظه‌ای مای ترنسکرایب ۲ و دو مدل تولید گفتار به نام‌های مای وویس ۲.۱ و نسخه‌ی سریع آن. این سه مدل در کنار هم یک حلقه‌ی کامل برای ساخت دستیاران صوتی می‌سازند که زمان پاسخ‌گویی آن‌ها به کمتر از یک ثانیه می‌رسد؛ عددی که به گفته‌ی مایکروسافت، احساس گفتگوی طبیعی با یک انسان را برای کاربر زنده می‌کند.
دستیار صوتی هوش مصنوعی مایکروسافت با رونویسی لحظه‌ای و تولید گفتار طبیعی زیر یک ثانیه

۱. مایکروسافت دقیقا چه چیزی را معرفی کرد؟

شرکت مایکروسافت در یکم اکتبر ۲۰۲۶ از طریق بخش تحقیقاتی خود، سه مدل تازه در حوزه‌ی هوش مصنوعی صوتی را به‌صورت پیش‌نمایش عمومی منتشر کرد. این سه مدل عبارت‌اند از یک مدل رونویسی لحظه‌ای با نام مای ترنسکرایب ۲ و دو مدل تولید گفتار با نام‌های مای وویس ۲.۱ و نسخه‌ی سریع‌تر آن یعنی مای وویس ۲.۱-فلش. نکته‌ی مهم این عرضه، این نیست که هر مدل به‌تنهایی چه کاری انجام می‌دهد، بلکه این است که مایکروسافت برای نخستین‌بار هر سه بخش یک دستیار صوتی — شنیدن، تصمیم‌گیری و صحبت‌کردن — را به‌صورت یک‌جا و هماهنگ عرضه کرده است.

هدف اعلام‌شده‌ی مایکروسافت، رساندن کل این فرآیند به زیر یک ثانیه است. در دنیای دستیاران صوتی، این عدد اهمیت زیادی دارد، چون مکالمه‌ی انسانی معمولا در همین بازه‌ی زمانی جریان دارد. اگر فاصله‌ی میان صحبت‌کردن کاربر و پاسخ ماشین بیشتر از یک ثانیه شود، گفتگو غیرطبیعی و پرمکث به نظر می‌رسد؛ همان مشکلی که بسیاری از دستیاران صوتی قدیمی‌تر با آن دست‌وپنجه نرم می‌کردند.

۲. مدل رونویسی لحظه‌ای مای ترنسکرایب ۲ چگونه کار می‌کند؟

مدل مای ترنسکرایب ۲ نخستین مدل رونویسی لحظه‌ای مایکروسافت است. این مدل با معماری ترنسفورمر رمزگذار-رمزگشا و مکانیزم توجه تکه‌ای ساخته شده؛ یعنی به‌جای این‌که منتظر بماند تا گوینده جمله‌اش را کامل کند، صدا را به‌صورت تکه‌های کوچک و هم‌زمان با رسیدن از طریق وب‌ساکت پردازش می‌کند. نتیجه‌ی این طراحی، ظاهرشدن نخستین فرضیه‌های متنی تنها حدود ۱۰۰ میلی‌ثانیه پس از شروع صحبت است.

از نظر دقت، مایکروسافت اعلام کرده این مدل در آزمون‌های داخلی نرخ خطای واژه‌ای ۲.۵ درصد ثبت کرده و روی پایگاه ارزیابی آرتیفیشال آنالیسیس هم رتبه‌ی نخست را، هم برای دقت متن نهایی و هم برای دقت متن موقت، به دست آورده است. زمان تاخیر از پایان گفتار تا دریافت رونوشت نهایی تنها ۱۳۰ میلی‌ثانیه گزارش شده که به گفته‌ی مایکروسافت نزدیک به دو برابر سریع‌تر از نزدیک‌ترین رقیب برای کاربردهایی مثل دیکته‌ی زنده و زیرنویس‌گذاری است.

پوشش زبانی و محدودیت فعلی

این مدل از ۶۰ زبان دنیا پشتیبانی می‌کند و تشخیص زبان را به‌طور کامل و خودکار انجام می‌دهد؛ یعنی کاربر لازم نیست پیش از شروع گفتگو زبان خود را انتخاب کند. با این حال، قابلیت تفکیک گویندگان یا همان speaker diarization هنوز برای نسخه‌ی لحظه‌ای این مدل به‌طور رسمی اعلام نشده و احتمالا در عرضه‌های بعدی اضافه خواهد شد.

۳. مدل‌های تولید گفتار مای وویس ۲.۱ و نسخه‌ی فلش

در کنار مدل رونویسی، مایکروسافت دو مدل تولید گفتار را هم معرفی کرد تا نیمه‌ی دوم حلقه‌ی گفتگو، یعنی پاسخ‌دادن، تکمیل شود. مدل مای وویس ۲.۱ که تمرکز اصلی آن روی کیفیت بالای صداست، از ۲۳ زبان در ۲۶ گویش مختلف پشتیبانی می‌کند. یکی از ویژگی‌های جالب این مدل، حفظ هویت صوتی میان زبان‌های گوناگون است؛ یعنی اگر یک صدا در زبان فارسی لحن و شخصیت خاصی داشته باشد، همان شخصیت هنگام تغییر زبان هم حفظ می‌شود. این مدل همچنین امکان شبیه‌سازی صدا را دارد، البته با فرآیندی برای تایید رضایت فرد صاحب صدا.

نسخه‌ی دوم با نام مای وویس ۲.۱-فلش برای سرعت بالا طراحی شده است. این مدل تنها در ۱۵۰ میلی‌ثانیه نخستین بخش صدای خروجی را تولید می‌کند، عددی که آن را حدود ۵۵ درصد سریع‌تر از نسخه‌ی استاندارد می‌کند. چنین سرعتی برای گفتگوهای زنده و پرحجم، مثل مرکزهای تماس یا دستیاران همراه، بسیار مناسب‌تر از نسخه‌ی باکیفیت‌تر است، هرچند ممکن است در ازای سرعت، کمی از ظرافت صوتی کاسته شود.

مدل رونویسی لحظه‌ای مای ترنسکرایب ۲ مایکروسافت برای تشخیص گفتار در ۶۰ زبان

۴. محاسبه‌ی تاخیر کامل: چرا زیر یک ثانیه مهم است؟

وقتی این سه مدل در کنار هم قرار می‌گیرند، یک زنجیره‌ی کامل شکل می‌گیرد: نخست تاخیر رونویسی حدود ۱۳۰ میلی‌ثانیه، سپس زمان تصمیم‌گیری مدل زبانی که معمولا بین ۳۵۰ تا ۵۰۰ میلی‌ثانیه طول می‌کشد، و در پایان تاخیر تولید گفتار حدود ۱۵۰ میلی‌ثانیه. جمع این سه مرحله به بازه‌ای میان ۵۸۰ تا ۷۸۰ میلی‌ثانیه می‌رسد؛ یعنی یک نوبت کامل گفتگو، از لحظه‌ی سکوت گوینده تا شروع پاسخ صوتی ماشین، در کمتر از یک ثانیه انجام می‌شود.

این عدد برای کسی که با دستیاران صوتی قدیمی‌تر کار کرده، تفاوت بزرگی محسوب می‌شود. تاخیرهای دو تا سه ثانیه‌ای در نسل‌های قبلی، باعث می‌شد کاربر احساس کند با یک ماشین حرف می‌زند، نه با یک همکار یا دستیار واقعی. رسیدن به زیر یک ثانیه، مرز میان این دو تجربه را به‌طور قابل‌توجهی کم‌رنگ‌تر می‌کند.

۵. کاربردهای عملی این فناوری در کسب‌وکار و رسانه

کاربرد اصلی این مجموعه، ساخت دستیاران پشتیبانی مشتری است که می‌توانند به‌صورت طبیعی و بدون مکث آزاردهنده با کاربران صحبت کنند. علاوه بر این، پلتفرم‌های آموزش تعاملی می‌توانند از این فناوری برای ساخت معلم‌های صوتی هوش مصنوعی استفاده کنند که بلادرنگ به سوال‌های دانش‌آموز پاسخ می‌دهند. حوزه‌ی دیگر، زیرنویس‌گذاری زنده‌ی رسانه‌ای و ابزارهای ارتباطی بلادرنگ است، جایی که دقت و سرعت رونویسی اهمیت زیادی دارد.

برای کسب‌وکارهایی که به دنبال بهبود تجربه‌ی مشتری و افزایش دیده‌شدن در نتایج جست‌وجو با کمک ابزارهای هوش مصنوعی هستند، آشنایی با این نوع فناوری‌ها اهمیت زیادی دارد؛ موضوعی که در نقش هوش مصنوعی در کسب‌وکار امروز هم به‌تفصیل بررسی شده است. همچنین برای کسانی که می‌خواهند با مفهوم طراحی پرامپت برای دستیاران صوتی و متنی بیشتر آشنا شوند، راهنمای نوشتن پرامپت برای مبتدیان نقطه‌ی شروع خوبی است.

۶. قیمت‌گذاری و نحوه‌ی دسترسی به مدل‌ها

هر سه مدل از یکم اکتبر ۲۰۲۶ به‌صورت پیش‌نمایش عمومی از طریق مایکروسافت فاندری و سرویس آژور اسپیچ در دسترس قرار گرفته‌اند. مدل رونویسی همچنین با یک واسط وب‌ساکت سازگار با استاندارد بلادرنگ شناخته‌شده در صنعت عرضه شده تا توسعه‌دهندگانی که قبلا با چنین واسط‌هایی کار کرده‌اند، راحت‌تر به آن مهاجرت کنند. دو مدل تولید گفتار هم از طریق چند پلتفرم دیگر قابل دسترسی‌اند و پشتیبانی از ابزارهای بیشتر هم به‌زودی اضافه خواهد شد.

نرخ معرفی مدل رونویسی تا پایان سال ۲۰۲۶ تنها ۰.۵۴ دلار برای هر ساعت صداست. مدل مای وویس ۲.۱ به ازای هر یک میلیون کاراکتر ۲۲ دلار هزینه دارد و نسخه‌ی فلش آن با قیمت ۱۵ دلار، حدود ۶۰ درصد ارزان‌تر از نمونه‌های مشابه در بازار قیمت‌گذاری شده است. چنین قیمت‌گذاری رقابتی می‌تواند تصمیم‌گیری تیم‌های فنی برای انتخاب ارائه‌دهنده را به نفع مایکروسافت تغییر دهد.

مدل‌های تولید گفتار مای وویس ۲.۱ مایکروسافت برای دستیاران صوتی چندزبانه

۷. محدودیت‌ها و نکاتی که باید مراقب آن‌ها بود

باید به یاد داشت که این مدل‌ها هنوز در وضعیت پیش‌نمایش عمومی قرار دارند، به این معنی که هیچ توافق سطح خدمات رسمی برایشان ارائه نشده و مشخصات فنی ممکن است پیش از عرضه‌ی نهایی تغییر کند. ارزیابی مستقل و عمومی از رتبه‌ی اول ادعاشده روی آرتیفیشال آنالیسیس هم هنوز به‌طور کامل تکرار و تایید نشده و باید منتظر ماند تا توسعه‌دهندگان مستقل این نتایج را بازتولید کنند.

نبود رسمی قابلیت تفکیک گوینده در نسخه‌ی لحظه‌ای هم می‌تواند برای کاربردهایی مثل جلسات چندنفره، مصاحبه‌های گروهی یا پادکست‌های چند مهمانه محدودیت ایجاد کند، تا زمانی که این ویژگی به‌طور رسمی به مدل اضافه شود. کسب‌وکارهایی که قصد استفاده‌ی جدی از این فناوری دارند، بهتر است ابتدا در محیط آزمایشی آن را ارزیابی کنند.

۸. این عرضه در رقابت جهانی دستیارهای صوتی کجا می‌ایستد؟

رقابت میان شرکت‌های بزرگ هوش مصنوعی برای ساخت بهترین دستیار صوتی و زبانی، در ماه‌های اخیر به‌شدت بالا گرفته است؛ از رقابت میان مدل‌های زبانی بزرگ که در مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک هم به آن اشاره شده، تا بحث‌های گسترده‌تر درباره‌ی شرکت اوپن‌ای‌آی و نقش آن در این صنعت. ورود جدی مایکروسافت به حوزه‌ی مدل‌های صوتی اختصاصی نشان می‌دهد این شرکت دیگر صرفا به عرضه‌ی دستیار متنی کوپایلات بسنده نمی‌کند و می‌خواهد زیرساخت صوتی خودش را هم در اختیار داشته باشد.

این موضوع در کنار بحث‌های گسترده‌تر درباره‌ی قابلیت‌ها و محدودیت‌های واقعی هوش مصنوعی در دنیای امروز قرار می‌گیرد. برای دنبال‌کردن روزانه‌ی چنین اخباری، صفحه‌ی اخبار هوش مصنوعی سایت ام‌آرچت‌جی‌پی‌تی و همچنین آموزش‌های کاربردی چت‌جی‌پی‌تی منابع خوبی برای به‌روز ماندن هستند.

۹. سوالات متداول

مدل مای ترنسکرایب ۲ دقیقا چه کاری انجام می‌دهد؟
این مدل صدای ورودی کاربر را به‌صورت لحظه‌ای و با تاخیری حدود ۱۳۰ میلی‌ثانیه به متن تبدیل می‌کند و از ۶۰ زبان پشتیبانی می‌کند.

تفاوت مای وویس ۲.۱ با نسخه‌ی فلش آن چیست؟
نسخه‌ی استاندارد روی کیفیت صدا و حفظ هویت صوتی تمرکز دارد، در حالی که نسخه‌ی فلش برای سرعت بالاتر و تاخیر کمتر طراحی شده است.

آیا این مدل‌ها هم‌اکنون برای همه در دسترس‌اند؟
بله، هر سه مدل از یکم اکتبر ۲۰۲۶ به‌صورت پیش‌نمایش عمومی از طریق مایکروسافت فاندری و چند پلتفرم دیگر در دسترس قرار گرفته‌اند، اما بدون توافق سطح خدمات رسمی.

این فناوری چه تاثیری روی دستیاران هوش مصنوعی خواهد داشت؟
رسیدن تاخیر کل گفتگو به کمتر از یک ثانیه می‌تواند تجربه‌ی مکالمه با دستیاران صوتی را به مکالمه‌ی طبیعی انسانی نزدیک‌تر کند.

جمع‌بندی. عرضه‌ی هم‌زمان مای ترنسکرایب ۲، مای وویس ۲.۱ و نسخه‌ی فلش آن، نشان می‌دهد مایکروسافت به‌جای عرضه‌ی تک‌مدل‌ها، به دنبال ساخت یک زیرساخت کامل برای دستیاران صوتی است. رسیدن به تاخیر زیر یک ثانیه می‌تواند نقطه‌ی عطفی در تجربه‌ی کاربری این دستیاران باشد، البته با در نظر گرفتن این‌که این مدل‌ها هنوز در مرحله‌ی پیش‌نمایش عمومی قرار دارند. برای دنبال‌کردن ادامه‌ی این خبرها و دیگر تحولات روز هوش مصنوعی، کانال @MrChatGPT_IR در تلگرام را دنبال کنید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *