مایکروسافت بهطور نیمهرسمی از MAI-Realtime رونمایی کرده؛ اولین مدل صوتی تمامدوطرفهی این شرکت که میتواند همزمان بشنود و پاسخ بدهد، دقیقاً مثل یک مکالمهی واقعی انسانی.

لیست مطالب
۱. چرا این خبر برای آیندهی دستیارهای صوتی مهم است؟
تا امروز، تقریباً همهی دستیارهای صوتی هوش مصنوعی — از جمله نسخهی فعلی Copilot — بر پایهی معماری «نوبتی» کار میکردند: کاربر حرف میزد، مدل صبر میکرد تا جمله تمام شود، سپس پاسخ تولید میشد و بعد از آن صدا ساخته و پخش میشد. این روش هرچند قابل اعتماد و ساده برای پیادهسازی است، اما با نحوهی مکالمهی طبیعی انسانها فاصلهی زیادی دارد؛ ما در گفتوگوی روزمره مدام حرف یکدیگر را قطع میکنیم، همزمان صحبت میکنیم، صداهای تأییدی مثل «آها» یا «بله» را وسط جملهی طرف مقابل میگوییم و بدون مکث واکنش نشان میدهیم. عرضهی MAI-Realtime نشان میدهد مایکروسافت هم مانند رقبایش تصمیم گرفته این فاصله را از بین ببرد و صدای Copilot را به یک مکالمهی واقعی نزدیکتر کند. برای پیگیری اینگونه تحولات، سری اخبار هوش مصنوعی سایت را دنبال کنید.
۲. اصلاً MAI-Realtime چیست؟
MAI-Realtime نام مدل صوتی جدید مایکروسافت است که فعلاً بهصورت محدود و از طریق دسترسی شریکها در MAI Playground در حال آزمایش است. هنوز هیچ اطلاعیهی رسمی از سوی مایکروسافت منتشر نشده و آنچه میدانیم از گزارشهای اولیهی تسترهاست که بهصورت اختصاصی منتشر شده. با این حال جزئیات فنی منتشرشده بهقدری مشخص است که میتوان تصویر روشنی از قابلیتهای این مدل ترسیم کرد؛ مدلی که برای اولین بار در تاریخ مایکروسافت، صدا را نه بهصورت مرحلهبهمرحله (اول تشخیص گفتار، سپس تولید پاسخ متنی، سپس ساخت صدای خروجی)، بلکه بهصورت یک جریان پیوسته و همزمان پردازش میکند. دو صدای آزمایشی به نامهای Victoria و Grant هم در اختیار تسترها قرار گرفته که بهگفتهی کاربران اولیه، طبیعیتر از صدای فعلی Copilot به نظر میرسند.
۳. تفاوت MAI-Realtime با MAI-Voice-2 و MAI-Transcribe-1.5
مایکروسافت پیش از این دو مدل صوتی جداگانه داشت: MAI-Voice-2 که فقط متن را به صدا تبدیل میکرد (سنتز گفتار)، و MAI-Transcribe-1.5 که فقط صدا را به متن تبدیل میکرد (تشخیص گفتار). هر دوی این مدلها یکطرفه بودند و برای ساخت یک مکالمهی کامل، باید کنار هم و بهصورت مرحلهای اجرا میشدند؛ همین موضوع باعث تأخیر محسوس و از بین رفتن طبیعیبودن مکالمه میشد. MAI-Realtime این دو وظیفه را در یک مدل واحد ادغام کرده و آنها را بهصورت همزمان و بدون توقف اجرا میکند، بدون نیاز به سوییچکردن بین چند مدل جداگانه. اگر میخواهید با تفاوت رویکردهای مختلف هوش مصنوعی و محدودیتهای واقعی آنها بیشتر آشنا شوید، مقالهی پتانسیل واقعی و محدودیتهای هوش مصنوعی را هم بخوانید.

۴. معماری «تمامدوطرفه» چگونه کار میکند؟
در معماری full-duplex، مدل بهطور پیوسته در حال گوشدادن به جریان صوتی ورودی است و همزمان تصمیم میگیرد که چه زمانی صحبت کند، چه زمانی سکوت کند، چه زمانی مکث کاربر را بهعنوان پایان جمله تشخیص دهد و چه زمانی یک ابزار (مثل جستوجوی وب) را فراخوانی کند — همهی اینها بدون توقف ضبط صدا. این تفاوت اساسی با پایپلاینهای نیمهدوطرفهی قدیمی است که مراحل تشخیص، استدلال و سنتز را بهصورت پیدرپی و جدا از هم انجام میدادند. طبق گزارشها، MAI-Realtime از دو حالت مدیریت نوبت مکالمه پشتیبانی میکند:
حالت Switchboard
در این حالت، یک تشخیصدهندهی پایانگفتار به نام MAI-Ears همراه با توکنهای کنترلی داخلی، بهصورت یادگیریشده تشخیص میدهد که کاربر جملهاش را تمام کرده یا نه. این روش برای مکالمات طبیعی، پرتنش و پرتعامل مناسبتر است و انعطاف بیشتری به مدل میدهد.
حالت قطعی (Deterministic)
در این حالت، ترکیبی از تشخیص سکوت و یک تشخیصدهندهی معنایی مبتنی بر Whisper استفاده میشود تا رفتار مدل قابل پیشبینیتر و قابل تنظیمتر باشد؛ گزینهای مناسب برای کاربردهای سازمانی حساس که نیاز به رفتار ثابت دارند.
۵. پشتیبانی از ۱۷ زبان و تعویض زبان بدون مکث
یکی از جذابترین ویژگیهای گزارششدهی MAI-Realtime، پشتیبانی همزمان از ۱۷ زبان از جمله انگلیسی، آلمانی، اسپانیایی، فرانسوی، ایتالیایی، پرتغالی، ژاپنی، کرهای، چینی، هلندی، هندی، اندونزیایی، عربی، روسی، ترکی، ویتنامی و تایلندی است. نکتهی مهمتر اینکه کاربر میتواند وسط یک مکالمه، بدون هیچ توقف یا بارگذاری مجدد، زبان صحبت را عوض کند و مدل همچنان بافت (context) مکالمه را حفظ میکند و مجبور به شروع دوبارهی گفتوگو نیست. این قابلیت بهویژه برای کاربران چندزبانه، از جمله کاربران فارسیزبانی که همزمان با زبان انگلیسی کار میکنند، میتواند بسیار کاربردی باشد. برای یادگیری نحوهی بهتر گفتوگو با ابزارهای هوش مصنوعی، آموزشهای چتجیپیتی سایت را هم ببینید.
۶. رقابت با GPT-Live اوپنایآی و Gemini Live گوگل
زمانبندی عرضهی MAI-Realtime تصادفی نیست. اوپنایآی حدود یک ماه پیش، مدل GPT-Live را با معماری مشابه full-duplex عرضه کرد و همین موضوع، MAI-Realtime را بهعنوان پاسخ مستقیم مایکروسافت در ذهنها جا انداخته است. برای آشنایی بیشتر با اوپنایآی و جایگاهش در این رقابت، مقالهی اوپنایآی چیست را بخوانید. از سوی دیگر، گوگل هم با Gemini Live در همین میدان حضور فعال دارد و بهطور مستمر در حال بهبود سرعت پاسخگویی و طبیعیبودن صدای خود است. تفاوت اصلی مایکروسافت در طبیعیبودن خام صدا نیست، بلکه در یکپارچگی با اکوسیستم سازمانی Azure و Copilot است؛ مزیتی که رقبا باید برای آن زیرساخت جداگانه بسازند. رقابت فشردهی مدلهای هوش مصنوعی البته موضوع تازهای نیست؛ برای نمونهای دیگر از این رقابتها میتوانید مقایسهی چتجیپیتی و دیپسیک در شطرنج را هم بخوانید.

۷. کاربردهای احتمالی در Copilot و Azure
بر اساس گزارشهای موجود، مقصد اصلی MAI-Realtime دو جاست: Microsoft Foundry برای توسعهدهندگانی که میخواهند این مدل را در اپلیکیشنهای خودشان ادغام کنند، و حالت صوتی Copilot برای کاربران عادی. این مدل احتمالاً جایگزین بخش GPT-Realtime اوپنایآی در Azure Speech Voice Live API خواهد شد؛ سرویسی که هماکنون تشخیص گفتار، تولید پاسخ، تشخیص نوبت مکالمه، مدیریت قطعشدن حرف و اتصال به ایجنتها را در یک بستهی واحد ارائه میدهد. کاربردهای سازمانی محتمل شامل خودکارسازی مراکز تماس، دستیارهای صوتی خدمات مشتری، و تعاملات پیچیدهای است که نیاز به مدیریت طبیعی وقفهها و سوالات پیاپی دارند. برای درک بهتر اهمیت اینگونه فناوریها در کسبوکار، مقالهی چرا هوش مصنوعی برای کسبوکارها مهم است را مطالعه کنید.
۸. قیمتگذاری و زمان عرضه؛ چه میدانیم و چه نمیدانیم؟
در حال حاضر هیچ تاریخ عرضهی رسمی، قیمت مشخص یا بنچمارک منتشرشدهای برای MAI-Realtime وجود ندارد؛ مایکروسافت هنوز هیچ اطلاعیهی رسمی صادر نکرده و آنچه میدانیم صرفاً از دسترسی محدود شرکای آزمایشی به دست آمده است. حتی مکانیزم فراخوانی ابزار (tool-calling)، سیاستهای حریم داده و محدودهی جغرافیایی سرویس نیز هنوز مستند نشدهاند. با این حال، با نگاهی به الگوی قیمتگذاری مدلهای قبلی مایکروسافت — مثلاً MAI-Voice-2 با نرخ تقریبی ۲۲ دلار بهازای هر میلیون کاراکتر، یا MAI-Transcribe-1.5 با نرخ حدود ۶ دلار بهازای هر هزار دقیقه — میتوان حدس زد که MAI-Realtime هم قیمتی پایینتر از نرخ فعلی GPT-Realtime اوپنایآی (حدود ۳۲ تا ۶۴ دلار بهازای هر میلیون توکن صوتی) خواهد داشت. البته این صرفاً یک برآورد بر اساس روند گذشته است، نه یک اعلامیهی رسمی از سوی مایکروسافت.
۹. چشمانداز آیندهی صدای هوش مصنوعی
ورود مایکروسافت به میدان مدلهای صوتی تمامدوطرفه نشان میدهد که این فناوری دیگر یک آزمایش آزمایشگاهی نیست، بلکه به یک استاندارد جدید برای دستیارهای صوتی سازمانی و مصرفی تبدیل شده است. در سالهای آینده احتمالاً شاهد رقابتی فشردهتر میان OpenAI، Google، Microsoft و سایر بازیگران بر سر سرعت پاسخگویی، طبیعیبودن مکالمه، تعداد زبانهای پشتیبانیشده و یکپارچگی با ابزارهای کاری روزمره خواهیم بود. برای کسانی که میخواهند بدون گمشدن در هیاهوی تبلیغاتی، تصویر واقعبینانهای از قابلیتها و محدودیتهای این فناوریها داشته باشند، مقالهی توهم هوش مصنوعی؛ توسعهدهندهی تنها در برابر مهندس واقعی پیشنهاد خوبی است.
سوالات متداول دربارهی MAI-Realtime
۱. MAI-Realtime چه زمانی بهصورت رسمی عرضه میشود؟
هنوز تاریخ رسمی اعلام نشده است. این مدل در حال حاضر فقط در دسترسی محدود شرکا و از طریق MAI Playground قابل آزمایش است و مایکروسافت دربارهی زمان عرضهی عمومی سکوت کرده.
۲. آیا MAI-Realtime جایگزین Copilot میشود؟
احتمالاً جایگزین حالت صوتی فعلی Copilot خواهد شد، اما هنوز زمانبندی دقیقی برای این ادغام از سوی مایکروسافت اعلام نشده است.
۳. تفاوت اصلی این مدل با مدلهای قبلی مایکروسافت چیست؟
مهمترین تفاوت، معماری «تمامدوطرفه» است که امکان گوشدادن و صحبتکردن همزمان را فراهم میکند، بر خلاف مدلهای قبلی که نوبتی عمل میکردند و منتظر پایان جمله میماندند.
۴. چگونه میتوان بهترین نتیجه را از دستیارهای صوتی هوش مصنوعی گرفت؟
نوشتن درخواستهای دقیق و ساختاریافته، چه در حالت متنی و چه صوتی، نتیجه را بهطور محسوسی بهتر میکند؛ برای شروع میتوانید راهنمای نوشتن پرامپت برای مبتدیان را مطالعه کنید.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
