کارت خبری مدل صوتی تمام‌دوطرفه MAI-Realtime مایکروسافت برای Copilot

MAI-Realtime مایکروسافت؛ اولین مدل صوتی تمام‌دوطرفه که هم‌زمان گوش می‌دهد و حرف می‌زند

اخبار · هوش مصنوعی

مایکروسافت به‌طور نیمه‌رسمی از MAI-Realtime رونمایی کرده؛ اولین مدل صوتی تمام‌دوطرفه‌ی این شرکت که می‌تواند هم‌زمان بشنود و پاسخ بدهد، دقیقاً مثل یک مکالمه‌ی واقعی انسانی.

چکیده. مایکروسافت مدل صوتی جدیدی به نام MAI-Realtime را وارد فاز تست محدود در MAI Playground کرده است. برخلاف مدل‌های قبلی این شرکت که یک‌طرفه بودند، MAI-Realtime به‌صورت «تمام‌دوطرفه» (full-duplex) عمل می‌کند؛ یعنی هم‌زمان گوش می‌دهد و صحبت می‌کند، از ۱۷ زبان پشتیبانی می‌کند و می‌تواند وسط مکالمه بدون مکث زبان را عوض کند. این مدل مستقیماً رقیب GPT-Live اوپن‌ای‌آی و Gemini Live گوگل است و قرار است جایگزین وابستگی مایکروسافت به مدل صوتی اوپن‌ای‌آی در Azure Speech شود.
کارت خبری مدل صوتی تمام‌دوطرفه MAI-Realtime مایکروسافت برای Copilot

۱. چرا این خبر برای آینده‌ی دستیارهای صوتی مهم است؟

تا امروز، تقریباً همه‌ی دستیارهای صوتی هوش مصنوعی — از جمله نسخه‌ی فعلی Copilot — بر پایه‌ی معماری «نوبتی» کار می‌کردند: کاربر حرف می‌زد، مدل صبر می‌کرد تا جمله تمام شود، سپس پاسخ تولید می‌شد و بعد از آن صدا ساخته و پخش می‌شد. این روش هرچند قابل اعتماد و ساده برای پیاده‌سازی است، اما با نحوه‌ی مکالمه‌ی طبیعی انسان‌ها فاصله‌ی زیادی دارد؛ ما در گفت‌وگوی روزمره مدام حرف یکدیگر را قطع می‌کنیم، هم‌زمان صحبت می‌کنیم، صداهای تأییدی مثل «آها» یا «بله» را وسط جمله‌ی طرف مقابل می‌گوییم و بدون مکث واکنش نشان می‌دهیم. عرضه‌ی MAI-Realtime نشان می‌دهد مایکروسافت هم مانند رقبایش تصمیم گرفته این فاصله را از بین ببرد و صدای Copilot را به یک مکالمه‌ی واقعی نزدیک‌تر کند. برای پیگیری این‌گونه تحولات، سری اخبار هوش مصنوعی سایت را دنبال کنید.

۲. اصلاً MAI-Realtime چیست؟

MAI-Realtime نام مدل صوتی جدید مایکروسافت است که فعلاً به‌صورت محدود و از طریق دسترسی شریک‌ها در MAI Playground در حال آزمایش است. هنوز هیچ اطلاعیه‌ی رسمی از سوی مایکروسافت منتشر نشده و آنچه می‌دانیم از گزارش‌های اولیه‌ی تسترهاست که به‌صورت اختصاصی منتشر شده. با این حال جزئیات فنی منتشرشده به‌قدری مشخص است که می‌توان تصویر روشنی از قابلیت‌های این مدل ترسیم کرد؛ مدلی که برای اولین بار در تاریخ مایکروسافت، صدا را نه به‌صورت مرحله‌به‌مرحله (اول تشخیص گفتار، سپس تولید پاسخ متنی، سپس ساخت صدای خروجی)، بلکه به‌صورت یک جریان پیوسته و هم‌زمان پردازش می‌کند. دو صدای آزمایشی به نام‌های Victoria و Grant هم در اختیار تسترها قرار گرفته که به‌گفته‌ی کاربران اولیه، طبیعی‌تر از صدای فعلی Copilot به نظر می‌رسند.

۳. تفاوت MAI-Realtime با MAI-Voice-2 و MAI-Transcribe-1.5

مایکروسافت پیش از این دو مدل صوتی جداگانه داشت: MAI-Voice-2 که فقط متن را به صدا تبدیل می‌کرد (سنتز گفتار)، و MAI-Transcribe-1.5 که فقط صدا را به متن تبدیل می‌کرد (تشخیص گفتار). هر دوی این مدل‌ها یک‌طرفه بودند و برای ساخت یک مکالمه‌ی کامل، باید کنار هم و به‌صورت مرحله‌ای اجرا می‌شدند؛ همین موضوع باعث تأخیر محسوس و از بین رفتن طبیعی‌بودن مکالمه می‌شد. MAI-Realtime این دو وظیفه را در یک مدل واحد ادغام کرده و آن‌ها را به‌صورت هم‌زمان و بدون توقف اجرا می‌کند، بدون نیاز به سوییچ‌کردن بین چند مدل جداگانه. اگر می‌خواهید با تفاوت رویکردهای مختلف هوش مصنوعی و محدودیت‌های واقعی آن‌ها بیشتر آشنا شوید، مقاله‌ی پتانسیل واقعی و محدودیت‌های هوش مصنوعی را هم بخوانید.

مقایسه مدل صوتی MAI-Realtime مایکروسافت با GPT-Live اوپن‌ای‌آی

۴. معماری «تمام‌دوطرفه» چگونه کار می‌کند؟

در معماری full-duplex، مدل به‌طور پیوسته در حال گوش‌دادن به جریان صوتی ورودی است و هم‌زمان تصمیم می‌گیرد که چه زمانی صحبت کند، چه زمانی سکوت کند، چه زمانی مکث کاربر را به‌عنوان پایان جمله تشخیص دهد و چه زمانی یک ابزار (مثل جست‌وجوی وب) را فراخوانی کند — همه‌ی این‌ها بدون توقف ضبط صدا. این تفاوت اساسی با پایپ‌لاین‌های نیمه‌دوطرفه‌ی قدیمی است که مراحل تشخیص، استدلال و سنتز را به‌صورت پی‌درپی و جدا از هم انجام می‌دادند. طبق گزارش‌ها، MAI-Realtime از دو حالت مدیریت نوبت مکالمه پشتیبانی می‌کند:

حالت Switchboard

در این حالت، یک تشخیص‌دهنده‌ی پایان‌گفتار به نام MAI-Ears همراه با توکن‌های کنترلی داخلی، به‌صورت یادگیری‌شده تشخیص می‌دهد که کاربر جمله‌اش را تمام کرده یا نه. این روش برای مکالمات طبیعی، پرتنش و پرتعامل مناسب‌تر است و انعطاف بیشتری به مدل می‌دهد.

حالت قطعی (Deterministic)

در این حالت، ترکیبی از تشخیص سکوت و یک تشخیص‌دهنده‌ی معنایی مبتنی بر Whisper استفاده می‌شود تا رفتار مدل قابل پیش‌بینی‌تر و قابل تنظیم‌تر باشد؛ گزینه‌ای مناسب برای کاربردهای سازمانی حساس که نیاز به رفتار ثابت دارند.

۵. پشتیبانی از ۱۷ زبان و تعویض زبان بدون مکث

یکی از جذاب‌ترین ویژگی‌های گزارش‌شده‌ی MAI-Realtime، پشتیبانی هم‌زمان از ۱۷ زبان از جمله انگلیسی، آلمانی، اسپانیایی، فرانسوی، ایتالیایی، پرتغالی، ژاپنی، کره‌ای، چینی، هلندی، هندی، اندونزیایی، عربی، روسی، ترکی، ویتنامی و تایلندی است. نکته‌ی مهم‌تر این‌که کاربر می‌تواند وسط یک مکالمه، بدون هیچ توقف یا بارگذاری مجدد، زبان صحبت را عوض کند و مدل همچنان بافت (context) مکالمه را حفظ می‌کند و مجبور به شروع دوباره‌ی گفت‌وگو نیست. این قابلیت به‌ویژه برای کاربران چندزبانه، از جمله کاربران فارسی‌زبانی که هم‌زمان با زبان انگلیسی کار می‌کنند، می‌تواند بسیار کاربردی باشد. برای یادگیری نحوه‌ی بهتر گفت‌وگو با ابزارهای هوش مصنوعی، آموزش‌های چت‌جی‌پی‌تی سایت را هم ببینید.

۶. رقابت با GPT-Live اوپن‌ای‌آی و Gemini Live گوگل

زمان‌بندی عرضه‌ی MAI-Realtime تصادفی نیست. اوپن‌ای‌آی حدود یک ماه پیش، مدل GPT-Live را با معماری مشابه full-duplex عرضه کرد و همین موضوع، MAI-Realtime را به‌عنوان پاسخ مستقیم مایکروسافت در ذهن‌ها جا انداخته است. برای آشنایی بیشتر با اوپن‌ای‌آی و جایگاهش در این رقابت، مقاله‌ی اوپن‌ای‌آی چیست را بخوانید. از سوی دیگر، گوگل هم با Gemini Live در همین میدان حضور فعال دارد و به‌طور مستمر در حال بهبود سرعت پاسخ‌گویی و طبیعی‌بودن صدای خود است. تفاوت اصلی مایکروسافت در طبیعی‌بودن خام صدا نیست، بلکه در یکپارچگی با اکوسیستم سازمانی Azure و Copilot است؛ مزیتی که رقبا باید برای آن زیرساخت جداگانه بسازند. رقابت فشرده‌ی مدل‌های هوش مصنوعی البته موضوع تازه‌ای نیست؛ برای نمونه‌ای دیگر از این رقابت‌ها می‌توانید مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک در شطرنج را هم بخوانید.

قابلیت چندزبانه و مکالمه زنده مدل صوتی مایکروسافت در برابر Gemini Live

۷. کاربردهای احتمالی در Copilot و Azure

بر اساس گزارش‌های موجود، مقصد اصلی MAI-Realtime دو جاست: Microsoft Foundry برای توسعه‌دهندگانی که می‌خواهند این مدل را در اپلیکیشن‌های خودشان ادغام کنند، و حالت صوتی Copilot برای کاربران عادی. این مدل احتمالاً جایگزین بخش GPT-Realtime اوپن‌ای‌آی در Azure Speech Voice Live API خواهد شد؛ سرویسی که هم‌اکنون تشخیص گفتار، تولید پاسخ، تشخیص نوبت مکالمه، مدیریت قطع‌شدن حرف و اتصال به ایجنت‌ها را در یک بسته‌ی واحد ارائه می‌دهد. کاربردهای سازمانی محتمل شامل خودکارسازی مراکز تماس، دستیارهای صوتی خدمات مشتری، و تعاملات پیچیده‌ای است که نیاز به مدیریت طبیعی وقفه‌ها و سوالات پیاپی دارند. برای درک بهتر اهمیت این‌گونه فناوری‌ها در کسب‌وکار، مقاله‌ی چرا هوش مصنوعی برای کسب‌وکارها مهم است را مطالعه کنید.

۸. قیمت‌گذاری و زمان عرضه؛ چه می‌دانیم و چه نمی‌دانیم؟

در حال حاضر هیچ تاریخ عرضه‌ی رسمی، قیمت مشخص یا بنچمارک منتشرشده‌ای برای MAI-Realtime وجود ندارد؛ مایکروسافت هنوز هیچ اطلاعیه‌ی رسمی صادر نکرده و آنچه می‌دانیم صرفاً از دسترسی محدود شرکای آزمایشی به دست آمده است. حتی مکانیزم فراخوانی ابزار (tool-calling)، سیاست‌های حریم داده و محدوده‌ی جغرافیایی سرویس نیز هنوز مستند نشده‌اند. با این حال، با نگاهی به الگوی قیمت‌گذاری مدل‌های قبلی مایکروسافت — مثلاً MAI-Voice-2 با نرخ تقریبی ۲۲ دلار به‌ازای هر میلیون کاراکتر، یا MAI-Transcribe-1.5 با نرخ حدود ۶ دلار به‌ازای هر هزار دقیقه — می‌توان حدس زد که MAI-Realtime هم قیمتی پایین‌تر از نرخ فعلی GPT-Realtime اوپن‌ای‌آی (حدود ۳۲ تا ۶۴ دلار به‌ازای هر میلیون توکن صوتی) خواهد داشت. البته این صرفاً یک برآورد بر اساس روند گذشته است، نه یک اعلامیه‌ی رسمی از سوی مایکروسافت.

۹. چشم‌انداز آینده‌ی صدای هوش مصنوعی

ورود مایکروسافت به میدان مدل‌های صوتی تمام‌دوطرفه نشان می‌دهد که این فناوری دیگر یک آزمایش آزمایشگاهی نیست، بلکه به یک استاندارد جدید برای دستیارهای صوتی سازمانی و مصرفی تبدیل شده است. در سال‌های آینده احتمالاً شاهد رقابتی فشرده‌تر میان OpenAI، Google، Microsoft و سایر بازیگران بر سر سرعت پاسخ‌گویی، طبیعی‌بودن مکالمه، تعداد زبان‌های پشتیبانی‌شده و یکپارچگی با ابزارهای کاری روزمره خواهیم بود. برای کسانی که می‌خواهند بدون گم‌شدن در هیاهوی تبلیغاتی، تصویر واقع‌بینانه‌ای از قابلیت‌ها و محدودیت‌های این فناوری‌ها داشته باشند، مقاله‌ی توهم هوش مصنوعی؛ توسعه‌دهنده‌ی تنها در برابر مهندس واقعی پیشنهاد خوبی است.

سوالات متداول درباره‌ی MAI-Realtime

۱. MAI-Realtime چه زمانی به‌صورت رسمی عرضه می‌شود؟
هنوز تاریخ رسمی اعلام نشده است. این مدل در حال حاضر فقط در دسترسی محدود شرکا و از طریق MAI Playground قابل آزمایش است و مایکروسافت درباره‌ی زمان عرضه‌ی عمومی سکوت کرده.

۲. آیا MAI-Realtime جایگزین Copilot می‌شود؟
احتمالاً جایگزین حالت صوتی فعلی Copilot خواهد شد، اما هنوز زمان‌بندی دقیقی برای این ادغام از سوی مایکروسافت اعلام نشده است.

۳. تفاوت اصلی این مدل با مدل‌های قبلی مایکروسافت چیست؟
مهم‌ترین تفاوت، معماری «تمام‌دوطرفه» است که امکان گوش‌دادن و صحبت‌کردن هم‌زمان را فراهم می‌کند، بر خلاف مدل‌های قبلی که نوبتی عمل می‌کردند و منتظر پایان جمله می‌ماندند.

۴. چگونه می‌توان بهترین نتیجه را از دستیارهای صوتی هوش مصنوعی گرفت؟
نوشتن درخواست‌های دقیق و ساختاریافته، چه در حالت متنی و چه صوتی، نتیجه را به‌طور محسوسی بهتر می‌کند؛ برای شروع می‌توانید راهنمای نوشتن پرامپت برای مبتدیان را مطالعه کنید.

جمع‌بندی. MAI-Realtime نشان می‌دهد مایکروسافت هم مانند اوپن‌ای‌آی و گوگل، آینده‌ی دستیارهای صوتی را در معماری تمام‌دوطرفه می‌بیند؛ فناوری‌ای که مکالمه با هوش مصنوعی را از حالت نوبتی و ماشینی به یک گفت‌وگوی واقعی و طبیعی نزدیک می‌کند. هنوز جزئیات نهایی مثل قیمت دقیق و تاریخ عرضه‌ی عمومی مشخص نیست، اما مسیر کاملاً روشن است: صدای هوش مصنوعی به‌زودی خیلی زنده‌تر از امروز خواهد شد. برای دریافت لحظه‌به‌لحظه‌ی این‌گونه اخبار، کانال تلگرام @MrChatGPT_IR را دنبال کنید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *