پوستر خبری معرفی مدل صوتی متن‌باز انویدیا Nemotron VoiceChat 11B

انویدیا Nemotron VoiceChat 11B را متن‌باز کرد؛ اولین مدل صوتی با فراخوانی ابزار در لحظه

فناوری · هوش مصنوعی

انویدیا با انتشار مدل متن‌باز Nemotron VoiceChat 11B، یکی از مهم‌ترین گام‌ها در مسیر ساخت دستیارهای صوتی هوشمند و بلادرنگ را برداشته است؛ مدلی که برای اولین بار در دنیای متن‌باز، امکان اجرای ابزار و دستور را درست وسط مکالمه فراهم می‌کند.

چکیده. انویدیا در تاریخ ۳ اوت ۲۰۲۶ مدل صوتی Nemotron VoiceChat 11B را به صورت متن‌باز منتشر کرد. این مدل ۱۱ میلیارد پارامتری، اولین مدل صدا-به-صدای دوطرفه‌کامل (full-duplex) با قابلیت فراخوانی زنده ابزار در دنیای متن‌باز است؛ تاخیر پاسخ‌گویی آن حدود ۴۵۰ میلی‌ثانیه است و در آزمون VoiceBench رتبه دوم را در میان مدل‌های متن‌باز مشابه کسب کرده است. مدل تحت مجوز OpenMDW v1.1 و فقط برای مصارف پژوهشی در دسترس است.
پوستر خبری معرفی مدل صوتی متن‌باز انویدیا Nemotron VoiceChat 11B

۱. یک جهش تازه در مسیر دستیارهای صوتی هوش مصنوعی

دستیارهای صوتی هوش مصنوعی طی دو سال گذشته از حالت «سؤال و جواب کند» به سمت گفت‌وگوهای طبیعی و بلادرنگ حرکت کرده‌اند، اما اکثر این سامانه‌ها همچنان به یک ضعف بنیادین دچارند: وقتی کاربر از دستیار می‌خواهد کاری انجام دهد — مثلاً رزرو بلیت، جست‌وجوی اطلاعات یا اجرای یک تابع — مکالمه برای چند ثانیه متوقف می‌شود تا سیستم «فکر کند». انویدیا با معرفی Nemotron VoiceChat 11B ادعا می‌کند این وقفه را از بین برده است. برای آشنایی بیشتر با مفهوم هوش مصنوعی و کاربردهای امروزی آن، می‌توانید نگاهی هم به پتانسیل‌های واقعی و محدودیت‌های هوش مصنوعی بیندازید.

این مدل در روز دوشنبه، سوم اوت ۲۰۲۶، به صورت عمومی روی Hugging Face منتشر شد و بلافاصله توجه جامعه توسعه‌دهندگان صوتی را جلب کرد؛ چراکه اولین باری است که یک مدل متن‌باز، توانایی «فراخوانی ابزار زنده» را در کنار مکالمه‌ی طبیعی و دوطرفه ارائه می‌دهد.

بازار دستیارهای صوتی هوش مصنوعی در سال‌های اخیر رشد بسیار سریعی داشته و بخش بزرگی از این رشد، ناشی از تقاضای فزاینده برای ایجنت‌های صوتی است که بتوانند علاوه بر گفت‌وگو، وظایف واقعی را هم انجام دهند. تا پیش از این، توسعه‌دهندگانی که می‌خواستند چنین قابلیتی بسازند، معمولاً مجبور بودند از ترکیب چند سرویس جداگانه و اغلب بسته استفاده کنند که هم هزینه‌بر بود و هم کنترل محدودی روی داده و رفتار مدل به آن‌ها می‌داد. انتشار متن‌باز Nemotron VoiceChat 11B می‌تواند این معادله را تا حدی تغییر دهد.

۲. Nemotron VoiceChat 11B دقیقاً چیست؟

Nemotron VoiceChat 11B یک مدل صدا-به-صدا (speech-to-speech) با ۱۱ میلیارد پارامتر است که توسط انویدیا توسعه یافته و برخلاف اغلب دستیارهای صوتی رایج، به جای استفاده از یک زنجیره سه‌مرحله‌ای جداگانه (تشخیص گفتار → پردازش زبانی → تبدیل متن به گفتار)، تمام این مراحل را در یک معماری واحد و یکپارچه ادغام کرده است. این رویکرد باعث می‌شود تاخیر کلی سامانه به شدت کاهش یابد و مکالمه حسی طبیعی‌تر و انسانی‌تر پیدا کند.

ویژگی «دوطرفه‌کامل» یا full-duplex به این معناست که مدل هم‌زمان می‌تواند بشنود و صحبت کند؛ دقیقاً مثل یک مکالمه‌ی انسانی واقعی که در آن دو طرف می‌توانند حرف یکدیگر را قطع کنند، همزمان واکنش نشان دهند و نوبت صحبت را به طور طبیعی رد و بدل کنند.

مقایسه با معماری‌های سنتی

در معماری‌های سنتی، هر مرحله (شنیدن، فهمیدن، پاسخ دادن) توسط یک مدل جداگانه انجام می‌شود که باعث تاخیرهای انباشته و از دست رفتن لحن و ریتم طبیعی گفت‌وگو می‌شود. مدل انویدیا با حذف این زنجیره، مستقیماً از سیگنال صوتی به سیگنال صوتی پاسخ عمل می‌کند.

تصویر مفهومی قابلیت فراخوانی ابزار در حین مکالمه صوتی هوش مصنوعی انویدیا

۳. معماری فنی: ترکیبی از Mamba، Transformer و رمزگذار گفتار

در قلب این مدل، یک معماری ترکیبی Mamba/Transformer قرار دارد که از چهار بخش اصلی تشکیل شده است: یک رمزگذار گفتاری از نوع Fast Conformer برای تبدیل صدای ورودی به بازنمایی قابل پردازش، هسته‌ی زبانی Nemotron Nano v2 با ۹ میلیارد پارامتر برای درک و تولید محتوا، یک رمزگشای تبدیل متن به گفتار برای تولید خروجی صوتی طبیعی، و در نهایت یک کانال خروجی مجزا که به طور اختصاصی برای فراخوانی ابزار طراحی شده است.

وجود این کانال جداگانه برای فراخوانی ابزار، نکته‌ی کلیدی طراحی این مدل است؛ چراکه اجازه می‌دهد فراخوانی توابع بدون تداخل با جریان اصلی گفت‌وگوی صوتی انجام شود. این موضوع از نظر مهندسی نرم‌افزار شباهت زیادی به الگوهای پرامپت‌نویسی ساختاریافته دارد که برای مدل‌های متنی هم استفاده می‌شود؛ اگر با اصول نوشتن پرامپت مؤثر آشنا نیستید، مقاله‌ی آموزش نوشتن پرامپت برای مبتدیان می‌تواند نقطه‌ی شروع خوبی باشد.

۴. فراخوانی ابزار در لحظه؛ ویژگی متمایزکننده‌ی این مدل

مهم‌ترین ویژگی Nemotron VoiceChat 11B، توانایی اجرای فراخوانی ابزار (function calling) درست در وسط یک مکالمه‌ی صوتی زنده است، بدون آنکه ریتم طبیعی گفت‌وگو مختل شود. برای مثال، اگر کاربری در حین صحبت از دستیار بخواهد «هوا را چک کن» یا «این یادداشت را ذخیره کن»، مدل می‌تواند بدون سکوت طولانی یا مکث محسوس، درخواست را به یک ابزار بیرونی ارسال کرده و پاسخ را در همان لحظه در جریان مکالمه بگنجاند.

طبق داده‌های منتشرشده توسط انویدیا، این مدل در آزمون Full-Duplex-Bench نسخه ۳ به دقت ۸۲.۵ درصدی در انتخاب صحیح ابزار دست یافته است؛ رقمی قابل توجه برای یک مدل متن‌باز که هنوز در مراحل اولیه‌ی توسعه قرار دارد.

۵. عملکرد و بنچمارک‌ها: نقاط قوت و ضعف

در آزمون VoiceBench، که استاندارد مرجع برای سنجش مدل‌های صوتی دوطرفه است، Nemotron VoiceChat 11B رتبه دوم را در میان مدل‌های متن‌باز مشابه به دست آورده است. مدل در معیار «پویایی مکالمه» به ۷۷.۸ درصد رسیده که رقم قابل قبولی محسوب می‌شود.

با این حال، در معیار «استدلال گفتاری» (speech reasoning) تنها به ۲۹.۲ درصد رسیده، در حالی که برخی مدل‌های بسته و اختصاصی رقبا تا ۹۶ درصد امتیاز کسب کرده‌اند. این شکاف نشان می‌دهد مدل‌های متن‌باز، هرچند در تعامل طبیعی و مدیریت نوبت گفت‌وگو پیشرفت چشمگیری داشته‌اند، هنوز در استدلال پیچیده‌ی مبتنی بر صدا فاصله‌ی زیادی با مدل‌های بسته دارند.

عملکرد در فراخوانی ابزار

در آزمون BFCL-v3 که فراخوانی توابع را می‌سنجد، مدل میانگین ۵۶.۱ درصد کسب کرده است؛ اما در زیرمعیارهای دقیق‌تر مثل «دقت آرگومان‌ها» (۴۴.۲ درصد) و «موفقیت در تلاش اول» یا Pass@1 (۳۳ درصد)، عملکرد ضعیف‌تری از خود نشان داده است. با این وجود، طبق تحلیل مؤسسه‌ی Artificial Analysis، این مدل تنها مدل متن‌باز موجود است که هم‌زمان در میان سه مدل برتر هر دو معیار «پویایی مکالمه» و «استدلال گفتاری» قرار می‌گیرد؛ نکته‌ای که آن را از سایر مدل‌های متن‌باز صوتی متمایز می‌کند.

۶. مجوز انتشار و نحوه‌ی دسترسی به مدل

Nemotron VoiceChat 11B تحت مجوز OpenMDW نسخه ۱.۱ منتشر شده که به طور مشخص استفاده‌ی آن را به مصارف پژوهشی محدود می‌کند و اجازه‌ی بهره‌برداری تجاری مستقیم را نمی‌دهد. این نکته برای شرکت‌هایی که قصد استفاده‌ی تجاری از این مدل را دارند بسیار مهم است و باید پیش از هر برنامه‌ریزی، شرایط مجوز را با دقت بررسی کنند.

از نظر سخت‌افزاری، اجرای این مدل به کارت‌های گرافیک قدرتمند نیاز دارد؛ از جمله A100، H100، H200، B100، B200 یا RTX-6000، و از طریق موتور استنتاج vLLM قابل اجراست. انویدیا همچنین یک کانتینر بهینه‌شده با رابط WebSocket برای استقرار جریانی (streaming) و پردازش دسته‌ای آفلاین ارائه کرده است تا توسعه‌دهندگان بتوانند آن را سریع‌تر در محیط‌های خود پیاده‌سازی کنند.

نمودار عملکرد و تاخیر پاسخ‌گویی مدل صوتی انویدیا در آزمون VoiceBench

۷. جایگاه این مدل در رقابت متن‌باز در برابر مدل‌های بسته

انتشار Nemotron VoiceChat 11B در بستری رخ می‌دهد که رقابت میان مدل‌های زبانی و صوتی بسته و متن‌باز هر روز داغ‌تر می‌شود. شرکت‌هایی مانند OpenAI با ChatGPT، گوگل با Gemini و آنتروپیک با Claude، عمدتاً مدل‌های اختصاصی و بسته‌ی خود را ارائه می‌دهند، در حالی که انویدیا با انتشار وزن‌های این مدل، مسیر متفاوتی را دنبال می‌کند که به پژوهشگران و توسعه‌دهندگان مستقل اجازه می‌دهد بدون وابستگی به APIهای بسته، دستیارهای صوتی سفارشی بسازند.

این رویکرد یادآور رقابت‌های مشابهی است که پیش‌تر در حوزه‌ی مدل‌های زبانی متنی شاهد آن بوده‌ایم؛ برای مثال در مقاله‌ی مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک بررسی کرده‌ایم که چگونه مدل‌های متن‌باز و بسته در حوزه‌های تخصصی با یکدیگر رقابت می‌کنند. برای درک بهتر جایگاه OpenAI در این اکوسیستم نیز می‌توانید مقاله‌ی OpenAI چیست؟ را مطالعه کنید.

۸. کاربردهای عملی برای توسعه‌دهندگان و کسب‌وکارها

برای توسعه‌دهندگان، متن‌باز بودن این مدل به معنای امکان سفارشی‌سازی کامل، آموزش تکمیلی (fine-tuning) روی داده‌های اختصاصی و اجرای آن روی زیرساخت‌های خودشان است؛ مزیتی که در مدل‌های بسته معمولاً وجود ندارد. این موضوع به‌ویژه برای شرکت‌هایی که به حریم خصوصی داده و کنترل کامل بر زیرساخت اهمیت می‌دهند، جذاب است.

از منظر کسب‌وکار نیز، دستیارهای صوتی با قابلیت فراخوانی ابزار زنده می‌توانند نقش مهمی در مراکز تماس هوشمند، دستیارهای فروش صوتی، پشتیبانی مشتری بلادرنگ و حتی ایجنت‌های صوتی داخلی سازمان‌ها ایفا کنند. برای آشنایی بیشتر با اهمیت هوش مصنوعی در فضای کسب‌وکار، پیشنهاد می‌کنیم مقاله‌ی چرا هوش مصنوعی برای کسب‌وکار مهم است؟ را هم بخوانید.

با این حال، باید در نظر داشت که این مدل هنوز محدودیت‌های واقعی دارد، به‌ویژه در استدلال پیچیده‌ی صوتی، و نباید انتظار داشت به‌سرعت جایگزین دستیارهای صوتی تجاری بالغ شود. برای درک واقع‌بینانه از توانایی‌ها و محدودیت‌های فعلی هوش مصنوعی، پیش‌تر در مقاله‌ای مستقل به این موضوع پرداخته‌ایم که در بخش اول همین متن نیز به آن اشاره شد.

نکته‌ی قابل‌توجه دیگر این است که انتشار متن‌باز چنین مدلی، مسیر پژوهش دانشگاهی و پروژه‌های کوچک‌تر را نیز هموارتر می‌کند. تیم‌های پژوهشی که پیش‌تر امکان دسترسی به مدل‌های صوتی پیشرفته و دوطرفه را نداشتند، اکنون می‌توانند بدون پرداخت هزینه‌ی API، روی بهبود استدلال گفتاری، کاهش بیشتر تاخیر یا افزودن زبان‌های جدید کار کنند. با توجه به سرعت بالای انتشار مدل‌های جدید در این حوزه، احتمالاً در ماه‌های آینده شاهد نسخه‌های به‌روزشده‌تر و رقبای متن‌باز دیگری نیز خواهیم بود.

۹. پرسش‌های متداول درباره‌ی Nemotron VoiceChat 11B

آیا Nemotron VoiceChat 11B رایگان است؟
بله، وزن‌های مدل به صورت رایگان روی Hugging Face در دسترس است، اما تحت مجوز OpenMDW v1.1 فقط برای مصارف پژوهشی مجاز است و استفاده‌ی تجاری مستقیم را پوشش نمی‌دهد.

چه تفاوتی با دستیارهای صوتی رایج مثل ChatGPT Voice یا Gemini Live دارد؟
تفاوت اصلی در متن‌باز بودن وزن‌ها و قابلیت فراخوانی زنده‌ی ابزار در وسط مکالمه است؛ ویژگی‌ای که تاکنون در مدل‌های متن‌باز مشابه دیده نشده بود.

آیا اجرای این مدل به سخت‌افزار خاصی نیاز دارد؟
بله، این مدل برای اجرا به کارت‌های گرافیک قدرتمند نظیر H100 یا B200 و موتور استنتاج vLLM نیاز دارد و برای دستگاه‌های معمولی مناسب نیست.

آیا این مدل جایگزین مدل‌های زبانی بزرگ متنی می‌شود؟
خیر؛ این مدل به طور خاص برای پردازش گفتار و مکالمه‌ی صوتی طراحی شده و مکمل مدل‌های زبانی متنی است، نه جایگزین آن‌ها. برای درک بهتر تفاوت میان توسعه‌ی واقعی مدل‌ها و ادعاهای اغراق‌آمیز در این حوزه، مطالعه‌ی مقاله‌ی توهم هوش مصنوعی: توسعه‌دهنده‌ی تنها در برابر مهندس واقعی نیز خالی از لطف نیست.

در نهایت، انتشار Nemotron VoiceChat 11B نشان می‌دهد رقابت در حوزه‌ی دستیارهای صوتی هوش مصنوعی وارد فاز تازه‌ای شده است؛ فازی که در آن مکالمه‌ی طبیعی و اجرای دستور دیگر دو مرحله‌ی جدا از هم نیستند. برای دنبال‌کردن جدیدترین اخبار و تحلیل‌های هوش مصنوعی به‌روز، سری بزنید به بخش اخبار هوش مصنوعی مرچت‌جی‌پی‌تی و ما را در تلگرام دنبال کنید: @MrChatGPT_IR

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *