انویدیا با انتشار مدل متنباز Nemotron VoiceChat 11B، یکی از مهمترین گامها در مسیر ساخت دستیارهای صوتی هوشمند و بلادرنگ را برداشته است؛ مدلی که برای اولین بار در دنیای متنباز، امکان اجرای ابزار و دستور را درست وسط مکالمه فراهم میکند.

لیست مطالب
۱. یک جهش تازه در مسیر دستیارهای صوتی هوش مصنوعی
دستیارهای صوتی هوش مصنوعی طی دو سال گذشته از حالت «سؤال و جواب کند» به سمت گفتوگوهای طبیعی و بلادرنگ حرکت کردهاند، اما اکثر این سامانهها همچنان به یک ضعف بنیادین دچارند: وقتی کاربر از دستیار میخواهد کاری انجام دهد — مثلاً رزرو بلیت، جستوجوی اطلاعات یا اجرای یک تابع — مکالمه برای چند ثانیه متوقف میشود تا سیستم «فکر کند». انویدیا با معرفی Nemotron VoiceChat 11B ادعا میکند این وقفه را از بین برده است. برای آشنایی بیشتر با مفهوم هوش مصنوعی و کاربردهای امروزی آن، میتوانید نگاهی هم به پتانسیلهای واقعی و محدودیتهای هوش مصنوعی بیندازید.
این مدل در روز دوشنبه، سوم اوت ۲۰۲۶، به صورت عمومی روی Hugging Face منتشر شد و بلافاصله توجه جامعه توسعهدهندگان صوتی را جلب کرد؛ چراکه اولین باری است که یک مدل متنباز، توانایی «فراخوانی ابزار زنده» را در کنار مکالمهی طبیعی و دوطرفه ارائه میدهد.
بازار دستیارهای صوتی هوش مصنوعی در سالهای اخیر رشد بسیار سریعی داشته و بخش بزرگی از این رشد، ناشی از تقاضای فزاینده برای ایجنتهای صوتی است که بتوانند علاوه بر گفتوگو، وظایف واقعی را هم انجام دهند. تا پیش از این، توسعهدهندگانی که میخواستند چنین قابلیتی بسازند، معمولاً مجبور بودند از ترکیب چند سرویس جداگانه و اغلب بسته استفاده کنند که هم هزینهبر بود و هم کنترل محدودی روی داده و رفتار مدل به آنها میداد. انتشار متنباز Nemotron VoiceChat 11B میتواند این معادله را تا حدی تغییر دهد.
۲. Nemotron VoiceChat 11B دقیقاً چیست؟
Nemotron VoiceChat 11B یک مدل صدا-به-صدا (speech-to-speech) با ۱۱ میلیارد پارامتر است که توسط انویدیا توسعه یافته و برخلاف اغلب دستیارهای صوتی رایج، به جای استفاده از یک زنجیره سهمرحلهای جداگانه (تشخیص گفتار → پردازش زبانی → تبدیل متن به گفتار)، تمام این مراحل را در یک معماری واحد و یکپارچه ادغام کرده است. این رویکرد باعث میشود تاخیر کلی سامانه به شدت کاهش یابد و مکالمه حسی طبیعیتر و انسانیتر پیدا کند.
ویژگی «دوطرفهکامل» یا full-duplex به این معناست که مدل همزمان میتواند بشنود و صحبت کند؛ دقیقاً مثل یک مکالمهی انسانی واقعی که در آن دو طرف میتوانند حرف یکدیگر را قطع کنند، همزمان واکنش نشان دهند و نوبت صحبت را به طور طبیعی رد و بدل کنند.
مقایسه با معماریهای سنتی
در معماریهای سنتی، هر مرحله (شنیدن، فهمیدن، پاسخ دادن) توسط یک مدل جداگانه انجام میشود که باعث تاخیرهای انباشته و از دست رفتن لحن و ریتم طبیعی گفتوگو میشود. مدل انویدیا با حذف این زنجیره، مستقیماً از سیگنال صوتی به سیگنال صوتی پاسخ عمل میکند.

۳. معماری فنی: ترکیبی از Mamba، Transformer و رمزگذار گفتار
در قلب این مدل، یک معماری ترکیبی Mamba/Transformer قرار دارد که از چهار بخش اصلی تشکیل شده است: یک رمزگذار گفتاری از نوع Fast Conformer برای تبدیل صدای ورودی به بازنمایی قابل پردازش، هستهی زبانی Nemotron Nano v2 با ۹ میلیارد پارامتر برای درک و تولید محتوا، یک رمزگشای تبدیل متن به گفتار برای تولید خروجی صوتی طبیعی، و در نهایت یک کانال خروجی مجزا که به طور اختصاصی برای فراخوانی ابزار طراحی شده است.
وجود این کانال جداگانه برای فراخوانی ابزار، نکتهی کلیدی طراحی این مدل است؛ چراکه اجازه میدهد فراخوانی توابع بدون تداخل با جریان اصلی گفتوگوی صوتی انجام شود. این موضوع از نظر مهندسی نرمافزار شباهت زیادی به الگوهای پرامپتنویسی ساختاریافته دارد که برای مدلهای متنی هم استفاده میشود؛ اگر با اصول نوشتن پرامپت مؤثر آشنا نیستید، مقالهی آموزش نوشتن پرامپت برای مبتدیان میتواند نقطهی شروع خوبی باشد.
۴. فراخوانی ابزار در لحظه؛ ویژگی متمایزکنندهی این مدل
مهمترین ویژگی Nemotron VoiceChat 11B، توانایی اجرای فراخوانی ابزار (function calling) درست در وسط یک مکالمهی صوتی زنده است، بدون آنکه ریتم طبیعی گفتوگو مختل شود. برای مثال، اگر کاربری در حین صحبت از دستیار بخواهد «هوا را چک کن» یا «این یادداشت را ذخیره کن»، مدل میتواند بدون سکوت طولانی یا مکث محسوس، درخواست را به یک ابزار بیرونی ارسال کرده و پاسخ را در همان لحظه در جریان مکالمه بگنجاند.
طبق دادههای منتشرشده توسط انویدیا، این مدل در آزمون Full-Duplex-Bench نسخه ۳ به دقت ۸۲.۵ درصدی در انتخاب صحیح ابزار دست یافته است؛ رقمی قابل توجه برای یک مدل متنباز که هنوز در مراحل اولیهی توسعه قرار دارد.
۵. عملکرد و بنچمارکها: نقاط قوت و ضعف
در آزمون VoiceBench، که استاندارد مرجع برای سنجش مدلهای صوتی دوطرفه است، Nemotron VoiceChat 11B رتبه دوم را در میان مدلهای متنباز مشابه به دست آورده است. مدل در معیار «پویایی مکالمه» به ۷۷.۸ درصد رسیده که رقم قابل قبولی محسوب میشود.
با این حال، در معیار «استدلال گفتاری» (speech reasoning) تنها به ۲۹.۲ درصد رسیده، در حالی که برخی مدلهای بسته و اختصاصی رقبا تا ۹۶ درصد امتیاز کسب کردهاند. این شکاف نشان میدهد مدلهای متنباز، هرچند در تعامل طبیعی و مدیریت نوبت گفتوگو پیشرفت چشمگیری داشتهاند، هنوز در استدلال پیچیدهی مبتنی بر صدا فاصلهی زیادی با مدلهای بسته دارند.
عملکرد در فراخوانی ابزار
در آزمون BFCL-v3 که فراخوانی توابع را میسنجد، مدل میانگین ۵۶.۱ درصد کسب کرده است؛ اما در زیرمعیارهای دقیقتر مثل «دقت آرگومانها» (۴۴.۲ درصد) و «موفقیت در تلاش اول» یا Pass@1 (۳۳ درصد)، عملکرد ضعیفتری از خود نشان داده است. با این وجود، طبق تحلیل مؤسسهی Artificial Analysis، این مدل تنها مدل متنباز موجود است که همزمان در میان سه مدل برتر هر دو معیار «پویایی مکالمه» و «استدلال گفتاری» قرار میگیرد؛ نکتهای که آن را از سایر مدلهای متنباز صوتی متمایز میکند.
۶. مجوز انتشار و نحوهی دسترسی به مدل
Nemotron VoiceChat 11B تحت مجوز OpenMDW نسخه ۱.۱ منتشر شده که به طور مشخص استفادهی آن را به مصارف پژوهشی محدود میکند و اجازهی بهرهبرداری تجاری مستقیم را نمیدهد. این نکته برای شرکتهایی که قصد استفادهی تجاری از این مدل را دارند بسیار مهم است و باید پیش از هر برنامهریزی، شرایط مجوز را با دقت بررسی کنند.
از نظر سختافزاری، اجرای این مدل به کارتهای گرافیک قدرتمند نیاز دارد؛ از جمله A100، H100، H200، B100، B200 یا RTX-6000، و از طریق موتور استنتاج vLLM قابل اجراست. انویدیا همچنین یک کانتینر بهینهشده با رابط WebSocket برای استقرار جریانی (streaming) و پردازش دستهای آفلاین ارائه کرده است تا توسعهدهندگان بتوانند آن را سریعتر در محیطهای خود پیادهسازی کنند.

۷. جایگاه این مدل در رقابت متنباز در برابر مدلهای بسته
انتشار Nemotron VoiceChat 11B در بستری رخ میدهد که رقابت میان مدلهای زبانی و صوتی بسته و متنباز هر روز داغتر میشود. شرکتهایی مانند OpenAI با ChatGPT، گوگل با Gemini و آنتروپیک با Claude، عمدتاً مدلهای اختصاصی و بستهی خود را ارائه میدهند، در حالی که انویدیا با انتشار وزنهای این مدل، مسیر متفاوتی را دنبال میکند که به پژوهشگران و توسعهدهندگان مستقل اجازه میدهد بدون وابستگی به APIهای بسته، دستیارهای صوتی سفارشی بسازند.
این رویکرد یادآور رقابتهای مشابهی است که پیشتر در حوزهی مدلهای زبانی متنی شاهد آن بودهایم؛ برای مثال در مقالهی مقایسهی چتجیپیتی و دیپسیک بررسی کردهایم که چگونه مدلهای متنباز و بسته در حوزههای تخصصی با یکدیگر رقابت میکنند. برای درک بهتر جایگاه OpenAI در این اکوسیستم نیز میتوانید مقالهی OpenAI چیست؟ را مطالعه کنید.
۸. کاربردهای عملی برای توسعهدهندگان و کسبوکارها
برای توسعهدهندگان، متنباز بودن این مدل به معنای امکان سفارشیسازی کامل، آموزش تکمیلی (fine-tuning) روی دادههای اختصاصی و اجرای آن روی زیرساختهای خودشان است؛ مزیتی که در مدلهای بسته معمولاً وجود ندارد. این موضوع بهویژه برای شرکتهایی که به حریم خصوصی داده و کنترل کامل بر زیرساخت اهمیت میدهند، جذاب است.
از منظر کسبوکار نیز، دستیارهای صوتی با قابلیت فراخوانی ابزار زنده میتوانند نقش مهمی در مراکز تماس هوشمند، دستیارهای فروش صوتی، پشتیبانی مشتری بلادرنگ و حتی ایجنتهای صوتی داخلی سازمانها ایفا کنند. برای آشنایی بیشتر با اهمیت هوش مصنوعی در فضای کسبوکار، پیشنهاد میکنیم مقالهی چرا هوش مصنوعی برای کسبوکار مهم است؟ را هم بخوانید.
با این حال، باید در نظر داشت که این مدل هنوز محدودیتهای واقعی دارد، بهویژه در استدلال پیچیدهی صوتی، و نباید انتظار داشت بهسرعت جایگزین دستیارهای صوتی تجاری بالغ شود. برای درک واقعبینانه از تواناییها و محدودیتهای فعلی هوش مصنوعی، پیشتر در مقالهای مستقل به این موضوع پرداختهایم که در بخش اول همین متن نیز به آن اشاره شد.
نکتهی قابلتوجه دیگر این است که انتشار متنباز چنین مدلی، مسیر پژوهش دانشگاهی و پروژههای کوچکتر را نیز هموارتر میکند. تیمهای پژوهشی که پیشتر امکان دسترسی به مدلهای صوتی پیشرفته و دوطرفه را نداشتند، اکنون میتوانند بدون پرداخت هزینهی API، روی بهبود استدلال گفتاری، کاهش بیشتر تاخیر یا افزودن زبانهای جدید کار کنند. با توجه به سرعت بالای انتشار مدلهای جدید در این حوزه، احتمالاً در ماههای آینده شاهد نسخههای بهروزشدهتر و رقبای متنباز دیگری نیز خواهیم بود.
۹. پرسشهای متداول دربارهی Nemotron VoiceChat 11B
آیا Nemotron VoiceChat 11B رایگان است؟
بله، وزنهای مدل به صورت رایگان روی Hugging Face در دسترس است، اما تحت مجوز OpenMDW v1.1 فقط برای مصارف پژوهشی مجاز است و استفادهی تجاری مستقیم را پوشش نمیدهد.
چه تفاوتی با دستیارهای صوتی رایج مثل ChatGPT Voice یا Gemini Live دارد؟
تفاوت اصلی در متنباز بودن وزنها و قابلیت فراخوانی زندهی ابزار در وسط مکالمه است؛ ویژگیای که تاکنون در مدلهای متنباز مشابه دیده نشده بود.
آیا اجرای این مدل به سختافزار خاصی نیاز دارد؟
بله، این مدل برای اجرا به کارتهای گرافیک قدرتمند نظیر H100 یا B200 و موتور استنتاج vLLM نیاز دارد و برای دستگاههای معمولی مناسب نیست.
آیا این مدل جایگزین مدلهای زبانی بزرگ متنی میشود؟
خیر؛ این مدل به طور خاص برای پردازش گفتار و مکالمهی صوتی طراحی شده و مکمل مدلهای زبانی متنی است، نه جایگزین آنها. برای درک بهتر تفاوت میان توسعهی واقعی مدلها و ادعاهای اغراقآمیز در این حوزه، مطالعهی مقالهی توهم هوش مصنوعی: توسعهدهندهی تنها در برابر مهندس واقعی نیز خالی از لطف نیست.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
