علیبابا با مجموعهی تازهی کوئن-آدیو ۳.۱ وارد میدان داغ هوش مصنوعی صوتی شده و قیمتها را تا ۹۵ درصد پایین آورده است؛ اتفاقی که میتواند معادلهی رقابت جهانی را تغییر دهد.

لیست مطالب
۱. رونمایی علیبابا از نسل تازهی هوش مصنوعی صوتی
بازار هوش مصنوعی صوتی این روزها یکی از داغترین میدانهای رقابت میان غولهای فناوری شده است و حالا یک بازیگر بزرگ چینی هم با قدرت وارد این میدان شده. شرکت علیبابا بهتازگی از مجموعهی جدید کوئن-آدیو ۳.۱ رونمایی کرده؛ مجموعهای متشکل از پنج مدل تخصصی که هرکدام بخشی از زنجیرهی تعامل صوتی با هوش مصنوعی را پوشش میدهند. این رونمایی را میتوان یکی از جدیترین تلاشها برای رقابتیتر کردن بازار هوش مصنوعی صوتی دانست، بازاری که تا امروز عمدتاً در اختیار چند شرکت آمریکایی بزرگ بوده است.
آنچه این رونمایی را از موارد مشابه متمایز میکند، تنها قابلیتهای فنی مدلها نیست، بلکه سیاست قیمتگذاری تهاجمی علیبابا در کنار آنهاست. برای آشنایی بیشتر با اینکه اصلاً هوش مصنوعی مولد چطور کار میکند و چه پتانسیلها و محدودیتهایی دارد، میتوانید این مقاله را دربارهی پتانسیلهای واقعی هوش مصنوعی مطالعه کنید.
۲. دو مدل برای تشخیص گفتار؛ از حذف کلمات زائد تا شناسایی احساسات
نخستین بخش از مجموعهی کوئن-آدیو ۳.۱ به تشخیص گفتار اختصاص دارد و شامل دو مدل میشود. مدل پایه برای شناسایی گفتار چندزبانه و انواع لهجهها طراحی شده و میتواند بهصورت خودکار کلمات زائد، مکثها و تکرارهای رایج در گفتار طبیعی انسان را حذف کند؛ ویژگیای که خروجی متنی تمیزتر و قابلاستفادهتری تولید میکند.
نسخهی پیشرفتهتر که با نام ASR-Next معرفی شده، چند قدم جلوتر میرود. این مدل میتواند چند گوینده را در یک فایل صوتی شناسایی کند و زمان دقیق صحبت هرکدام را ثبت کند. علاوه بر این، قادر است لحن احساسی گوینده، صداهای محیطی و حتی صداهای مکانیکی و دستگاهها را هم در کنار متن گفتار تشخیص دهد. چنین قابلیتی میتواند برای تولید محتوا، تحلیل مکالمات پشتیبانی مشتری و حتی ساخت زیرنویسهای دقیقتر بسیار کاربردی باشد.
۳. تبدیل متن به صدا؛ کنترل لحن با یک جملهی ساده
بخش دوم مجموعه به تبدیل متن به صدا اختصاص دارد و همینجاست که کاربران عادی هم میتوانند تفاوت را بهوضوح حس کنند. مدل پایهی تبدیل متن به صدا، گفتار چندزبانه با انتقال طبیعی صدا میان زبانهای مختلف تولید میکند. جالب اینجاست که کاربر میتواند فقط با نوشتن یک دستور متنی ساده، لحن، سرعت و سبک بیان صدا را تغییر دهد؛ برای مثال نوشتن عبارتی مانند «این متن را با لحنی محکم و مقتدر بخوان» کافی است تا صدای خروجی دقیقاً همان حس را منتقل کند.
نسخهی پیشرفتهتر این مدل با نام TTS-Next، ترکیبی از مدل زبانی و تکنیکهای انتشار (دیفیوژن) به کار میگیرد تا بتواند صدا، افکتهای صوتی و صدای پسزمینه را همزمان و در یک مرحله تولید کند. این یعنی دیگر نیازی به ترکیب چند فایل صوتی جداگانه نیست و کل صحنهی صوتی در یک خروجی یکپارچه ساخته میشود. کسانی که با پرامپتنویسی برای هوش مصنوعی آشنا نیستند، میتوانند برای شروع نگاهی به راهنمای نوشتن پرامپت برای مبتدیان بیندازند تا بهتر بتوانند از این نوع دستورهای متنی برای کنترل صدا استفاده کنند.

۴. مدل بلادرنگ؛ وقتی هوش مصنوعی وسط حرف شما میپرد
شاید جذابترین بخش این مجموعه، مدل بلادرنگ (Real-time) باشد. این مدل امکان مکالمهی دوطرفه و همزمان با هوش مصنوعی را فراهم میکند؛ به این معنا که کاربر و هوش مصنوعی میتوانند مانند یک مکالمهی واقعی انسانی، همزمان صحبت کنند و حتی وسط حرف یکدیگر بپرند. این مدل قابلیت قطع کردن گفتار (interruption) را بهصورت لحظهای پشتیبانی میکند که تجربهای بسیار طبیعیتر از دستیارهای صوتی رایج به کاربر میدهد.
ویژگی دیگر این مدل، تطبیق سرعت پاسخگویی و میزان همدلی بر اساس حالت احساسی تشخیصدادهشده در صدای کاربر است. اگر لحن کاربر عصبی یا ناراحت باشد، مدل میتواند لحن و سرعت پاسخ خود را متناسب با آن تنظیم کند. چنین قابلیتی برای کاربردهایی مانند خدمات مشتریان، مربیگری صوتی و حتی اپلیکیشنهای سلامت روان اهمیت زیادی دارد. اگر میخواهید بدانید هوش مصنوعی در کسبوکارها امروز دقیقاً چه نقشی ایفا میکند، این مقاله دربارهی اهمیت هوش مصنوعی در کسبوکار را از دست ندهید.
۵. کاهش قیمت تا ۹۵ درصد؛ عددی که بازار را میلرزاند
بخشی که بیشترین توجه رسانهها و تحلیلگران را به خود جلب کرده، سیاست قیمتگذاری علیبابا برای این مجموعه است. بر اساس گزارشهای منتشرشده، قیمت سرویس تبدیل متن به صدا حدود ۷۰ درصد کاهش یافته، هزینهی سرویس بلادرنگ نزدیک به ۸۵ درصد ارزانتر شده و قیمت سرویس تشخیص گفتار تا سقف ۹۵ درصد کاهش پیدا کرده است. این اعداد در نوع خود کمسابقه هستند و نشان میدهند علیبابا قصد دارد با قیمتگذاری تهاجمی، سهم بزرگی از بازار جهانی هوش مصنوعی صوتی را از آن خود کند.
چنین کاهش قیمتی معمولاً بهمعنای دسترسی آسانتر توسعهدهندگان کوچکتر و استارتاپها به فناوریهای صوتی پیشرفته است؛ فناوریهایی که تا پیش از این به دلیل هزینهی بالا عمدتاً در اختیار شرکتهای بزرگ بود. همین موضوع میتواند به رشد سریعتر اپلیکیشنهای مبتنی بر صدا در سراسر جهان کمک کند.
۶. چرا علیبابا اینقدر روی هوش مصنوعی صوتی سرمایهگذاری میکند؟
علیبابا مدتی است که استراتژی مشخصی برای حضور جدی در بازار جهانی هوش مصنوعی دنبال میکند و مجموعهی مدلهای کوئن یکی از ستونهای اصلی این استراتژی است. سرمایهگذاری سنگین روی صدا میتواند چند دلیل داشته باشد: نخست، بازار دستیارهای صوتی و اپلیکیشنهای مبتنی بر گفتار در حال رشد سریع است. دوم، ارائهی خدمات ارزانتر به علیبابا کمک میکند تا در بازارهای نوظهور آسیا، خاورمیانه و آفریقا سهم بیشتری به دست آورد. سوم، چنین حرکاتی معمولاً پیام روشنی به رقبا میفرستد: چین دیگر فقط دنبالهرو فناوریهای آمریکایی نیست.
برای درک بهتر جایگاه شرکتهای چینی در رقابت جهانی هوش مصنوعی، میتوانید نگاهی هم به مقایسهی چتجیپیتی و دیپسیک بیندازید که یکی دیگر از نمونههای رقابت فشردهی شرق و غرب در حوزهی هوش مصنوعی است.
نباید فراموش کرد که این رقابت فقط به دو کشور محدود نمیشود. شرکتهای نوپای بسیاری در سراسر جهان، از اروپا گرفته تا خاورمیانه، در تلاشاند تا با تکیه بر مدلهای متنباز و ارزانتر، سهمی از این بازار رو به رشد به دست آورند. کاهش قیمت از سوی یک بازیگر بزرگ مانند علیبابا معمولاً اثر زنجیرهای دارد و سایر شرکتها را هم به بازنگری در سیاست قیمتگذاری خود وادار میکند؛ روندی که در نهایت به نفع کاربران نهایی تمام میشود.

۷. واکنش رقبای آمریکایی و آیندهی جنگ قیمت هوش مصنوعی
تا لحظهی انتشار این خبر، شرکتهای بزرگ آمریکایی فعال در حوزهی هوش مصنوعی صوتی واکنش رسمی و مشخصی به این کاهش قیمت ندادهاند، اما تحلیلگران بازار معتقدند بیتوجهی به این حرکت علیبابا برای رقبا هزینهبر خواهد بود. در ماههای اخیر شاهد یک جنگ قیمت گستردهتر میان شرکتهای بزرگ هوش مصنوعی بودهایم؛ روندی که با ورود بازیگران چینی با قیمتهای بهمراتب پایینتر، احتمالاً شدت بیشتری هم پیدا خواهد کرد.
این وضعیت بار دیگر یادآور تنش همیشگی میان دو شعار رایج در صنعت هوش مصنوعی است: از یک سو هشدار دربارهی خطرات پیشرفت شتابزدهی این فناوری، و از سوی دیگر فشار بازار برای عرضهی سریعتر و ارزانتر محصولات. برای آشنایی بیشتر با یکی از بازیگران اصلی این عرصه و نقشی که در شکلگیری این رقابت داشته، میتوانید این معرفی کامل از OpenAI را هم بخوانید.
۸. این تغییرات چه تاثیری روی کاربران عادی و کسبوکارها دارد؟
برای کاربران عادی، مهمترین پیامد این رقابت قیمتی، دسترسی گستردهتر به ابزارهای صوتی باکیفیت با هزینهی کمتر است. تولیدکنندگان محتوا، پادکسترها و صاحبان کسبوکارهای کوچک میتوانند از این ابزارها برای تولید صداهای طبیعیتر، پشتیبانی مشتری خودکار و حتی تولید محتوای چندزبانه استفاده کنند. البته باید توجه داشت که با وجود پیشرفت چشمگیر این فناوریها، هنوز محدودیتهای واقعی در دقت، صحت اطلاعات و کنترل کیفیت خروجی وجود دارد که کاربران باید نسبت به آنها آگاه باشند.
اگر میخواهید با ابزارهای عملیتر مرتبط با چتجیپیتی هم آشنا شوید تا در کنار این فناوریهای صوتی از آنها بهره ببرید، سری به بخش آموزشهای چتجیپیتی در سایت ما بزنید. همچنین برای دنبال کردن بهروزترین اخبار روز دنیای هوش مصنوعی، صفحهی اخبار هوش مصنوعی مای چتجیپیتی همیشه بهروز است.
نکتهی دیگری که کسبوکارها باید به آن توجه کنند، تفاوت میان استفادهی آزمایشی و استفادهی حرفهای از این مدلهاست. ارزان شدن قیمت بهتنهایی تضمینکنندهی موفقیت یک محصول یا سرویس نیست؛ کیفیت پیادهسازی، تجربهی کاربری و میزان دقت مدل در زبان و لهجهی مخاطب هدف هم نقش تعیینکنندهای دارند. به همین دلیل توصیه میشود پیش از مهاجرت کامل به یک سرویس صوتی تازه، ابتدا آن را در مقیاس کوچک و برای یک کاربرد مشخص آزمایش کنید.
۹. سوالات متداول
کوئن-آدیو ۳.۱ چیست؟
کوئن-آدیو ۳.۱ مجموعهای از پنج مدل هوش مصنوعی صوتی ساخت شرکت علیبابا است که تشخیص گفتار، تبدیل متن به صدا و مکالمهی بلادرنگ را پوشش میدهد.
چرا این رونمایی اینقدر مهم است؟
مهمترین دلیل، کاهش قیمت شدید خدمات صوتی تا سقف ۹۵ درصد است که میتواند فشار رقابتی تازهای بر شرکتهای آمریکایی وارد کند و دسترسی به فناوری صوتی پیشرفته را برای توسعهدهندگان کوچکتر آسانتر کند.
مدل بلادرنگ چه کاری انجام میدهد؟
این مدل امکان مکالمهی دوطرفه و همزمان با هوش مصنوعی، از جمله قطع کردن گفتار وسط صحبت، و تنظیم لحن پاسخ بر اساس حالت احساسی کاربر را فراهم میکند.
آیا این مدلها از زبان فارسی هم پشتیبانی میکنند؟
شرکت علیبابا از پشتیبانی چندزبانهی گسترده برای این مجموعه خبر داده، اما جزئیات دقیق فهرست زبانها و کیفیت پشتیبانی از هر زبان هنوز بهطور کامل منتشر نشده است.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
