علی‌بابا با کوئن-آدیو ۳.۱ قیمت هوش مصنوعی صوتی را ۹۵ درصد شکست

اخبار · هوش مصنوعی

علی‌بابا با مجموعه‌ی تازه‌ی کوئن-آدیو ۳.۱ وارد میدان داغ هوش مصنوعی صوتی شده و قیمت‌ها را تا ۹۵ درصد پایین آورده است؛ اتفاقی که می‌تواند معادله‌ی رقابت جهانی را تغییر دهد.

چکیده. شرکت چینی علی‌بابا از پنج مدل هوش مصنوعی صوتی تحت عنوان کوئن-آدیو ۳.۱ رونمایی کرده است؛ مدل‌هایی برای تشخیص گفتار، تبدیل متن به صدا و مکالمه‌ی بلادرنگ. نکته‌ی کلیدی این رونمایی، کاهش شدید قیمت خدمات صوتی تا سقف ۹۵ درصد است که فشار رقابتی تازه‌ای روی شرکت‌های آمریکایی این حوزه وارد می‌کند.
رونمایی علی‌بابا از کوئن-آدیو ۳.۱، مجموعه‌ی جدید مدل‌های هوش مصنوعی صوتی با کاهش قیمت تا ۹۵ درصد

۱. رونمایی علی‌بابا از نسل تازه‌ی هوش مصنوعی صوتی

بازار هوش مصنوعی صوتی این روزها یکی از داغ‌ترین میدان‌های رقابت میان غول‌های فناوری شده است و حالا یک بازیگر بزرگ چینی هم با قدرت وارد این میدان شده. شرکت علی‌بابا به‌تازگی از مجموعه‌ی جدید کوئن-آدیو ۳.۱ رونمایی کرده؛ مجموعه‌ای متشکل از پنج مدل تخصصی که هرکدام بخشی از زنجیره‌ی تعامل صوتی با هوش مصنوعی را پوشش می‌دهند. این رونمایی را می‌توان یکی از جدی‌ترین تلاش‌ها برای رقابتی‌تر کردن بازار هوش مصنوعی صوتی دانست، بازاری که تا امروز عمدتاً در اختیار چند شرکت آمریکایی بزرگ بوده است.

آنچه این رونمایی را از موارد مشابه متمایز می‌کند، تنها قابلیت‌های فنی مدل‌ها نیست، بلکه سیاست قیمت‌گذاری تهاجمی علی‌بابا در کنار آن‌هاست. برای آشنایی بیشتر با اینکه اصلاً هوش مصنوعی مولد چطور کار می‌کند و چه پتانسیل‌ها و محدودیت‌هایی دارد، می‌توانید این مقاله را درباره‌ی پتانسیل‌های واقعی هوش مصنوعی مطالعه کنید.

۲. دو مدل برای تشخیص گفتار؛ از حذف کلمات زائد تا شناسایی احساسات

نخستین بخش از مجموعه‌ی کوئن-آدیو ۳.۱ به تشخیص گفتار اختصاص دارد و شامل دو مدل می‌شود. مدل پایه برای شناسایی گفتار چندزبانه و انواع لهجه‌ها طراحی شده و می‌تواند به‌صورت خودکار کلمات زائد، مکث‌ها و تکرارهای رایج در گفتار طبیعی انسان را حذف کند؛ ویژگی‌ای که خروجی متنی تمیزتر و قابل‌استفاده‌تری تولید می‌کند.

نسخه‌ی پیشرفته‌تر که با نام ASR-Next معرفی شده، چند قدم جلوتر می‌رود. این مدل می‌تواند چند گوینده را در یک فایل صوتی شناسایی کند و زمان دقیق صحبت هرکدام را ثبت کند. علاوه بر این، قادر است لحن احساسی گوینده، صداهای محیطی و حتی صداهای مکانیکی و دستگاه‌ها را هم در کنار متن گفتار تشخیص دهد. چنین قابلیتی می‌تواند برای تولید محتوا، تحلیل مکالمات پشتیبانی مشتری و حتی ساخت زیرنویس‌های دقیق‌تر بسیار کاربردی باشد.

۳. تبدیل متن به صدا؛ کنترل لحن با یک جمله‌ی ساده

بخش دوم مجموعه به تبدیل متن به صدا اختصاص دارد و همین‌جاست که کاربران عادی هم می‌توانند تفاوت را به‌وضوح حس کنند. مدل پایه‌ی تبدیل متن به صدا، گفتار چندزبانه با انتقال طبیعی صدا میان زبان‌های مختلف تولید می‌کند. جالب اینجاست که کاربر می‌تواند فقط با نوشتن یک دستور متنی ساده، لحن، سرعت و سبک بیان صدا را تغییر دهد؛ برای مثال نوشتن عبارتی مانند «این متن را با لحنی محکم و مقتدر بخوان» کافی است تا صدای خروجی دقیقاً همان حس را منتقل کند.

نسخه‌ی پیشرفته‌تر این مدل با نام TTS-Next، ترکیبی از مدل زبانی و تکنیک‌های انتشار (دیفیوژن) به کار می‌گیرد تا بتواند صدا، افکت‌های صوتی و صدای پس‌زمینه را همزمان و در یک مرحله تولید کند. این یعنی دیگر نیازی به ترکیب چند فایل صوتی جداگانه نیست و کل صحنه‌ی صوتی در یک خروجی یکپارچه ساخته می‌شود. کسانی که با پرامپت‌نویسی برای هوش مصنوعی آشنا نیستند، می‌توانند برای شروع نگاهی به راهنمای نوشتن پرامپت برای مبتدیان بیندازند تا بهتر بتوانند از این نوع دستورهای متنی برای کنترل صدا استفاده کنند.

مدل بلادرنگ کوئن-آدیو ۳.۱ که می‌تواند وسط صحبت کاربر وارد شود و بر اساس حالت احساسی او پاسخ دهد

۴. مدل بلادرنگ؛ وقتی هوش مصنوعی وسط حرف شما می‌پرد

شاید جذاب‌ترین بخش این مجموعه، مدل بلادرنگ (Real-time) باشد. این مدل امکان مکالمه‌ی دوطرفه و همزمان با هوش مصنوعی را فراهم می‌کند؛ به این معنا که کاربر و هوش مصنوعی می‌توانند مانند یک مکالمه‌ی واقعی انسانی، همزمان صحبت کنند و حتی وسط حرف یکدیگر بپرند. این مدل قابلیت قطع کردن گفتار (interruption) را به‌صورت لحظه‌ای پشتیبانی می‌کند که تجربه‌ای بسیار طبیعی‌تر از دستیارهای صوتی رایج به کاربر می‌دهد.

ویژگی دیگر این مدل، تطبیق سرعت پاسخ‌گویی و میزان همدلی بر اساس حالت احساسی تشخیص‌داده‌شده در صدای کاربر است. اگر لحن کاربر عصبی یا ناراحت باشد، مدل می‌تواند لحن و سرعت پاسخ خود را متناسب با آن تنظیم کند. چنین قابلیتی برای کاربردهایی مانند خدمات مشتریان، مربی‌گری صوتی و حتی اپلیکیشن‌های سلامت روان اهمیت زیادی دارد. اگر می‌خواهید بدانید هوش مصنوعی در کسب‌وکارها امروز دقیقاً چه نقشی ایفا می‌کند، این مقاله درباره‌ی اهمیت هوش مصنوعی در کسب‌وکار را از دست ندهید.

۵. کاهش قیمت تا ۹۵ درصد؛ عددی که بازار را می‌لرزاند

بخشی که بیشترین توجه رسانه‌ها و تحلیلگران را به خود جلب کرده، سیاست قیمت‌گذاری علی‌بابا برای این مجموعه است. بر اساس گزارش‌های منتشرشده، قیمت سرویس تبدیل متن به صدا حدود ۷۰ درصد کاهش یافته، هزینه‌ی سرویس بلادرنگ نزدیک به ۸۵ درصد ارزان‌تر شده و قیمت سرویس تشخیص گفتار تا سقف ۹۵ درصد کاهش پیدا کرده است. این اعداد در نوع خود کم‌سابقه هستند و نشان می‌دهند علی‌بابا قصد دارد با قیمت‌گذاری تهاجمی، سهم بزرگی از بازار جهانی هوش مصنوعی صوتی را از آن خود کند.

چنین کاهش قیمتی معمولاً به‌معنای دسترسی آسان‌تر توسعه‌دهندگان کوچک‌تر و استارتاپ‌ها به فناوری‌های صوتی پیشرفته است؛ فناوری‌هایی که تا پیش از این به دلیل هزینه‌ی بالا عمدتاً در اختیار شرکت‌های بزرگ بود. همین موضوع می‌تواند به رشد سریع‌تر اپلیکیشن‌های مبتنی بر صدا در سراسر جهان کمک کند.

۶. چرا علی‌بابا این‌قدر روی هوش مصنوعی صوتی سرمایه‌گذاری می‌کند؟

علی‌بابا مدتی است که استراتژی مشخصی برای حضور جدی در بازار جهانی هوش مصنوعی دنبال می‌کند و مجموعه‌ی مدل‌های کوئن یکی از ستون‌های اصلی این استراتژی است. سرمایه‌گذاری سنگین روی صدا می‌تواند چند دلیل داشته باشد: نخست، بازار دستیارهای صوتی و اپلیکیشن‌های مبتنی بر گفتار در حال رشد سریع است. دوم، ارائه‌ی خدمات ارزان‌تر به علی‌بابا کمک می‌کند تا در بازارهای نوظهور آسیا، خاورمیانه و آفریقا سهم بیشتری به دست آورد. سوم، چنین حرکاتی معمولاً پیام روشنی به رقبا می‌فرستد: چین دیگر فقط دنباله‌رو فناوری‌های آمریکایی نیست.

برای درک بهتر جایگاه شرکت‌های چینی در رقابت جهانی هوش مصنوعی، می‌توانید نگاهی هم به مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک بیندازید که یکی دیگر از نمونه‌های رقابت فشرده‌ی شرق و غرب در حوزه‌ی هوش مصنوعی است.

نباید فراموش کرد که این رقابت فقط به دو کشور محدود نمی‌شود. شرکت‌های نوپای بسیاری در سراسر جهان، از اروپا گرفته تا خاورمیانه، در تلاش‌اند تا با تکیه بر مدل‌های متن‌باز و ارزان‌تر، سهمی از این بازار رو به رشد به دست آورند. کاهش قیمت از سوی یک بازیگر بزرگ مانند علی‌بابا معمولاً اثر زنجیره‌ای دارد و سایر شرکت‌ها را هم به بازنگری در سیاست قیمت‌گذاری خود وادار می‌کند؛ روندی که در نهایت به نفع کاربران نهایی تمام می‌شود.

تاثیر کاهش شدید قیمت کوئن-آدیو ۳.۱ علی‌بابا بر رقابت جهانی بازار هوش مصنوعی صوتی

۷. واکنش رقبای آمریکایی و آینده‌ی جنگ قیمت هوش مصنوعی

تا لحظه‌ی انتشار این خبر، شرکت‌های بزرگ آمریکایی فعال در حوزه‌ی هوش مصنوعی صوتی واکنش رسمی و مشخصی به این کاهش قیمت نداده‌اند، اما تحلیلگران بازار معتقدند بی‌توجهی به این حرکت علی‌بابا برای رقبا هزینه‌بر خواهد بود. در ماه‌های اخیر شاهد یک جنگ قیمت گسترده‌تر میان شرکت‌های بزرگ هوش مصنوعی بوده‌ایم؛ روندی که با ورود بازیگران چینی با قیمت‌های به‌مراتب پایین‌تر، احتمالاً شدت بیشتری هم پیدا خواهد کرد.

این وضعیت بار دیگر یادآور تنش همیشگی میان دو شعار رایج در صنعت هوش مصنوعی است: از یک سو هشدار درباره‌ی خطرات پیشرفت شتاب‌زده‌ی این فناوری، و از سوی دیگر فشار بازار برای عرضه‌ی سریع‌تر و ارزان‌تر محصولات. برای آشنایی بیشتر با یکی از بازیگران اصلی این عرصه و نقشی که در شکل‌گیری این رقابت داشته، می‌توانید این معرفی کامل از OpenAI را هم بخوانید.

۸. این تغییرات چه تاثیری روی کاربران عادی و کسب‌وکارها دارد؟

برای کاربران عادی، مهم‌ترین پیامد این رقابت قیمتی، دسترسی گسترده‌تر به ابزارهای صوتی باکیفیت با هزینه‌ی کمتر است. تولیدکنندگان محتوا، پادکسترها و صاحبان کسب‌وکارهای کوچک می‌توانند از این ابزارها برای تولید صداهای طبیعی‌تر، پشتیبانی مشتری خودکار و حتی تولید محتوای چندزبانه استفاده کنند. البته باید توجه داشت که با وجود پیشرفت چشمگیر این فناوری‌ها، هنوز محدودیت‌های واقعی در دقت، صحت اطلاعات و کنترل کیفیت خروجی وجود دارد که کاربران باید نسبت به آن‌ها آگاه باشند.

اگر می‌خواهید با ابزارهای عملی‌تر مرتبط با چت‌جی‌پی‌تی هم آشنا شوید تا در کنار این فناوری‌های صوتی از آن‌ها بهره ببرید، سری به بخش آموزش‌های چت‌جی‌پی‌تی در سایت ما بزنید. همچنین برای دنبال کردن به‌روزترین اخبار روز دنیای هوش مصنوعی، صفحه‌ی اخبار هوش مصنوعی مای چت‌جی‌پی‌تی همیشه به‌روز است.

نکته‌ی دیگری که کسب‌وکارها باید به آن توجه کنند، تفاوت میان استفاده‌ی آزمایشی و استفاده‌ی حرفه‌ای از این مدل‌هاست. ارزان شدن قیمت به‌تنهایی تضمین‌کننده‌ی موفقیت یک محصول یا سرویس نیست؛ کیفیت پیاده‌سازی، تجربه‌ی کاربری و میزان دقت مدل در زبان و لهجه‌ی مخاطب هدف هم نقش تعیین‌کننده‌ای دارند. به همین دلیل توصیه می‌شود پیش از مهاجرت کامل به یک سرویس صوتی تازه، ابتدا آن را در مقیاس کوچک و برای یک کاربرد مشخص آزمایش کنید.

۹. سوالات متداول

کوئن-آدیو ۳.۱ چیست؟

کوئن-آدیو ۳.۱ مجموعه‌ای از پنج مدل هوش مصنوعی صوتی ساخت شرکت علی‌بابا است که تشخیص گفتار، تبدیل متن به صدا و مکالمه‌ی بلادرنگ را پوشش می‌دهد.

چرا این رونمایی این‌قدر مهم است؟

مهم‌ترین دلیل، کاهش قیمت شدید خدمات صوتی تا سقف ۹۵ درصد است که می‌تواند فشار رقابتی تازه‌ای بر شرکت‌های آمریکایی وارد کند و دسترسی به فناوری صوتی پیشرفته را برای توسعه‌دهندگان کوچک‌تر آسان‌تر کند.

مدل بلادرنگ چه کاری انجام می‌دهد؟

این مدل امکان مکالمه‌ی دوطرفه و همزمان با هوش مصنوعی، از جمله قطع کردن گفتار وسط صحبت، و تنظیم لحن پاسخ بر اساس حالت احساسی کاربر را فراهم می‌کند.

آیا این مدل‌ها از زبان فارسی هم پشتیبانی می‌کنند؟

شرکت علی‌بابا از پشتیبانی چندزبانه‌ی گسترده برای این مجموعه خبر داده، اما جزئیات دقیق فهرست زبان‌ها و کیفیت پشتیبانی از هر زبان هنوز به‌طور کامل منتشر نشده است.

جمع‌بندی. رونمایی علی‌بابا از کوئن-آدیو ۳.۱ و کاهش قیمت تا ۹۵ درصد، یکی از جدی‌ترین تکانه‌های اخیر بازار هوش مصنوعی صوتی است و می‌تواند نقطه‌ی شروع یک جنگ قیمت تازه میان شرکت‌های چینی و آمریکایی باشد. برای دنبال کردن ادامه‌ی این رقابت داغ و تازه‌ترین اخبار هوش مصنوعی، کانال تلگرام ما را دنبال کنید: @MrChatGPT_IR

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *