گوگل جمینی ۳.۸ را رونمایی کرد: دو هزار صدای هوش مصنوعی و شبیه‌سازی صدا در سی ثانیه

اخبار · هوش مصنوعی

گوگل با معرفی جمینی ۳.۸ فلش و فلش‌لایت، صدای مصنوعی را از چند گزینهٔ ثابت به کتابخانه‌ای با دو هزار صدا و قابلیت شبیه‌سازی در سی ثانیه رساند.

چکیده. گوگل دو مدل تازه برای تبدیل متن به صدا رونمایی کرده که کتابخانه‌ای با بیش از دو هزار صدای طبیعی، پوشش صد زبان و گویش، و قابلیت بحث‌برانگیز شبیه‌سازی صدا با فقط سی ثانیه نمونهٔ صوتی را در اختیار توسعه‌دهندگان می‌گذارد. برای مهار خطر سوءاستفاده، تمام خروجی‌ها با واترمارک نامرئی سینتید نشانه‌گذاری می‌شوند.
رونمایی گوگل از مدل صدای جمینی ۳.۸ فلش با بیش از دو هزار صدای هوش مصنوعی

۱. ماجرا از کجا شروع شد؟

روز چهارشنبه، تیم جمینی گوگل از دو مدل جدید صدا رونمایی کرد: Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS. این عرضه در بحبوحهٔ رقابتی داغ میان آزمایشگاه‌های بزرگ هوش مصنوعی بر سر صدای دیجیتال اتفاق افتاد؛ رقابتی که این روزها به همان اندازهٔ مسابقهٔ مدل‌های متنی جدی شده است. برای آشنایی با روند کلی این مسابقه می‌توانید سری اخبار هوش مصنوعی را هم دنبال کنید.

نکتهٔ مهم این عرضه، فاصله‌گرفتن از منطق قدیمی «چند صدای از پیش ساخته» است. تا پیش از این، بیشتر ابزارهای تبدیل متن به صدا کاربر را محدود به چند گزینهٔ ثابت می‌کردند؛ اما گوگل حالا کتابخانه‌ای تقریباً نامتناهی از صداها را در دسترس گذاشته که هم برای توسعه‌دهندگان جذاب است و هم برای استودیوهای تولید محتوا.

شرکت‌های فعال در حوزهٔ صدای مصنوعی طی دو سال گذشته رشد چشمگیری داشته‌اند و بخش بزرگی از این رشد به بلوغ فناوری تبدیل متن به گفتار برمی‌گردد. تا همین چند سال پیش، صدای تولیدشده با هوش مصنوعی به‌راحتی از صدای انسانی قابل‌تشخیص بود، اما با معرفی مدل‌هایی مثل جمینی ۳.۸، این فاصله عملاً به صفر نزدیک شده است. همین موضوع باعث شده رگولاتورها و پلتفرم‌های رسانه‌ای هم فشار بیشتری برای شفاف‌سازی منشأ صدا وارد کنند.

۲. جمینی ۳.۸ فلش و فلش‌لایت چه تفاوتی دارند؟

دو مدل تازه هرچند از یک خانواده هستند، اما برای دو هدف متفاوت طراحی شده‌اند. شناخت این تفاوت برای هر کسی که می‌خواهد از این فناوری در پروژهٔ خودش استفاده کند، نقطهٔ شروع خوبی است.

مدل فلش برای خلق محتوا

نسخهٔ Flash روی کیفیت و بیان احساسی صدا تمرکز دارد و برای پروژه‌های خلاقانه مثل بازی‌های رایانه‌ای، کتاب‌های صوتی همراه با اجرای نقش، پادکست‌های چندنفره و رسانه‌های تعاملی ساخته شده است. این مدل امکان «کارگردانی خط‌به‌خط» را هم فراهم می‌کند؛ یعنی سازنده می‌تواند با یک توصیف متنی ساده مشخص کند که هر جمله با چه لحن، سرعت و حالتی خوانده شود.

مدل فلش‌لایت برای مقیاس اقتصادی

در مقابل، نسخهٔ Flash-Lite برای پروژه‌های حجیم و کم‌هزینه طراحی شده؛ جایی که هدف دوبلهٔ حجم بالا، عامل‌های صوتی مکالمه‌محور یا تولید انبوه محتواست، نه لزوماً بالاترین سطح بیان هنری. قیمت‌گذاری این مدل هم در همین راستا پایین‌تر تعریف شده تا برای کاربرد در مقیاس بزرگ مقرون‌به‌صرفه باشد.

۳. کتابخانه‌ای با دو هزار صدا و طراحی صدا با متن

پیش از این عرضه، کتابخانهٔ صدای جمینی تنها حدود سی صدای ثابت داشت. حالا این عدد به بیش از دو هزار صدای آماده رسیده و کاربران می‌توانند با نوشتن یک توصیف ساده دربارهٔ نقش، لهجه و شخصیت صدا، مدل را وادار کنند یک صدای کاملاً تازه برایشان بسازد. این رویکرد، طراحی صدا را به همان اندازهٔ نوشتن یک درخواست متنی ساده کرده است؛ اگر با اصول نوشتن پرامپت آشنا نیستید، راهنمای نوشتن پرامپت برای مبتدی‌ها نقطهٔ شروع خوبی است، چون همان منطق برای طراحی صدا هم کاربرد دارد.

از دیگر قابلیت‌های این نسخه می‌توان به تولید محتوای طولانی با حفظ یکدستی صدا در طول ساعت‌ها، صحنه‌سازی طبیعی برای گفت‌وگوی دو نفره، و افزودن واکنش‌های صوتی کوچک مثل «هوم» یا خنده‌های کوتاه برای طبیعی‌تر شدن مکالمه اشاره کرد. قابلیت ریمیکس صدا -یعنی تغییر تن، سرعت و لهجهٔ یک صدای موجود- هم به‌زودی اضافه خواهد شد.

۴. شبیه‌سازی صدا در سی ثانیه؛ فرصت یا خطر؟

جنجالی‌ترین بخش این عرضه، قابلیت شبیه‌سازی صداست. کاربر تنها با ارائهٔ سی ثانیه نمونهٔ صوتی می‌تواند نسخه‌ای مصنوعی از یک صدای واقعی بسازد. گوگل تأکید کرده که برای جلوگیری از سوءاستفاده، این فرآیند به ضبط رضایت شفاهی گویندهٔ اصلی نیاز دارد و سیستم آن را با نمونهٔ صدای اولیه تطبیق می‌دهد.

با این حال، همین قابلیت است که نگرانی‌های قدیمی دربارهٔ سوءاستفاده از دیپ‌فیک صوتی را دوباره زنده می‌کند. تجربهٔ چند سال اخیر نشان داده که هر جهش در توانایی‌های هوش مصنوعی، هم فرصت تازه می‌سازد و هم ریسک تازه به همراه می‌آورد؛ موضوعی که در تحلیل پتانسیل و محدودیت‌های واقعی هوش مصنوعی هم به‌تفصیل بررسی شده است.

قابلیت شبیه‌سازی صدا در جمینی ۳.۸ با سی ثانیه نمونهٔ صوتی و تایید رضایت گوینده

۵. واترمارک نامرئی سینتید و اعتبارنامهٔ C2PA

برای مهار همین ریسک، گوگل تمام خروجی‌های صوتی این مدل‌ها را با فناوری واترمارک نامرئی سینتید نشانه‌گذاری می‌کند؛ نشانه‌ای دیجیتال که در خود موج صوتی جاسازی شده و حتی پس از فشرده‌سازی یا ویرایش صدا هم قابل شناسایی باقی می‌ماند. این یعنی در تئوری، هر ابزار یا پلتفرمی که به این استاندارد مجهز باشد می‌تواند تشخیص دهد یک فایل صوتی توسط هوش مصنوعی گوگل تولید شده یا نه.

علاوه بر این، صداهای شبیه‌سازی‌شده دارای اعتبارنامهٔ محتوایی C2PA هم هستند؛ استانداردی صنعتی که منشأ و تاریخچهٔ یک فایل رسانه‌ای را ثبت می‌کند. ترکیب این دو لایهٔ ایمنی نشان می‌دهد گوگل تلاش کرده همزمان با گسترش قدرت این ابزار، چارچوبی برای شفافیت و ردیابی هم بسازد؛ هرچند پرسش دربارهٔ کفایت این چارچوب همچنان باز است.

۶. کاربردهای صنعتی: از بازی تا دوبلاژ و کسب‌وکار

کاربردهای معرفی‌شده برای این مدل‌ها طیف گسترده‌ای را پوشش می‌دهند: صداپیشگی در بازی‌های رایانه‌ای، کتاب‌های صوتی غوطه‌ورکننده، پادکست‌های چندنفره، دوبلهٔ حجم بالا برای پلتفرم‌های استریم، و عامل‌های صوتی مکالمه‌محور برای پشتیبانی مشتری. برای کسب‌وکارهایی که هنوز نمی‌دانند چرا باید سراغ چنین ابزارهایی بروند، مقالهٔ اهمیت هوش مصنوعی برای کسب‌وکار تصویر روشنی از این مسیر ارائه می‌دهد.

در دسترسی به این مدل‌ها هم تفاوت‌هایی دیده می‌شود؛ نسخهٔ Flash از طریق واسط برنامه‌نویسی، استودیوی هوش مصنوعی گوگل و دفترچهٔ جمینی برای همگان قابل استفاده است، در حالی که نسخهٔ Flash-Lite در کنار واسط برنامه‌نویسی، وارد ابزار Google Vids هم شده است. نسخهٔ سازمانی هر دو مدل نیز به‌زودی از طریق جمینی اینترپرایز عرضه خواهد شد.

از منظر اقتصادی هم این عرضه قابل‌توجه است. نسخهٔ فلش‌لایت با قیمتی به‌مراتب پایین‌تر از نسخهٔ استاندارد قیمت‌گذاری شده تا استودیوهایی که نیاز به تولید انبوه صدا دارند -مثل پلتفرم‌های دوبلهٔ فیلم و سریال یا سازندگان اپلیکیشن‌های آموزش زبان- بتوانند بدون نگرانی از هزینهٔ سنگین، از این فناوری استفاده کنند. این روند کاهش هزینه با روند کلی صنعت هوش مصنوعی هم‌راستاست؛ جایی که هزینهٔ رسیدن به یک سطح مشخص از عملکرد هر سال به‌طور چشمگیری کاهش می‌یابد.

۷. عملکرد در آزمون‌های مستقل و پوشش زبانی

پوشش زبانی این مدل‌ها از صد زبان و گویش عبور می‌کند و شامل لهجه‌های منطقه‌ای مثل اسپانیایی مکزیک، فرانسوی کبک، انگلیسی اسکاتلندی، پرتغالی برزیل، عربی معیار و هندی هم می‌شود. در آزمون‌های مستقل کیفیت صدا -از جمله رتبه‌بندی طراحی صدای هیوم ای‌آی- مدل فلش رتبهٔ نخست را از آن خود کرده و در مدل‌سازی لهجه هم پیشتاز بوده است.

در آزمون‌های ترجیح کاربران هم هر دو مدل در چند زبان از جمله ژاپنی، پرتغالی برزیل، ویتنامی، عربی، اسپانیایی مکزیک و هندی در بالای جدول قرار گرفته‌اند. این نتایج نشان می‌دهد گوگل تمرکز ویژه‌ای روی بازارهای غیرانگلیسی‌زبان داشته؛ نکته‌ای که برای کاربران فارسی‌زبان هم امیدوارکننده است، چون معمولاً افزایش کیفیت در زبان‌های منطقه‌ای با تأخیر به زبان‌های کم‌منبع‌تر هم می‌رسد.

۸. رقابت گوگل، اوپن‌ای‌آی و آینده صدای دیجیتال

این عرضه را باید در بستر رقابت گسترده‌تر آزمایشگاه‌های هوش مصنوعی دید. اوپن‌ای‌آی هم این روزها مسیر مشابهی را با گسترش تجربهٔ صوتی چت‌جی‌پی‌تی دنبال می‌کند و شرکت‌های نوپای صدا مانند هیوم هم در همین میدان فعال‌اند. برای درک بهتر اینکه اوپن‌ای‌آی چگونه شکل گرفته و چرا این‌قدر در کانون رقابت قرار دارد، می‌توانید نگاهی به مطلب اوپن‌ای‌آی چیست بیندازید.

الگوی این رقابت شباهت زیادی به نبرد مدل‌های متنی و استدلالی دارد؛ جایی که هر آزمایشگاه سعی می‌کند با یک ویژگی متمایزکننده از رقبا جلو بزند. تحلیل نبرد هوش مصنوعی‌های شطرنج‌باز چت‌جی‌پی‌تی و دیپ‌سیک هم نمونهٔ خوبی از همین الگوی رقابت فشرده در حوزه‌ای دیگر است. آنچه مشخص است این‌که صدای مصنوعی دیگر یک ویژگی جانبی نیست، بلکه به یکی از میدان‌های اصلی جنگ محصول در سال ۲۰۲۶ تبدیل شده است.

فناوری واترمارک SynthID در خروجی صوتی جمینی ۳.۸ برای شفافیت و جلوگیری از سوءاستفاده

۹. این تحول برای توسعه‌دهندگان فارسی‌زبان چه معنایی دارد؟

برای توسعه‌دهندگان و سازندگان محتوای فارسی‌زبان، این عرضه دو پیام دارد. اول اینکه ساخت محصولات صوتی -از اپلیکیشن‌های آموزشی تا پادکست و ربات‌های صوتی- حالا با هزینه و پیچیدگی کمتری ممکن شده است. دوم اینکه فاصلهٔ میان یک «توسعه‌دهندهٔ واقعی» که این ابزارها را می‌فهمد و به‌درستی استفاده می‌کند، با کسی که صرفاً روی دکمه‌ها کلیک می‌کند، دارد بیشتر می‌شود؛ موضوعی که مقالهٔ توهم توسعه‌دهندهٔ تنها در برابر مهندس واقعی به‌خوبی باز کرده است.

اگر می‌خواهید با نحوهٔ کار عملی با چنین ابزارهایی آشنا شوید، بخش آموزش‌های چت‌جی‌پی‌تی ما می‌تواند نقطهٔ شروع خوبی باشد، چون بسیاری از تکنیک‌های نوشتن درخواست و طراحی گردش‌کار که آنجا آموزش داده می‌شود، عیناً برای کار با مدل‌های صوتی تازه هم قابل استفاده است.

سوالات متداول

آیا جمینی ۳.۸ فلش رایگان است؟
دسترسی به این مدل‌ها عمدتاً از طریق واسط برنامه‌نویسی و استودیوی هوش مصنوعی گوگل و با تعرفهٔ مبتنی بر مصرف انجام می‌شود؛ گرچه برخی قابلیت‌ها در ابزارهایی مثل دفترچهٔ جمینی برای همگان هم در دسترس است.

چگونه می‌توان فهمید یک صدا با هوش مصنوعی ساخته شده؟
واترمارک نامرئی سینتید در تمام خروجی‌های این مدل جاسازی می‌شود و ابزارهای سازگار با این استاندارد می‌توانند آن را تشخیص دهند.

برای شبیه‌سازی صدای یک شخص چه چیزی لازم است؟
سی ثانیه نمونهٔ صوتی از آن شخص و ضبط رضایت شفاهی او که با نمونهٔ اولیه تطبیق داده می‌شود.

این مدل چند زبان را پشتیبانی می‌کند؟
بیش از صد زبان و گویش، از جمله چند لهجهٔ منطقه‌ای مانند اسپانیایی مکزیک و پرتغالی برزیل.

جمع‌بندی. رونمایی جمینی ۳.۸ فلش و فلش‌لایت نشان می‌دهد صدای مصنوعی وارد فاز تازه‌ای شده؛ فازی که در آن کیفیت، تنوع و سرعت تولید صدا به‌شدت بالا رفته، اما مسئولیت تشخیص و کنترل سوءاستفاده هم سنگین‌تر شده است. برای دنبال‌کردن ادامهٔ این رقابت داغ میان گوگل، اوپن‌ای‌آی و دیگر بازیگران هوش مصنوعی، کانال ما @MrChatGPT_IR را دنبال کنید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *