رونمایی از GPT-Live؛ دستیار صوتی تازه‌ی ChatGPT که هم‌زمان گوش می‌دهد و حرف می‌زند

خبر ویژه · هوش مصنوعی

اوپن‌ای‌آی حالت صوتی ChatGPT را از پایه بازطراحی کرد؛ مدلی که هم‌زمان گوش می‌دهد و حرف می‌زند، وسط حرفتان نمی‌پرد و می‌تواند صحبت شما را به‌صورت زنده ترجمه کند.

چکیده. اوپن‌ای‌آی نسل تازه‌ای از مدل‌های صوتی خود با نام GPT-Live را معرفی کرد که از این پس موتور بخش «گفت‌وگوی صوتی» ChatGPT است. برخلاف حالت پیشین که از زنجیره‌ی جداگانه‌ی تبدیل گفتار به متن، مدل زبانی و تبدیل متن به گفتار استفاده می‌کرد، GPT-Live با معماری «تمام‌دوطرفه» ساخته شده و می‌تواند در آنِ واحد بشنود و صحبت کند. نسخه‌ی سبک آن برای کاربران رایگان هم فعال شده و عرضه‌ی جهانی روی iOS، اندروید و وب آغاز شده است.

GPT-Live چیست و چه فرقی با نسخه‌ی قبل دارد؟

اوپن‌ای‌آی در هشتم ژوئیه‌ی ۲۰۲۶ از نسل تازه‌ای از مدل‌های صوتی خود با نام GPT-Live رونمایی کرد؛ فناوری‌ای که از این پس موتور اصلی بخش «گفت‌وگوی صوتی» در ChatGPT خواهد بود. تفاوت اصلی این مدل با نسخه‌ی پیشین، یعنی Advanced Voice Mode، در نحوه‌ی ساخت آن است. حالت قبلی در واقع از سه بخش جدا تشکیل می‌شد که پشت سر هم کار می‌کردند: نخست گفتار کاربر به متن تبدیل می‌شد، سپس یک مدل زبانی متن را پردازش می‌کرد و در پایان پاسخ دوباره به گفتار برمی‌گشت. همین زنجیره باعث می‌شد پاسخ‌ها با کمی تأخیر بیایند، قطع کردن حرف مدل دشوار باشد و گفت‌وگو کمتر شبیه یک مکالمه‌ی واقعی به نظر برسد.

معماری «تمام‌دوطرفه»؛ گوش دادن و حرف زدن در آنِ واحد

GPT-Live بر پایه‌ی معماری «تمام‌دوطرفه» یا Full-Duplex ساخته شده است؛ یعنی می‌تواند هم‌زمان هم گوش بدهد و هم صحبت کند، درست مثل دو انسان که با هم گفت‌وگو می‌کنند. این مدل چندین بار در ثانیه تصمیم می‌گیرد که سکوت کند، ادامه بدهد یا واکنش نشان دهد. نتیجه‌ی عملی این معماری آن است که می‌توانید وسط جمله‌ی مدل بپرید، حرفش را قطع کنید یا موضوع را عوض کنید، بی‌آنکه رشته‌ی گفت‌وگو از دستش در برود. اوپن‌ای‌آی می‌گوید مدل حتی برای طبیعی‌تر شدن مکالمه، گاهی مانند انسان‌ها واژه‌های تأییدی کوتاهی مثل «اوهوم» یا «بله» به کار می‌برد و می‌تواند هنگام گوش دادن ساکت بماند تا منظور شما را کامل دریافت کند.

ترجمه‌ی زنده و سپردن کارهای سنگین به GPT-5.5

یکی از کاربردی‌ترین قابلیت‌های GPT-Live، ترجمه‌ی زنده است: کاربر صحبت می‌کند و گفتارش تقریباً هم‌زمان به زبانی دیگر برگردانده می‌شود؛ ابزاری که می‌تواند مرز زبان را در سفر، کار و ارتباط روزمره کمرنگ کند. نکته‌ی فنی مهم این است که خودِ مدل صوتی سبک و سریع طراحی شده تا مکالمه روان بماند؛ اما هر جا پرسش پیچیده‌تری مطرح شود، GPT-Live کار را در پس‌زمینه به مدل قدرتمندتر GPT-5.5 می‌سپارد تا جست‌وجو، استدلال و کارهای سنگین‌تر انجام شود، بی‌آنکه جریان گفت‌وگو کند یا قطع شود.

نسخه‌ها، دسترسی و خبر خوب برای کاربران رایگان

اوپن‌ای‌آی این فناوری را در چند نسخه عرضه کرده است؛ از GPT-Live-1 به‌عنوان مدل کامل تا نسخه‌ی سبک‌تر mini. عرضه‌ی جهانی آن روی iOS، اندروید و وب‌سایت ChatGPT آغاز شده است. مهم‌ترین نکته برای کاربران عادی این است که نسخه‌ی mini به‌صورت پیش‌فرض جایگزین حالت صوتی قبلی برای کاربران رایگان شده و کاربران اشتراک‌های Plus و Pro به مدل کامل GPT-Live-1 دسترسی دارند. دسترسی توسعه‌دهندگان از راه API نیز به گفته‌ی شرکت «به‌زودی» فراهم می‌شود.

چرا این خبر مهم است؟

اهمیت این تغییر را می‌توان در مقیاس آن دید. به گفته‌ی اوپن‌ای‌آی، هم‌اکنون بیش از ۱۵۰ میلیون نفر از قابلیت صوتی ChatGPT استفاده می‌کنند و این بازطراحی، بزرگ‌ترین تغییر این بخش تا امروز است. یکی از سرپرستان این محصول تعریف کرده که در پیاده‌روی‌های روزانه‌اش گفت‌وگوهای ۳۰ تا ۴۰ دقیقه‌ای با مدل داشته است؛ نشانه‌ای از اینکه هدف اوپن‌ای‌آی تبدیل صدا به یکی از رابط‌های اصلی تعامل با هوش مصنوعی است، نه صرفاً یک قابلیت جانبی. این حرکت هم‌زمان فشار رقابتی را بر گوگل و دیگر شرکت‌هایی که روی دستیارهای صوتی کار می‌کنند بیشتر می‌کند.

محدودیت‌ها؛ آنچه هنوز کامل نیست

با همه‌ی این‌ها، GPT-Live هنوز نقص‌هایی دارد. این مدل فعلاً از گفت‌وگوی صوتی همراه با تصویر زنده یا اشتراک صفحه‌نمایش پشتیبانی نمی‌کند. کیفیت ترجمه‌ی زنده هم به‌طور کامل پخته نشده است؛ برای نمونه در یکی از نمایش‌های زنده، ترجمه به زبان هندی با لهجه و جمله‌بندی چندان طبیعی همراه نبود. به بیان دیگر، ایده و معماری این مدل جهش بزرگی است، اما پرداخت نهایی برخی قابلیت‌ها هنوز جا برای بهتر شدن دارد.

جمع‌بندی

GPT-Live را می‌توان مهم‌ترین گام اوپن‌ای‌آی برای طبیعی کردن گفت‌وگوی صوتی با هوش مصنوعی دانست؛ مدلی که به‌جای «نوبتی» حرف زدن، مثل یک طرف واقعی مکالمه رفتار می‌کند. برای کاربران فارسی‌زبان، قابلیت‌هایی مانند ترجمه‌ی هم‌زمان و مکالمه‌ی روان می‌تواند در یادگیری زبان، ارتباط و کار روزمره بسیار کاربردی باشد. رقابت بر سر «صدای طبیعی» تازه شروع شده و به نظر می‌رسد صدا، میدان بعدی نبرد غول‌های هوش مصنوعی است.

منبع: صفحه‌ی رسمی اوپن‌ای‌آی (Introducing GPT-Live) و گزارش تک‌کرانچ.

برای داغ‌ترین اخبار و آموزش‌های هوش مصنوعی، کانال ما را دنبال کنید: @MrChatGPT_IR

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

ورود | ثبت نام
شماره موبایل یا پست الکترونیک خود را وارد کنید

روش دریافت کد تایید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

برگشت
کد تایید را وارد کنید
کد تایید برای شماره موبایل شما ارسال گردید
کد تایید از طریق بازوی "رمز یکبار مصرف (OTP)" در پیام رسان بله برای شما ارسال شد"
برای دریافت کد تایید، شماره زیر را با موبایل خود به صورت کاملاً رایگان شماره گیری کنید"
تا لحظاتی دیگر برای اعلام کد تایید با شما تماس خواهیم گرفت
ارسال مجدد کد تا دیگر

روش دریافت کد تایید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

برگشت
رمز عبور را وارد کنید
رمز عبور حساب کاربری خود را وارد کنید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

برگشت
درخواست بازیابی رمز عبور
لطفاً پست الکترونیک یا موبایل خود را وارد نمایید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

برگشت
کد تایید را وارد کنید
کد تایید برای شماره موبایل شما ارسال گردید
ارسال مجدد کد تا دیگر

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

ایمیل بازیابی ارسال شد!
لطفاً به صندوق الکترونیکی خود مراجعه کرده و بر روی لینک ارسال شده کلیک نمایید.

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

تغییر رمز عبور
یک رمز عبور برای اکانت خود تنظیم کنید

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

تغییر رمز با موفقیت انجام شد

ورود / ثبت‌نام با گوگل

ورود با تلگرام

ورود با لینک جادویی

دریافت ۵۰ پرامپت برای سوالات پیچیده

دریافت فایل