اوپنایآی حالت صوتی ChatGPT را از پایه بازطراحی کرد؛ مدلی که همزمان گوش میدهد و حرف میزند، وسط حرفتان نمیپرد و میتواند صحبت شما را بهصورت زنده ترجمه کند.
لیست مطالب
GPT-Live چیست و چه فرقی با نسخهی قبل دارد؟
اوپنایآی در هشتم ژوئیهی ۲۰۲۶ از نسل تازهای از مدلهای صوتی خود با نام GPT-Live رونمایی کرد؛ فناوریای که از این پس موتور اصلی بخش «گفتوگوی صوتی» در ChatGPT خواهد بود. تفاوت اصلی این مدل با نسخهی پیشین، یعنی Advanced Voice Mode، در نحوهی ساخت آن است. حالت قبلی در واقع از سه بخش جدا تشکیل میشد که پشت سر هم کار میکردند: نخست گفتار کاربر به متن تبدیل میشد، سپس یک مدل زبانی متن را پردازش میکرد و در پایان پاسخ دوباره به گفتار برمیگشت. همین زنجیره باعث میشد پاسخها با کمی تأخیر بیایند، قطع کردن حرف مدل دشوار باشد و گفتوگو کمتر شبیه یک مکالمهی واقعی به نظر برسد.
معماری «تمامدوطرفه»؛ گوش دادن و حرف زدن در آنِ واحد
GPT-Live بر پایهی معماری «تمامدوطرفه» یا Full-Duplex ساخته شده است؛ یعنی میتواند همزمان هم گوش بدهد و هم صحبت کند، درست مثل دو انسان که با هم گفتوگو میکنند. این مدل چندین بار در ثانیه تصمیم میگیرد که سکوت کند، ادامه بدهد یا واکنش نشان دهد. نتیجهی عملی این معماری آن است که میتوانید وسط جملهی مدل بپرید، حرفش را قطع کنید یا موضوع را عوض کنید، بیآنکه رشتهی گفتوگو از دستش در برود. اوپنایآی میگوید مدل حتی برای طبیعیتر شدن مکالمه، گاهی مانند انسانها واژههای تأییدی کوتاهی مثل «اوهوم» یا «بله» به کار میبرد و میتواند هنگام گوش دادن ساکت بماند تا منظور شما را کامل دریافت کند.
ترجمهی زنده و سپردن کارهای سنگین به GPT-5.5
یکی از کاربردیترین قابلیتهای GPT-Live، ترجمهی زنده است: کاربر صحبت میکند و گفتارش تقریباً همزمان به زبانی دیگر برگردانده میشود؛ ابزاری که میتواند مرز زبان را در سفر، کار و ارتباط روزمره کمرنگ کند. نکتهی فنی مهم این است که خودِ مدل صوتی سبک و سریع طراحی شده تا مکالمه روان بماند؛ اما هر جا پرسش پیچیدهتری مطرح شود، GPT-Live کار را در پسزمینه به مدل قدرتمندتر GPT-5.5 میسپارد تا جستوجو، استدلال و کارهای سنگینتر انجام شود، بیآنکه جریان گفتوگو کند یا قطع شود.
نسخهها، دسترسی و خبر خوب برای کاربران رایگان
اوپنایآی این فناوری را در چند نسخه عرضه کرده است؛ از GPT-Live-1 بهعنوان مدل کامل تا نسخهی سبکتر mini. عرضهی جهانی آن روی iOS، اندروید و وبسایت ChatGPT آغاز شده است. مهمترین نکته برای کاربران عادی این است که نسخهی mini بهصورت پیشفرض جایگزین حالت صوتی قبلی برای کاربران رایگان شده و کاربران اشتراکهای Plus و Pro به مدل کامل GPT-Live-1 دسترسی دارند. دسترسی توسعهدهندگان از راه API نیز به گفتهی شرکت «بهزودی» فراهم میشود.
چرا این خبر مهم است؟
اهمیت این تغییر را میتوان در مقیاس آن دید. به گفتهی اوپنایآی، هماکنون بیش از ۱۵۰ میلیون نفر از قابلیت صوتی ChatGPT استفاده میکنند و این بازطراحی، بزرگترین تغییر این بخش تا امروز است. یکی از سرپرستان این محصول تعریف کرده که در پیادهرویهای روزانهاش گفتوگوهای ۳۰ تا ۴۰ دقیقهای با مدل داشته است؛ نشانهای از اینکه هدف اوپنایآی تبدیل صدا به یکی از رابطهای اصلی تعامل با هوش مصنوعی است، نه صرفاً یک قابلیت جانبی. این حرکت همزمان فشار رقابتی را بر گوگل و دیگر شرکتهایی که روی دستیارهای صوتی کار میکنند بیشتر میکند.
محدودیتها؛ آنچه هنوز کامل نیست
با همهی اینها، GPT-Live هنوز نقصهایی دارد. این مدل فعلاً از گفتوگوی صوتی همراه با تصویر زنده یا اشتراک صفحهنمایش پشتیبانی نمیکند. کیفیت ترجمهی زنده هم بهطور کامل پخته نشده است؛ برای نمونه در یکی از نمایشهای زنده، ترجمه به زبان هندی با لهجه و جملهبندی چندان طبیعی همراه نبود. به بیان دیگر، ایده و معماری این مدل جهش بزرگی است، اما پرداخت نهایی برخی قابلیتها هنوز جا برای بهتر شدن دارد.
جمعبندی
GPT-Live را میتوان مهمترین گام اوپنایآی برای طبیعی کردن گفتوگوی صوتی با هوش مصنوعی دانست؛ مدلی که بهجای «نوبتی» حرف زدن، مثل یک طرف واقعی مکالمه رفتار میکند. برای کاربران فارسیزبان، قابلیتهایی مانند ترجمهی همزمان و مکالمهی روان میتواند در یادگیری زبان، ارتباط و کار روزمره بسیار کاربردی باشد. رقابت بر سر «صدای طبیعی» تازه شروع شده و به نظر میرسد صدا، میدان بعدی نبرد غولهای هوش مصنوعی است.
منبع: صفحهی رسمی اوپنایآی (Introducing GPT-Live) و گزارش تککرانچ.
برای داغترین اخبار و آموزشهای هوش مصنوعی، کانال ما را دنبال کنید: @MrChatGPT_IR