OpenAI معماری صوتی ChatGPT را کاملاً از نو ساخته است. سیستم تازهای به نام GPT-Live، مکالمه صوتی نوبتی و کند را کنار گذاشته و به جایش گفتوگویی زنده، همزمان و بدون مکث ارائه میدهد.

لیست مطالب
۱. GPT-Live چیست و چرا OpenAI معماری صوت را از صفر ساخت؟
تا پیش از این، حالت صوتی ChatGPT مثل بیسیم واکیتاکی کار میکرد: کاربر حرف میزد، مدل صبر میکرد جمله تمام شود، بعد پاسخ میداد. این معماری «نوبتی» به یک مدل جداگانه برای تشخیص پایان صحبت (turn detection) نیاز داشت که خودش تاخیر اضافه میکرد و گاهی وسط حرف کاربر میپرید یا دیر واکنش نشان میداد. OpenAI با معرفی GPT-Live این مشکل را از ریشه حل کرده: یک مدل صوتی «full-duplex» واقعی که میتواند همزمان بشنود و صحبت کند، دقیقاً مثل یک مکالمه انسانی طبیعی. برای آشنایی بیشتر با شرکت سازنده این فناوری، میتوانید مقاله OpenAI چیست را در سایت ما بخوانید.
۲. از مکالمه نوبتی به گفتوگوی دوطرفه واقعی
در سیستمهای صوتی قدیمیتر، پردازش صدا معمولاً بهصورت آبشاری (cascaded) انجام میشد: ابتدا گفتار به متن تبدیل میشد (speech-to-text)، سپس متن پردازش و پاسخ تولید میشد، و در آخر پاسخ دوباره به گفتار برمیگشت (text-to-speech). این مسیر طولانی، علاوه بر تاخیر، لحن و احساس صدای کاربر را هم از دست میداد. GPT-Live این زنجیره را کوتاه کرده و بهجای پردازش مرحلهبهمرحله، از استنتاج جریانی (streaming inference) با مدیریت زمینه پیوسته استفاده میکند؛ یعنی مدل همزمان با شنیدن صدا، درک و پاسخ را میسازد.
چرا این موضوع برای کاربر فارسیزبان مهم است؟
در مکالمههای روزمره فارسی، وقفه و تاخیر خیلی زود حس میشود؛ چون ساختار جمله در فارسی گاهی نیاز به تغییر مسیر ناگهانی یا تصحیح فوری دارد. سیستمی که همزمان میشنود و پاسخ میدهد، تجربه طبیعیتری برای تمرین زبان، مصاحبه شبیهسازیشده یا حتی دستیار صوتی روزمره فراهم میکند.
۳. پروتکل WARP: از شش رفتوبرگشت شبکه به یک مرحله
یکی از مهمترین نوآوریهای فنی این پروژه، پروتکل تازهای با نام WARP (WebRTC Abridged Roundtrip Protocol) است. پیش از این، برقراری هر مکالمه صوتی نیازمند شش رفتوبرگشت شبکهای بین کاربر و سرور بود؛ فرایندی که خودش چند صدم ثانیه تا حتی بیشتر زمان میبرد. WARP این فرایند را به یک مرحله واحد کاهش داده است. در کنار آن، قابلیتی به نام Instant Connect پارامترهای اتصال (SDP) را از پیش آماده میکند تا سیگنالینگ اصلاً وارد مسیر بحرانی شروع مکالمه نشود.
۴. بازنویسی زیرساخت با Go: چرا پایتون دیگر کافی نبود؟
تیم مهندسی OpenAI برای رسیدن به پایداری و تحویل روان فریمهای صوتی، بخش بزرگی از موتور رسانه و منطق استنتاج را از پایتون asyncio به زبان Go بازنویسی کرده است. نتیجه این تغییر چشمگیر بوده: طبق گزارش رسمی، معیار p95 تاخیر سیستم جدید (یعنی بدترین ۵ درصد موارد) اکنون با معیار p50 سیستم قدیمی (یعنی حالت متوسط سیستم قبلی) برابری میکند. به زبان ساده، بدترین تجربه در سیستم جدید، از تجربه متوسط سیستم قدیم هم بهتر است.

۵. جابهجایی نرم بین مدلها و فشردهسازی پویای زمینه
یکی از چالشهای همیشگی سیستمهای صوتی زنده، مدیریت مکالمههای طولانی است. GPT-Live از تکنیکی به نام «جابهجایی نرم» (seamless handoff) استفاده میکند: پیش از آنکه یک نمونه مدل به محدودیت خود برسد، نمونه جدیدی با زمینه از پیش پرشده (prefilled context) آماده میشود و بدون کوچکترین وقفهای جای نمونه قبلی را میگیرد. کاربر هیچوقت متوجه این تعویض پشتصحنه نمیشود.
در کنار این تکنیک، «فشردهسازی پویای زمینه» (Dynamic Context Compaction) هم وارد عمل میشود: وقتی حجم اطلاعاتی که مدل باید به خاطر بسپارد از ظرفیت معمول عبور میکند، سیستم اطلاعات کماهمیتتر مکالمه را خلاصه میکند تا نکات کلیدی گفتوگو حفظ شود، بدون اینکه کیفیت پاسخ افت کند یا مدل «فراموشکار» به نظر برسد.
۶. تفویض ناهمزمان به GPT-5.5 برای استدلال عمیقتر
شاید جالبترین بخش این معماری، «تفویض ناهمزمان» (asynchronous delegation) باشد. وقتی سوال کاربر نیاز به استدلال سنگینتر دارد، GPT-Live بدون قطعکردن جریان صوتی، پشت صحنه از مدلهای قویتری مثل GPT-5.5 کمک میگیرد و پاسخ نهایی را در دل همان گفتوگوی طبیعی برمیگرداند. یعنی کاربر همزمان از سرعت یک مدل سبک و عمق یک مدل سنگین بهره میبرد. برای درک بهتر تفاوت مدلهای زبانی و محدودیتهای واقعی آنها، میتوانید نگاهی به پتانسیل واقعی و محدودیتهای هوش مصنوعی بیندازید.
۷. آزمایش خاموش: چطور OpenAI بدون آسیب به کاربران زیرساخت را عوض کرد؟
برای اطمینان از پایداری سیستم جدید پیش از انتشار عمومی، OpenAI از روشی به نام «آزمایش خاموش» (Silent Test) استفاده کرد: مکالمههای واقعی کاربران همزمان روی سیستم قدیم و سیستم جدید اجرا میشد، بدون آنکه تجربه کاربر تغییری کند. این آزمایش چند نکته کلیدی را آشکار کرد: ظرفیت واقعی سیستم به توانایی حفظ مکالمههای همزمان با تحویل بهموقع فریم بستگی دارد نه صرفاً قدرت پردازشی GPU؛ موقعیت جغرافیایی کاربر تاثیر زیادی روی تاخیر دارد؛ و مشکلات حافظه و پایداری تنها در مکالمههای طولانیمدت خودشان را نشان میدهند، نه در تستهای کوتاه.
۸. GPT-Live در برابر رقبا: Gemini Live، Grok Voice و Copilot
رقابت روی دستیارهای صوتی این روزها بین همه غولهای هوش مصنوعی داغ است. گوگل با Gemini Live، xAI با Grok Voice و مایکروسافت با قابلیتهای صوتی Copilot، همگی روی کاهش تاخیر و طبیعیتر کردن مکالمه کار میکنند. تفاوت اصلی رویکرد OpenAI در GPT-Live، بازطراحی کامل لایه شبکه (WARP) و زیرساخت پردازشی (بازنویسی با Go) بهجای صرفاً بهبود مدل زبانی است؛ رویکردی که میتواند مزیت پایداری قابل توجهی در مقیاس بزرگ ایجاد کند. در حالی که برخی رقبا روی بزرگترکردن مدل زبانی زیربنایی تمرکز دارند، تیم OpenAI نشان داده که گاهی گلوگاه اصلی تجربه کاربر، نه هوش مدل، بلکه مهندسی شبکه و مدیریت حافظه است.
مقایسه سریع رویکردها
Gemini Live گوگل بیشتر روی یکپارچگی با اکوسیستم اندروید و جستوجوی بصری تمرکز دارد؛ Grok Voice از xAI به سمت لحن غیررسمیتر و واکنشهای سریعتر در بستر ایکس (توییتر سابق) رفته؛ و Copilot مایکروسافت تمرکز بیشتری روی سناریوهای کاری و ادغام با Office دارد. GPT-Live با تمرکز بر «پایداری در مقیاس» و مکالمه طولانیمدت بدون افت کیفیت، خودش را از این رقبا متمایز کرده است.

۹. کاربرد عملی: استفاده روزمره، حریم خصوصی و تاثیر بر کسبوکار
در حال حاضر، GPT-Live بهعنوان موتور پشتصحنه حالت صوتی ChatGPT در اپلیکیشن دسکتاپ فعال است و نیازی به تنظیمات خاصی از سوی کاربر ندارد؛ کافی است حالت صوتی را باز کنید و مکالمه را شروع کنید. برای کاربرانی که تازه با قابلیتهای صوتی ChatGPT آشنا میشوند یا میخواهند از دستورهای صوتی برای کنترل کامپیوتر و هماهنگی ایجنتها استفاده کنند، آشنایی با نحوه نوشتن درخواستهای دقیق همچنان اهمیت دارد؛ نکتهای که در راهنمای نوشتن پرامپت برای مبتدیان بهطور کامل توضیح داده شده است.
هر بار که یک دستیار صوتی توانمندتر میشود، پرسشهای مربوط به حریم خصوصی و نحوه پردازش داده صوتی هم پررنگتر میشود. سیستمهایی مثل GPT-Live که بهصورت پیوسته صدا را پردازش میکنند، باید تعادل دقیقی بین تجربه کاربری روان و محافظت از دادههای حساس برقرار کنند. کاربرانی که از دستیارهای صوتی برای کارهای حساس (مثل مرور اطلاعات مالی یا شخصی) استفاده میکنند، بهتر است همیشه از تنظیمات حریم خصوصی اپلیکیشن آگاه باشند.
از سوی دیگر، دستیارهای صوتی سریعتر و پایدارتر، درهای تازهای برای پشتیبانی مشتری صوتی، مصاحبههای شبیهسازیشده و آموزش زبان باز میکنند. کسبوکارهایی که به دنبال استفاده عملی از هوش مصنوعی هستند، میتوانند از این پیشرفتها در مسیرهای تازهای بهره ببرند؛ موضوعی که در مقاله اهمیت هوش مصنوعی در کسبوکار ۲۰۲۵ بهتفصیل بررسی شده است.
۱۰. سوالات متداول درباره GPT-Live
GPT-Live دقیقاً چیست؟ زیرساخت تازه OpenAI برای حالت صوتی ChatGPT است که مکالمه را بهصورت همزمان (full-duplex) و بدون تاخیر محسوس مدیریت میکند.
آیا GPT-Live همان GPT-5.6 است؟ خیر؛ GPT-Live یک لایه صوتی و زیرساختی است که در کنار مدلهای زبانی مثل GPT-5.5 کار میکند و در صورت نیاز به استدلال عمیقتر، از آنها کمک میگیرد.
چه زمانی به همه کاربران میرسد؟ طبق پست رسمی OpenAI، این زیرساخت هماکنون بخشی از حالت صوتی ChatGPT در اپلیکیشن دسکتاپ است و نسخه API آن بهزودی برای توسعهدهندگان عرضه خواهد شد.
آیا این فناوری با دستیارهای رقیب مثل Gemini Live فرق دارد؟ تفاوت اصلی در معماری شبکه و زیرساخت پردازشی است؛ OpenAI بهجای تمرکز صرف روی مدل زبانی، کل مسیر انتقال صدا را بازطراحی کرده است.
آیا استفاده از GPT-Live نیاز به اشتراک ویژه دارد؟ این زیرساخت در حال حاضر بهعنوان موتور پیشفرض حالت صوتی ChatGPT در اپلیکیشن دسکتاپ فعال شده و کاربر نیازی به فعالسازی جداگانه ندارد؛ جزئیات دسترسی برای پلنهای مختلف ممکن است در هفتههای آینده بهروزرسانی شود.
آیا GPT-Live روی سیستمهای صوتی موجود مثل مترجم زنده هم تاثیر میگذارد؟ با توجه به اینکه این معماری پایه ارتباط صوتی را بازطراحی کرده، انتظار میرود قابلیتهایی مثل ترجمه همزمان و مکالمه چندزبانه هم از کاهش تاخیر و پایداری بیشتر بهرهمند شوند.
GPT-Live نشان میدهد آینده دستیارهای صوتی فقط به مدلهای زبانی بزرگتر ختم نمیشود؛ بلکه زیرساخت شبکه، مدیریت حافظه و مهندسی سیستم هم بههمان اندازه اهمیت دارند. اگر میخواهید با آموزشهای عملی ChatGPT و آخرین اخبار هوش مصنوعی همراه باشید، سری بزنید به آموزشهای ChatGPT و بخش اخبار در سایت ما. برای مقایسه دقیقتر مدلهای هوش مصنوعی هم میتوانید این مقاله مقایسهای را بخوانید.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
