بنچمارک سلامت روان OpenAI؛ کدام هوش مصنوعی بهتر گوش می‌دهد؟

اخبار · هوش مصنوعی

شرکت OpenAI از نخستین بنچمارک رسمی برای سنجش کیفیت گفت‌وگوهای هوش مصنوعی درباره‌ی سلامت روان رونمایی کرد؛ آزمونی که پای Claude و Gemini را هم به میدان رقابت باز کرده است.

چکیده. شرکت OpenAI محکی تازه به نام MentalHealthBench منتشر کرده که با همکاری بیش از ۸۰ روان‌شناس و روان‌پزشک از ۲۲ کشور و به ۱۹ زبان -از جمله فارسی- ساخته شده است. این بنچمارک ۱٬۲۱۵ گفت‌وگوی واقع‌گرایانه را ارزیابی می‌کند و نشان می‌دهد مدل تازه‌ی GPT-6 Astra با ۵۷.۳ درصد در صدر جدول ایستاده، در حالی‌که جمینای ۲.۵ پرو با تنها ۲۹.۵ درصد بیشترین فاصله را با رقبا دارد.
معرفی بنچمارک MentalHealthBench توسط OpenAI برای سنجش گفت‌وگوهای هوش مصنوعی درباره‌ی سلامت روان

بخش اول: چرا OpenAI به سراغ سلامت روان رفت؟

میلیون‌ها نفر در سراسر جهان هر روز با چت‌بات‌هایی مثل ChatGPT درباره‌ی نگرانی‌ها، اضطراب و مشکلات روزمره‌ی خود صحبت می‌کنند؛ گاهی به‌جای یک دوست، گاهی به‌جای یک مشاور. همین واقعیت باعث شده OpenAI دیگر نتواند این موضوع را نادیده بگیرد. شرکت در بیانیه‌ی رسمی خود توضیح داده که هدف از این بنچمارک، ایجاد یک استاندارد شفاف و قابل‌اندازه‌گیری برای پاسخ‌های حساس هوش مصنوعی است، نه صرفاً یک ابزار بازاریابی. تا پیش از این، هر آزمایشگاه هوش مصنوعی معیار داخلی خودش را برای سنجش ایمنی گفت‌وگوها داشت و مقایسه‌ی دقیق میان مدل‌های مختلف تقریباً غیرممکن بود. با انتشار عمومی این بنچمارک، حالا هر پژوهشگر یا شرکتی می‌تواند مدل خود را با استانداردی مشترک بسنجد. برای آشنایی بیشتر با ماهیت این شرکت و مسیر توسعه‌ی محصولاتش، می‌توانید این معرفی کامل از OpenAI را هم بخوانید.

بخش دوم: MentalHealthBench دقیقاً چیست؟

این بنچمارک -یعنی MentalHealthBench- ابزاری آزاد و عمومی است که رفتار مدل‌های زبانی را در گفت‌وگوهای واقعی و حساس درباره‌ی سلامت روان می‌سنجد. برخلاف بسیاری از آزمون‌های قبلی که تنها روی موقعیت‌های بحرانی مثل افکار خودکشی تمرکز داشتند، این بنچمارک طیف گسترده‌تری از موقعیت‌ها را پوشش می‌دهد: از استرس روزمره‌ی محل کار گرفته تا اضطراب نوجوانان و نگرانی‌های مراقبان خانوادگی. هدف این است که مدل‌ها نه‌فقط در بحران، بلکه در گفت‌وگوهای معمولی روزانه هم رفتار درستی داشته باشند؛ رفتاری که نه بیش‌ازحد محتاطانه و خشک باشد و نه بیش‌ازحد راحت و بی‌توجه به ریسک‌های احتمالی. این تعادل ظریف همان چیزی است که طراحی چنین بنچمارکی را دشوار می‌کند.

بخش سوم: چه کسانی این معیار را ساخته‌اند؟

نکته‌ی مهم درباره‌ی این پروژه، دامنه‌ی همکاری تخصصی پشت آن است. بیش از ۸۰ روان‌شناس و روان‌پزشک دارای مجوز از ۲۲ کشور در طراحی آن مشارکت داشتند؛ افرادی که در مجموع به ۱۹ زبان از جمله فارسی، عربی، اسپانیایی، هندی، آلمانی، ایتالیایی، اندونزیایی، ترکی و چینی تسلط داشتند و نزدیک به بیست زیرشاخه‌ی تخصصی سلامت روان -از اضطراب گرفته تا اختلالات خوردن- را پوشش می‌دادند. حاصل این همکاری، ۱٬۲۱۵ گفت‌وگوی مصنوعی اما واقع‌گرایانه و ۵٬۲۶۲ معیار داوری تخصصی بود که هر کدام دست‌کم توسط سه کارشناس جداگانه بازبینی شد و تنها معیارهایی باقی ماندند که حداقل دو کارشناس روی آن‌ها توافق داشتند. این سطح از دقت و بازبینی چندلایه، MentalHealthBench را از بسیاری از بنچمارک‌های صرفاً فنی که معمولاً توسط تیم‌های مهندسی و بدون نظارت بالینی ساخته می‌شوند، متمایز می‌کند.

بخش چهارم: روش‌شناسی و نحوه‌ی امتیازدهی

گفت‌وگوها بر اساس سطح فوریت به سه دسته تقسیم شدند: حدود ۵۳.۵ درصد موقعیت‌های غیرحاد روزمره، ۱۸.۲ درصد موقعیت‌های پراضطراب و ۲۸.۳ درصد موقعیت‌های اضطراری. همچنین چهار پروفایل کاربری در نظر گرفته شد: بزرگسالان (۶۸.۱ درصد)، نوجوانان ۱۳ تا ۱۷ سال (۲۱.۲ درصد)، بالینگران (۵.۸ درصد) و مراقبان خانوادگی (۴.۹ درصد). هر پاسخ مدل بر پایه‌ی ده محور رفتاری از جمله ایمنی، همدلی، زمینه‌یابی درست، حفظ اختیار کاربر، کالیبراسیون فوریت و واقعیت‌سنجی، در بازه‌ی منفی ده تا مثبت ده نمره گرفت. وزن هر معیار بر اساس اهمیت بالینی آن تعیین شده بود؛ یعنی خطاهایی که می‌توانستند پیامد جدی‌تری برای کاربر داشته باشند، نمره‌ی منفی سنگین‌تری دریافت می‌کردند. داوری خودکار این فرآیند را مدل GPT-5.6 Sol انجام داد که نتایج آن با نمونه‌گیری تصادفی توسط کارشناسان انسانی نیز اعتبارسنجی شد.

نمودار رتبه‌بندی Claude Opus 5.5 در بنچمارک سلامت روان هوش مصنوعی

بخش پنجم: نتایج؛ چه مدلی برنده شد؟

نتایج نهایی نشان داد مدل تازه‌ی GPT-6 Astra با امتیاز ۵۷.۳ درصد بهترین عملکرد را در میان مدل‌های ارزیابی‌شده داشت. پس از آن GPT-6 Sol با ۵۳.۹ درصد و Claude Opus 5.5 با ۵۲.۴ درصد در رتبه‌های بعدی قرار گرفتند. مدل GPT-6 Luna با ۵۰.۲ درصد نیز عملکردی نزدیک به میانگین داشت. اما در طرف دیگر جدول، جمینای ۲.۵ پرو با تنها ۲۹.۵ درصد و حتی مدل قدیمی‌تر GPT-4o (نسخه‌ی مارس ۲۰۲۵) با ۳۲.۱ درصد، فاصله‌ی چشمگیری با نسل تازه‌ی مدل‌ها نشان دادند. این شکاف نشان می‌دهد پیشرفت در استدلال و کدنویسی لزوماً به معنای پیشرفت هم‌زمان در مهارت‌های ارتباطی حساس نیست؛ چیزی که تیم‌های توسعه باید آن را به‌طور جداگانه و هدفمند آموزش دهند. اگر می‌خواهید عملکرد مدل‌های مختلف هوش مصنوعی را در کنار هم مقایسه کنید، این مقاله‌ی مقایسه‌ای نگاه خوبی به تفاوت رویکردهای مختلف می‌دهد.

بخش ششم: تفاوت دیدگاه کاربران عادی و متخصصان

یکی از جالب‌توجه‌ترین بخش‌های این پژوهش، نظرسنجی جداگانه‌ای بود که از ۴۴ کاربر عادی در ۱۶ کشور و ۱۴ زبان گرفته شد. نتیجه نشان داد دیدگاه کاربران و متخصصان تنها در ۲۵.۷ درصد از کل وزن معیارها هم‌پوشانی داشت. کاربران عادی بیشتر به لحن دوستانه، همدلی قابل‌لمس و راهکارهای عملی و فوری اهمیت می‌دادند، در حالی‌که متخصصان بر زمینه‌یابی دقیق‌تر و تفسیر درست موقعیت پیش از ارائه‌ی راهکار تأکید داشتند. برای مثال، یک کاربر معمولی ممکن است پاسخی را که سریع راه‌حل می‌دهد بهترین پاسخ بداند، در حالی‌که یک روان‌شناس همان پاسخ را عجولانه و فاقد زمینه‌یابی کافی ارزیابی کند. این شکاف نشان می‌دهد طراحی یک هوش مصنوعی که هم برای کاربر عادی مفید باشد و هم از منظر بالینی درست عمل کند، کار ساده‌ای نیست و نیازمند توازنی دقیق میان دو نگاه متفاوت است.

بخش هفتم: این خبر برای کاربران فارسی‌زبان چه اهمیتی دارد؟

حضور زبان فارسی در میان زبان‌های پوشش‌داده‌شده‌ی این بنچمارک نکته‌ای قابل‌توجه است. این یعنی OpenAI به‌صورت مشخص گفت‌وگوهای فارسی درباره‌ی سلامت روان را هم در فرآیند ارزیابی خود گنجانده است؛ موضوعی که می‌تواند در آینده به بهبود کیفیت پاسخ‌های ChatGPT برای کاربران ایرانی و فارسی‌زبان منجر شود. با توجه به محدودیت دسترسی رسمی برخی ابزارهای هوش مصنوعی در ایران، بسیاری از کاربران فارسی‌زبان از طریق روش‌های جایگزین با این ابزارها گفت‌وگو می‌کنند و کیفیت درک زبان فارسی برایشان اهمیت ویژه‌ای دارد. با این حال، کاربران باید همچنان به یاد داشته باشند که هوش مصنوعی جایگزین مشاور یا روان‌پزشک واقعی نیست. برای درک بهتر از توانایی‌ها و محدودیت‌های واقعی این فناوری‌ها، خواندن این تحلیل جامع درباره‌ی توان و محدودیت‌های هوش مصنوعی توصیه می‌شود.

نتیجه ضعیف Gemini 2.5 Pro در آزمون سلامت روان هوش مصنوعی نسبت به رقبا

بخش هشتم: نگرانی‌ها و مرزهای این فناوری

انتشار چنین بنچمارکی به این معنا نیست که مشکل حل شده است. منتقدان یادآوری می‌کنند که حتی بهترین مدل در این آزمون، یعنی GPT-6 Astra، تنها ۵۷.۳ درصد امتیاز گرفته است؛ رقمی که فاصله‌ی زیادی با عملکرد ایده‌آل دارد. همچنین این بنچمارک بر پایه‌ی گفت‌وگوهای مصنوعی ساخته شده و لزوماً همه‌ی پیچیدگی‌های یک بحران واقعی روانی را بازتاب نمی‌دهد؛ افراد واقعی در شرایط بحرانی معمولاً رفتاری غیرقابل‌پیش‌بینی‌تر از یک گفت‌وگوی شبیه‌سازی‌شده دارند. از سوی دیگر، کسب‌وکارهایی که می‌خواهند از دستیارهای هوش مصنوعی در حوزه‌ی سلامت یا پشتیبانی مشتری استفاده کنند، باید به این محدودیت‌ها توجه ویژه داشته باشند؛ نکته‌ای که در این راهنمای اهمیت هوش مصنوعی در کسب‌وکار هم به آن پرداخته شده است.

بخش نهم: واکنش رقبا و آینده‌ی این رقابت

انتشار عمومی MentalHealthBench عملاً یک چالش ضمنی برای رقبای OpenAI هم به‌حساب می‌آید. حالا که Anthropic و Google هم می‌دانند مدل‌های Claude Opus 5.5 و Gemini 2.5 Pro در این آزمون کجای جدول ایستاده‌اند، انتظار می‌رود در نسخه‌های بعدی خود روی این حوزه سرمایه‌گذاری بیشتری کنند. برخی تحلیل‌گران این حرکت OpenAI را نوعی «رقابت مسئولانه» می‌دانند؛ به این معنا که به‌جای رقابت صرف بر سر سرعت و توان استدلال، شرکت‌ها حالا باید در حوزه‌ی ایمنی گفت‌وگوهای انسانی هم با یکدیگر رقابت کنند. اگر این روند ادامه یابد، احتمالاً در ماه‌های آینده شاهد انتشار بنچمارک‌های مشابه یا نسخه‌های به‌روزشده‌ی همین آزمون از سوی سایر آزمایشگاه‌های هوش مصنوعی خواهیم بود.

بخش دهم: راهکار عملی برای کاربران

اگر خودتان یا اطرافیانتان از هوش مصنوعی برای صحبت درباره‌ی احساسات یا مشکلات روزمره استفاده می‌کنید، چند نکته را در نظر بگیرید: هرگز جای مشاوره‌ی تخصصی را با گفت‌وگو با چت‌بات پر نکنید، به‌ویژه در موقعیت‌های اضطراری حتماً با خطوط کمک واقعی یا نزدیک‌ترین مرکز درمانی تماس بگیرید، و پاسخ‌های هوش مصنوعی را همیشه با دید انتقادی بخوانید. برای گرفتن بهترین و ایمن‌ترین پاسخ از ابزارهایی مثل ChatGPT، دانستن نحوه‌ی درست پرامپت‌نویسی هم کمک بزرگی می‌کند؛ این آموزش ساده‌ی پرامپت‌نویسی نقطه‌ی شروع خوبی است. همچنین در بخش آموزش‌های ChatGPT سایت، راهنماهای عملی بیشتری برای استفاده‌ی روزمره از این ابزارها پیدا می‌کنید.

پرسش‌های متداول

سؤال: MentalHealthBench دقیقاً چه چیزی را اندازه می‌گیرد؟
پاسخ: کیفیت و ایمنی پاسخ‌های هوش مصنوعی در گفت‌وگوهای واقعی درباره‌ی سلامت روان، از موقعیت‌های روزمره تا شرایط اضطراری.

سؤال: کدام مدل هوش مصنوعی بهترین نتیجه را گرفت؟
پاسخ: مدل تازه‌ی GPT-6 Astra با امتیاز ۵۷.۳ درصد در صدر جدول قرار گرفت و پس از آن GPT-6 Sol و Claude Opus 5.5 ایستادند.

سؤال: آیا زبان فارسی هم در این بنچمارک بررسی شده؟
پاسخ: بله، فارسی یکی از ۱۹ زبانی است که در طراحی و ارزیابی این بنچمارک لحاظ شده است.

سؤال: چرا جمینای امتیاز پایینی گرفت؟
پاسخ: OpenAI جزئیات فنی دلیل ضعف Gemini 2.5 Pro را اعلام نکرده، اما نتایج نشان می‌دهد این مدل در محورهایی مثل زمینه‌یابی و کالیبراسیون فوریت عملکرد ضعیف‌تری نسبت به مدل‌های تازه‌ی OpenAI و Anthropic داشته است.

سؤال: آیا می‌توان به‌جای مشاور واقعی از هوش مصنوعی استفاده کرد؟
پاسخ: خیر. حتی بهترین مدل‌ها در این آزمون هم به نمره‌ی کامل نرسیدند و هوش مصنوعی نباید جایگزین مشاوره‌ی تخصصی شود؛ برای شناخت بهتر مرز میان توانایی واقعی هوش مصنوعی و تصورات اغراق‌آمیز درباره‌ی آن، این مقاله خواندنی است.

در یک جمله: OpenAI با انتشار MentalHealthBench، رقابت هوش مصنوعی را از میدان کدنویسی و استدلال به میدان حساس‌تری یعنی مسئولیت‌پذیری در گفت‌وگوهای انسانی کشانده است. برای دنبال‌کردن ادامه‌ی این رقابت و تازه‌ترین اخبار هوش مصنوعی، صفحه‌ی اخبار سایت را دنبال کنید و به کانال تلگرام @MrChatGPT_IR بپیوندید.
— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *