شرکت OpenAI از نخستین بنچمارک رسمی برای سنجش کیفیت گفتوگوهای هوش مصنوعی دربارهی سلامت روان رونمایی کرد؛ آزمونی که پای Claude و Gemini را هم به میدان رقابت باز کرده است.

لیست مطالب
بخش اول: چرا OpenAI به سراغ سلامت روان رفت؟
میلیونها نفر در سراسر جهان هر روز با چتباتهایی مثل ChatGPT دربارهی نگرانیها، اضطراب و مشکلات روزمرهی خود صحبت میکنند؛ گاهی بهجای یک دوست، گاهی بهجای یک مشاور. همین واقعیت باعث شده OpenAI دیگر نتواند این موضوع را نادیده بگیرد. شرکت در بیانیهی رسمی خود توضیح داده که هدف از این بنچمارک، ایجاد یک استاندارد شفاف و قابلاندازهگیری برای پاسخهای حساس هوش مصنوعی است، نه صرفاً یک ابزار بازاریابی. تا پیش از این، هر آزمایشگاه هوش مصنوعی معیار داخلی خودش را برای سنجش ایمنی گفتوگوها داشت و مقایسهی دقیق میان مدلهای مختلف تقریباً غیرممکن بود. با انتشار عمومی این بنچمارک، حالا هر پژوهشگر یا شرکتی میتواند مدل خود را با استانداردی مشترک بسنجد. برای آشنایی بیشتر با ماهیت این شرکت و مسیر توسعهی محصولاتش، میتوانید این معرفی کامل از OpenAI را هم بخوانید.
بخش دوم: MentalHealthBench دقیقاً چیست؟
این بنچمارک -یعنی MentalHealthBench- ابزاری آزاد و عمومی است که رفتار مدلهای زبانی را در گفتوگوهای واقعی و حساس دربارهی سلامت روان میسنجد. برخلاف بسیاری از آزمونهای قبلی که تنها روی موقعیتهای بحرانی مثل افکار خودکشی تمرکز داشتند، این بنچمارک طیف گستردهتری از موقعیتها را پوشش میدهد: از استرس روزمرهی محل کار گرفته تا اضطراب نوجوانان و نگرانیهای مراقبان خانوادگی. هدف این است که مدلها نهفقط در بحران، بلکه در گفتوگوهای معمولی روزانه هم رفتار درستی داشته باشند؛ رفتاری که نه بیشازحد محتاطانه و خشک باشد و نه بیشازحد راحت و بیتوجه به ریسکهای احتمالی. این تعادل ظریف همان چیزی است که طراحی چنین بنچمارکی را دشوار میکند.
بخش سوم: چه کسانی این معیار را ساختهاند؟
نکتهی مهم دربارهی این پروژه، دامنهی همکاری تخصصی پشت آن است. بیش از ۸۰ روانشناس و روانپزشک دارای مجوز از ۲۲ کشور در طراحی آن مشارکت داشتند؛ افرادی که در مجموع به ۱۹ زبان از جمله فارسی، عربی، اسپانیایی، هندی، آلمانی، ایتالیایی، اندونزیایی، ترکی و چینی تسلط داشتند و نزدیک به بیست زیرشاخهی تخصصی سلامت روان -از اضطراب گرفته تا اختلالات خوردن- را پوشش میدادند. حاصل این همکاری، ۱٬۲۱۵ گفتوگوی مصنوعی اما واقعگرایانه و ۵٬۲۶۲ معیار داوری تخصصی بود که هر کدام دستکم توسط سه کارشناس جداگانه بازبینی شد و تنها معیارهایی باقی ماندند که حداقل دو کارشناس روی آنها توافق داشتند. این سطح از دقت و بازبینی چندلایه، MentalHealthBench را از بسیاری از بنچمارکهای صرفاً فنی که معمولاً توسط تیمهای مهندسی و بدون نظارت بالینی ساخته میشوند، متمایز میکند.
بخش چهارم: روششناسی و نحوهی امتیازدهی
گفتوگوها بر اساس سطح فوریت به سه دسته تقسیم شدند: حدود ۵۳.۵ درصد موقعیتهای غیرحاد روزمره، ۱۸.۲ درصد موقعیتهای پراضطراب و ۲۸.۳ درصد موقعیتهای اضطراری. همچنین چهار پروفایل کاربری در نظر گرفته شد: بزرگسالان (۶۸.۱ درصد)، نوجوانان ۱۳ تا ۱۷ سال (۲۱.۲ درصد)، بالینگران (۵.۸ درصد) و مراقبان خانوادگی (۴.۹ درصد). هر پاسخ مدل بر پایهی ده محور رفتاری از جمله ایمنی، همدلی، زمینهیابی درست، حفظ اختیار کاربر، کالیبراسیون فوریت و واقعیتسنجی، در بازهی منفی ده تا مثبت ده نمره گرفت. وزن هر معیار بر اساس اهمیت بالینی آن تعیین شده بود؛ یعنی خطاهایی که میتوانستند پیامد جدیتری برای کاربر داشته باشند، نمرهی منفی سنگینتری دریافت میکردند. داوری خودکار این فرآیند را مدل GPT-5.6 Sol انجام داد که نتایج آن با نمونهگیری تصادفی توسط کارشناسان انسانی نیز اعتبارسنجی شد.

بخش پنجم: نتایج؛ چه مدلی برنده شد؟
نتایج نهایی نشان داد مدل تازهی GPT-6 Astra با امتیاز ۵۷.۳ درصد بهترین عملکرد را در میان مدلهای ارزیابیشده داشت. پس از آن GPT-6 Sol با ۵۳.۹ درصد و Claude Opus 5.5 با ۵۲.۴ درصد در رتبههای بعدی قرار گرفتند. مدل GPT-6 Luna با ۵۰.۲ درصد نیز عملکردی نزدیک به میانگین داشت. اما در طرف دیگر جدول، جمینای ۲.۵ پرو با تنها ۲۹.۵ درصد و حتی مدل قدیمیتر GPT-4o (نسخهی مارس ۲۰۲۵) با ۳۲.۱ درصد، فاصلهی چشمگیری با نسل تازهی مدلها نشان دادند. این شکاف نشان میدهد پیشرفت در استدلال و کدنویسی لزوماً به معنای پیشرفت همزمان در مهارتهای ارتباطی حساس نیست؛ چیزی که تیمهای توسعه باید آن را بهطور جداگانه و هدفمند آموزش دهند. اگر میخواهید عملکرد مدلهای مختلف هوش مصنوعی را در کنار هم مقایسه کنید، این مقالهی مقایسهای نگاه خوبی به تفاوت رویکردهای مختلف میدهد.
بخش ششم: تفاوت دیدگاه کاربران عادی و متخصصان
یکی از جالبتوجهترین بخشهای این پژوهش، نظرسنجی جداگانهای بود که از ۴۴ کاربر عادی در ۱۶ کشور و ۱۴ زبان گرفته شد. نتیجه نشان داد دیدگاه کاربران و متخصصان تنها در ۲۵.۷ درصد از کل وزن معیارها همپوشانی داشت. کاربران عادی بیشتر به لحن دوستانه، همدلی قابللمس و راهکارهای عملی و فوری اهمیت میدادند، در حالیکه متخصصان بر زمینهیابی دقیقتر و تفسیر درست موقعیت پیش از ارائهی راهکار تأکید داشتند. برای مثال، یک کاربر معمولی ممکن است پاسخی را که سریع راهحل میدهد بهترین پاسخ بداند، در حالیکه یک روانشناس همان پاسخ را عجولانه و فاقد زمینهیابی کافی ارزیابی کند. این شکاف نشان میدهد طراحی یک هوش مصنوعی که هم برای کاربر عادی مفید باشد و هم از منظر بالینی درست عمل کند، کار سادهای نیست و نیازمند توازنی دقیق میان دو نگاه متفاوت است.
بخش هفتم: این خبر برای کاربران فارسیزبان چه اهمیتی دارد؟
حضور زبان فارسی در میان زبانهای پوششدادهشدهی این بنچمارک نکتهای قابلتوجه است. این یعنی OpenAI بهصورت مشخص گفتوگوهای فارسی دربارهی سلامت روان را هم در فرآیند ارزیابی خود گنجانده است؛ موضوعی که میتواند در آینده به بهبود کیفیت پاسخهای ChatGPT برای کاربران ایرانی و فارسیزبان منجر شود. با توجه به محدودیت دسترسی رسمی برخی ابزارهای هوش مصنوعی در ایران، بسیاری از کاربران فارسیزبان از طریق روشهای جایگزین با این ابزارها گفتوگو میکنند و کیفیت درک زبان فارسی برایشان اهمیت ویژهای دارد. با این حال، کاربران باید همچنان به یاد داشته باشند که هوش مصنوعی جایگزین مشاور یا روانپزشک واقعی نیست. برای درک بهتر از تواناییها و محدودیتهای واقعی این فناوریها، خواندن این تحلیل جامع دربارهی توان و محدودیتهای هوش مصنوعی توصیه میشود.

بخش هشتم: نگرانیها و مرزهای این فناوری
انتشار چنین بنچمارکی به این معنا نیست که مشکل حل شده است. منتقدان یادآوری میکنند که حتی بهترین مدل در این آزمون، یعنی GPT-6 Astra، تنها ۵۷.۳ درصد امتیاز گرفته است؛ رقمی که فاصلهی زیادی با عملکرد ایدهآل دارد. همچنین این بنچمارک بر پایهی گفتوگوهای مصنوعی ساخته شده و لزوماً همهی پیچیدگیهای یک بحران واقعی روانی را بازتاب نمیدهد؛ افراد واقعی در شرایط بحرانی معمولاً رفتاری غیرقابلپیشبینیتر از یک گفتوگوی شبیهسازیشده دارند. از سوی دیگر، کسبوکارهایی که میخواهند از دستیارهای هوش مصنوعی در حوزهی سلامت یا پشتیبانی مشتری استفاده کنند، باید به این محدودیتها توجه ویژه داشته باشند؛ نکتهای که در این راهنمای اهمیت هوش مصنوعی در کسبوکار هم به آن پرداخته شده است.
بخش نهم: واکنش رقبا و آیندهی این رقابت
انتشار عمومی MentalHealthBench عملاً یک چالش ضمنی برای رقبای OpenAI هم بهحساب میآید. حالا که Anthropic و Google هم میدانند مدلهای Claude Opus 5.5 و Gemini 2.5 Pro در این آزمون کجای جدول ایستادهاند، انتظار میرود در نسخههای بعدی خود روی این حوزه سرمایهگذاری بیشتری کنند. برخی تحلیلگران این حرکت OpenAI را نوعی «رقابت مسئولانه» میدانند؛ به این معنا که بهجای رقابت صرف بر سر سرعت و توان استدلال، شرکتها حالا باید در حوزهی ایمنی گفتوگوهای انسانی هم با یکدیگر رقابت کنند. اگر این روند ادامه یابد، احتمالاً در ماههای آینده شاهد انتشار بنچمارکهای مشابه یا نسخههای بهروزشدهی همین آزمون از سوی سایر آزمایشگاههای هوش مصنوعی خواهیم بود.
بخش دهم: راهکار عملی برای کاربران
اگر خودتان یا اطرافیانتان از هوش مصنوعی برای صحبت دربارهی احساسات یا مشکلات روزمره استفاده میکنید، چند نکته را در نظر بگیرید: هرگز جای مشاورهی تخصصی را با گفتوگو با چتبات پر نکنید، بهویژه در موقعیتهای اضطراری حتماً با خطوط کمک واقعی یا نزدیکترین مرکز درمانی تماس بگیرید، و پاسخهای هوش مصنوعی را همیشه با دید انتقادی بخوانید. برای گرفتن بهترین و ایمنترین پاسخ از ابزارهایی مثل ChatGPT، دانستن نحوهی درست پرامپتنویسی هم کمک بزرگی میکند؛ این آموزش سادهی پرامپتنویسی نقطهی شروع خوبی است. همچنین در بخش آموزشهای ChatGPT سایت، راهنماهای عملی بیشتری برای استفادهی روزمره از این ابزارها پیدا میکنید.
پرسشهای متداول
سؤال: MentalHealthBench دقیقاً چه چیزی را اندازه میگیرد؟
پاسخ: کیفیت و ایمنی پاسخهای هوش مصنوعی در گفتوگوهای واقعی دربارهی سلامت روان، از موقعیتهای روزمره تا شرایط اضطراری.
سؤال: کدام مدل هوش مصنوعی بهترین نتیجه را گرفت؟
پاسخ: مدل تازهی GPT-6 Astra با امتیاز ۵۷.۳ درصد در صدر جدول قرار گرفت و پس از آن GPT-6 Sol و Claude Opus 5.5 ایستادند.
سؤال: آیا زبان فارسی هم در این بنچمارک بررسی شده؟
پاسخ: بله، فارسی یکی از ۱۹ زبانی است که در طراحی و ارزیابی این بنچمارک لحاظ شده است.
سؤال: چرا جمینای امتیاز پایینی گرفت؟
پاسخ: OpenAI جزئیات فنی دلیل ضعف Gemini 2.5 Pro را اعلام نکرده، اما نتایج نشان میدهد این مدل در محورهایی مثل زمینهیابی و کالیبراسیون فوریت عملکرد ضعیفتری نسبت به مدلهای تازهی OpenAI و Anthropic داشته است.
سؤال: آیا میتوان بهجای مشاور واقعی از هوش مصنوعی استفاده کرد؟
پاسخ: خیر. حتی بهترین مدلها در این آزمون هم به نمرهی کامل نرسیدند و هوش مصنوعی نباید جایگزین مشاورهی تخصصی شود؛ برای شناخت بهتر مرز میان توانایی واقعی هوش مصنوعی و تصورات اغراقآمیز دربارهی آن، این مقاله خواندنی است.
