بنچمارک آخرین آزمون رادیولوژی برای سنجش هوش مصنوعی

بنچمارک تازه رادیولوژی؛ وقتی هوش مصنوعی با اطمینان اشتباه می‌کند

اخبار · هوش مصنوعی

عکس رادیولوژی را در چت‌بات آپلود می‌کنی و ظرف چند ثانیه یک تشخیص قاطع تحویل می‌گیری. لحن پاسخ آن‌قدر مطمئن است که آدم وسوسه می‌شود باور کند. اما یک بنچمارک تازه نشان می‌دهد همین قاطعیت، خطرناک‌ترین بخش ماجراست. پژوهشگران ۱۶ مدل پیشرو را روی ۲۰۰ پرونده‌ی تصویربرداری واقعی آزمودند و چیزی که دیدند، تصویر خوش‌بینانه‌ی این روزها را به هم می‌ریزد.

چکیده. بنچمارک «آخرین آزمون رادیولوژی» یا RadLE در نسخه‌ی دوم خود ۱۶ مدل چندوجهی را روی ۲۰۰ مورد تصویربرداری پزشکی سنجید و به‌جای دقت خام، پاسخ‌های نادرستِ پرقاطعیت را جریمه کرد. رادیولوژیست‌های انسانی حدود ۹۸۸ امتیاز از ۲۰۰۰ گرفتند، در حالی که بهترین مدل حدود ۷۵۸ امتیاز کسب کرد. یافته‌ی کلیدی این است که میزان اطمینان اعلام‌شده‌ی مدل‌ها، شاخص قابل‌اتکایی برای درست‌بودن پاسخشان نیست. مدل‌های متن‌باز و مدل‌های ویژه‌ی پزشکی بدترین رفتار را داشتند: تقریباً به همه‌ی موارد پاسخ دادند و اغلب هم اشتباه.
بنچمارک آخرین آزمون رادیولوژی برای سنجش هوش مصنوعی

۱) ماجرا از چه قرار است

گروه پژوهشی CRASH Lab وابسته به دانشگاه اشوکا در هند، در نوزدهم ژوئیه‌ی ۲۰۲۶ نسخه‌ی دوم بنچمارکی را منتشر کرد که نامش را «آخرین آزمون رادیولوژی» گذاشته‌اند؛ اشاره‌ای آشکار به بنچمارک مشهور «آخرین آزمون بشریت». ایده ساده است: به‌جای آنکه از مدل‌ها سؤال‌های تئوریک پزشکی بپرسیم، تصویر واقعی جلویشان بگذاریم و بخواهیم مثل یک رادیولوژیست تشخیص بدهند.

نکته‌ی مهم اما در روش امتیازدهی است. در بیشتر بنچمارک‌های رایج، فقط درصد پاسخ‌های درست شمرده می‌شود. اینجا پژوهشگران سراغ سنجه‌ای رفتند که وزن اطمینان را هم لحاظ می‌کند: مدلی که اشتباه می‌گوید ولی با قاطعیت کامل می‌گوید، امتیاز منفی می‌گیرد؛ و مدلی که صادقانه اعلام می‌کند مطمئن نیست یا پرونده را به متخصص انسانی ارجاع می‌دهد، تنبیه نمی‌شود. این تغییر کوچک در طراحی آزمون، رتبه‌بندی‌ها را کاملاً به هم ریخت.

در عمل، چیزی که این بنچمارک اندازه می‌گیرد دیگر صرفاً «چقدر بلد است» نیست؛ «چقدر می‌داند که نمی‌داند» است. و دقیقاً همین‌جاست که فاصله‌ی مدل‌ها با پزشک انسانی خودش را نشان می‌دهد.

۲) آزمون چگونه طراحی شده بود

مجموعه‌ی آزمون شامل ۲۰۰ پرونده‌ی تصویربرداری واقعی است و ۱۶ مدل چندوجهی پیشرو روی آن اجرا شدند. سقف امتیاز ۲۰۰۰ در نظر گرفته شده، یعنی هر پرونده حداکثر ده امتیاز دارد. امتیاز نهایی ترکیبی است از درستی تشخیص و صداقت مدل درباره‌ی میزان اطمینانش.

برای مقایسه، همان ۲۰۰ مورد به رادیولوژیست‌های متخصص هم داده شد. نتیجه‌ی گروه انسانی حدود ۹۸۸٫۷ امتیاز از ۲۰۰۰ بود. این عدد به‌خودی‌خود جالب است: حتی متخصص انسانی هم روی این مجموعه نمره‌ی درخشانی نمی‌گیرد، چون پرونده‌ها عمداً سخت انتخاب شده‌اند. اما همین سختی، مقایسه را منصفانه می‌کند.

بهترین مدل هوش مصنوعی حدود ۷۵۸ امتیاز گرفت. یعنی فاصله وجود دارد، ولی دیگر آن شکاف نجومی سال‌های گذشته نیست. طبق گزارش‌ها در نسخه‌ی نخست همین بنچمارک، رادیولوژیست متخصص حدود ۸۳ درصد موارد را درست تشخیص داده بود و بهترین مدل تنها حدود ۳۰ درصد؛ یعنی در فاصله‌ی کوتاهی میان دو نسخه، مدل‌ها جهش قابل‌توجهی داشته‌اند.

۳) یافته‌ی اصلی: قاطعیت به‌جای دقت

مهم‌ترین نتیجه‌ی این پژوهش یک جمله است: میزان اطمینانی که مدل اعلام می‌کند، نشانه‌ی درست‌بودن پاسخش نیست. مدل‌ها در موارد متعددی تشخیص کاملاً نادرست را با لحنی ارائه دادند که هیچ ردی از تردید در آن نبود.

پژوهشگران در جمع‌بندی خود اشاره کرده‌اند که چند مدل اگر صرفاً بیشتر سکوت می‌کردند و به‌جای حدس‌زدن، ناتوانی‌شان را اعلام می‌کردند، امتیاز به‌مراتب بهتری می‌گرفتند. این جمله شاید ساده به نظر برسد، اما در فضای پزشکی معنای سنگینی دارد: یک پاسخ نادرستِ مطمئن، از یک «نمی‌دانم» صادقانه به‌مراتب پرهزینه‌تر است.

در ادبیات فنی به این مسئله «کالیبراسیون اعتماد» می‌گویند. مدل خوب مدلی است که وقتی می‌گوید نود درصد مطمئن است، واقعاً در نود درصد موارد درست بگوید. آنچه این بنچمارک نشان داد این است که مدل‌های امروزی در حوزه‌ی تصویربرداری پزشکی هنوز به این تعادل نرسیده‌اند.

اعتمادبه‌نفس کاذب مدل‌های هوش مصنوعی در تشخیص پزشکی

۴) کدام مدل‌ها بهتر عمل کردند

تصویر رتبه‌بندی یکدست نیست و بسته به اینکه چه چیزی را معیار بگیریم، برنده عوض می‌شود:

مدل Gemini 3 Pro از گوگل در دقت خام بالاترین جایگاه را داشت و طبق گزارش‌ها در این سنجه تقریباً به عملکرد انسانی نزدیک شد. اما دقت خام همان چیزی است که این بنچمارک عمداً کافی نمی‌داند.

مدل Claude Fable 5 از آنتروپیک در سنجه‌ی «پاسخ‌های قابل‌اتکا و ایمن» بهترین عملکرد را داشت؛ یعنی وقتی مطمئن نبود، این را می‌گفت. برای کاربرد بالینی، این ویژگی احتمالاً ارزشمندتر از چند درصد دقت بیشتر است.

مدل Muse Spark 1.1 از متا در تشخیص موقعیت‌هایی که باید پرونده را به انسان واگذار کند بهتر از بقیه بود. این همان قابلیتی است که در طراحی سامانه‌های بالینی به آن «تحویل به متخصص» می‌گویند.

در مقابل، Grok 4.5 نمونه‌ی جالبی بود: دانش پزشکی‌اش نسبت به نسخه‌های قبلی رشد کرده بود، اما نرخ توهم‌زایی‌اش هم بالا رفته بود. یعنی بیشتر می‌دانست و همزمان بیشتر هم از خودش درمی‌آورد.

۵) داستان تلخ مدل‌های متن‌باز و مدل‌های پزشکی

شاید غیرمنتظره‌ترین بخش گزارش همین باشد. انتظار می‌رفت مدل‌هایی که مشخصاً روی داده‌ی پزشکی آموزش دیده‌اند، در آزمونی پزشکی برتری داشته باشند. اما نتیجه برعکس بود.

مدل‌های متن‌باز و مدل‌های تخصصی حوزه‌ی سلامت تقریباً به همه‌ی پرونده‌ها پاسخ دادند؛ یعنی نرخ خودداری‌شان نزدیک به صفر بود. اما بخش بزرگی از این پاسخ‌ها نادرست و در عین حال با اطمینان بالا ارائه شده بود. در سنجه‌ی وزنی، این ترکیب فاجعه‌بار است.

یک تفسیر محتمل این است که تنظیم دقیق روی داده‌ی حوزه‌ی خاص، مدل را «جسورتر» می‌کند: مدل یاد می‌گیرد که در این حوزه باید پاسخ بدهد، بی‌آنکه یاد بگیرد کِی نباید. این همان الگویی است که در بحث‌های عمومی درباره‌ی توانایی‌ها و محدودیت‌های واقعی هوش مصنوعی بارها تکرار شده است.

۶) چرا این موضوع فراتر از رادیولوژی است

مسئله‌ی کالیبراسیون اعتماد مخصوص پزشکی نیست. هر جا که خروجی مدل قرار است مبنای تصمیم قرار بگیرد — از تحلیل حقوقی و مالی گرفته تا مهندسی — همین الگو تکرار می‌شود: مدل با لحن مطمئن پاسخی می‌دهد که کاربر غیرمتخصص راهی برای راستی‌آزمایی‌اش ندارد.

تفاوت رادیولوژی این است که هزینه‌ی خطا فوری و انسانی است. به همین دلیل حوزه‌ی پزشکی عملاً به آزمایشگاه سنجش صداقت مدل‌ها تبدیل شده و درس‌هایش به بقیه‌ی صنایع هم سرریز می‌کند. اگر می‌خواهی تصویر کلی‌تری از نقش این فناوری در کسب‌وکار داشته باشی، مرور اهمیت هوش مصنوعی در کسب‌وکار نقطه‌ی شروع خوبی است.

۷) این یافته برای کاربر عادی چه معنایی دارد

اگر عادت داری عکس رادیولوژی یا آزمایش خودت را در چت‌بات آپلود کنی، این پژوهش چند پیام روشن برایت دارد.

نخست اینکه قاطعیت لحن پاسخ را با اعتبار آن اشتباه نگیر. مدل‌ها طوری آموزش دیده‌اند که روان و مطمئن بنویسند؛ این ویژگی سبک نگارش است، نه گواهی صحت.

دوم اینکه پاسخ مدل را در بهترین حالت به‌عنوان «فرضیه‌ی اولیه» در نظر بگیر، نه تشخیص. سؤالی که باید از مدل بپرسی این نیست که «این عکس چه مشکلی دارد»، بلکه این است که «چه احتمال‌هایی مطرح است و برای رد یا تأیید هرکدام چه چیزی لازم است».

سوم اینکه از خود مدل بخواه سطح اطمینانش را اعلام کند و بگوید در چه شرایطی ممکن است اشتباه کند. نحوه‌ی پرسیدن، تأثیر مستقیمی بر کیفیت پاسخ دارد؛ اگر با اصول پرامپت‌نویسی آشنا نیستی، راهنمای پرامپت‌نویسی به زبان ساده کمک می‌کند.

برتری رادیولوژیست انسانی نسبت به مدل‌های هوش مصنوعی

۸) محدودیت‌های این پژوهش

هیچ بنچمارکی تصویر کامل نیست و این یکی هم استثنا نیست. مجموعه‌ی ۲۰۰ موردی، هرچقدر هم با دقت انتخاب شده باشد، نماینده‌ی تمام تنوع بالینی نیست. ضمناً پرونده‌ها عمداً دشوار انتخاب شده‌اند، پس نمرات پایین را نباید مستقیماً به عملکرد در موارد روزمره تعمیم داد.

نکته‌ی دیگر اینکه مدل‌ها در این آزمون تک‌مرحله‌ای ارزیابی شده‌اند، در حالی که در عمل یک سامانه‌ی بالینی می‌تواند خروجی چند مدل را ترکیب کند، سابقه‌ی بیمار را در اختیار داشته باشد و در نهایت زیر نظر پزشک کار کند. کارایی چنین سامانه‌ای احتمالاً بالاتر از عدد خام بنچمارک خواهد بود.

در نهایت، سرعت تغییر مدل‌ها به‌قدری بالاست که نتیجه‌ی هر بنچمارک عمر کوتاهی دارد. فاصله‌ی چشمگیر میان نسخه‌ی اول و دوم همین آزمون، خودش گواه این ادعاست. برای دنبال‌کردن این تغییرات، بخش اخبار هوش مصنوعی را از دست نده.

۹) نگاه به آینده

جهت‌گیری روشن است: رقابت در حال جابه‌جا شدن از «چه کسی دقیق‌تر است» به «چه کسی صادق‌تر است». مدلی که بتواند مرز دانش خودش را تشخیص بدهد و پرونده را به موقع به انسان واگذار کند، در محیط بالینی ارزش عملی بیشتری دارد تا مدلی که چند درصد دقت خام بالاتر ولی رفتار غیرقابل‌پیش‌بینی دارد.

محتمل‌ترین مسیر کوتاه‌مدت، نقش «دستیار» است نه «تشخیص‌دهنده»: مدل موارد مشکوک را علامت می‌زند، اولویت‌بندی نوبت‌ها را انجام می‌دهد و گزارش اولیه را می‌نویسد؛ اما امضای نهایی همچنان پای رادیولوژیست است. مقایسه‌ی توانمندی مدل‌های مختلف در حوزه‌های تخصصی موضوعی است که در تحلیل‌هایی مانند نبرد چت‌جی‌پی‌تی و دیپ‌سیک هم به آن پرداخته‌ایم.

پرسش‌های پرتکرار درباره‌ی بنچمارک آخرین آزمون رادیولوژی

آیا می‌توانم برای تشخیص بیماری به چت‌بات اعتماد کنم؟

خیر. بر پایه‌ی همین پژوهش، مدل‌ها هنوز برای تشخیص مستقل پزشکی آماده نیستند و مهم‌تر از آن، میزان اطمینانی که اعلام می‌کنند قابل‌اتکا نیست. از مدل برای درک بهتر گزارش پزشک و آماده‌کردن سؤال استفاده کن، نه برای جایگزینی او.

چرا مدل‌های تخصصی پزشکی بدتر عمل کردند؟

چون تقریباً هیچ‌وقت از پاسخ‌دادن خودداری نکردند. در سنجه‌ای که پاسخ نادرست پرقاطعیت را جریمه می‌کند، این رفتار امتیاز را به‌شدت پایین می‌آورد. مدل عمومی که گاهی می‌گوید «مطمئن نیستم» در این آزمون جلو می‌افتد.

معنای عدد ۹۸۸ از ۲۰۰۰ برای رادیولوژیست انسانی چیست؟

یعنی حتی متخصص انسانی هم روی این مجموعه‌ی عمداً دشوار نمره‌ی کاملی نمی‌گیرد. این عدد خط پایه‌ی مقایسه است، نه نمره‌ی عملکرد رادیولوژیست در کار روزمره.

کدام مدل برای پرسش‌های پزشکی امن‌تر است؟

در این آزمون، مدلی که بیشترین امتیاز را در بخش پاسخ‌های قابل‌اتکا و ایمن گرفت Claude Fable 5 بود و Gemini 3 Pro در دقت خام پیشتاز بود. اما هیچ‌کدام جایگزین پزشک نیستند و انتخاب میانشان نباید حس امنیت کاذب ایجاد کند.

آیا این وضعیت به‌زودی بهتر می‌شود؟

روند بهبود سریع بوده است، اما مسئله‌ی کالیبراسیون اعتماد صرفاً با بزرگ‌تر کردن مدل حل نمی‌شود و به تغییر در روش آموزش و ارزیابی نیاز دارد. برای آشنایی با بازیگران این حوزه، مطلب اوپن‌ای‌آی چیست را ببین.

جمع‌بندی. بنچمارک تازه‌ی رادیولوژی نشان داد مشکل امروز مدل‌ها بی‌سوادی نیست، بی‌احتیاطی است؛ آن‌ها بیش از دانششان اعتمادبه‌نفس دارند. تا وقتی این شکاف پر نشده، جای هوش مصنوعی در اتاق تصویربرداری کنار پزشک است، نه به‌جای او. برای دنبال‌کردن روزانه‌ی این تحولات به @MrChatGPT_IR بپیوند.
— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *