عکس رادیولوژی را در چتبات آپلود میکنی و ظرف چند ثانیه یک تشخیص قاطع تحویل میگیری. لحن پاسخ آنقدر مطمئن است که آدم وسوسه میشود باور کند. اما یک بنچمارک تازه نشان میدهد همین قاطعیت، خطرناکترین بخش ماجراست. پژوهشگران ۱۶ مدل پیشرو را روی ۲۰۰ پروندهی تصویربرداری واقعی آزمودند و چیزی که دیدند، تصویر خوشبینانهی این روزها را به هم میریزد.

لیست مطالب
۱) ماجرا از چه قرار است
گروه پژوهشی CRASH Lab وابسته به دانشگاه اشوکا در هند، در نوزدهم ژوئیهی ۲۰۲۶ نسخهی دوم بنچمارکی را منتشر کرد که نامش را «آخرین آزمون رادیولوژی» گذاشتهاند؛ اشارهای آشکار به بنچمارک مشهور «آخرین آزمون بشریت». ایده ساده است: بهجای آنکه از مدلها سؤالهای تئوریک پزشکی بپرسیم، تصویر واقعی جلویشان بگذاریم و بخواهیم مثل یک رادیولوژیست تشخیص بدهند.
نکتهی مهم اما در روش امتیازدهی است. در بیشتر بنچمارکهای رایج، فقط درصد پاسخهای درست شمرده میشود. اینجا پژوهشگران سراغ سنجهای رفتند که وزن اطمینان را هم لحاظ میکند: مدلی که اشتباه میگوید ولی با قاطعیت کامل میگوید، امتیاز منفی میگیرد؛ و مدلی که صادقانه اعلام میکند مطمئن نیست یا پرونده را به متخصص انسانی ارجاع میدهد، تنبیه نمیشود. این تغییر کوچک در طراحی آزمون، رتبهبندیها را کاملاً به هم ریخت.
در عمل، چیزی که این بنچمارک اندازه میگیرد دیگر صرفاً «چقدر بلد است» نیست؛ «چقدر میداند که نمیداند» است. و دقیقاً همینجاست که فاصلهی مدلها با پزشک انسانی خودش را نشان میدهد.
۲) آزمون چگونه طراحی شده بود
مجموعهی آزمون شامل ۲۰۰ پروندهی تصویربرداری واقعی است و ۱۶ مدل چندوجهی پیشرو روی آن اجرا شدند. سقف امتیاز ۲۰۰۰ در نظر گرفته شده، یعنی هر پرونده حداکثر ده امتیاز دارد. امتیاز نهایی ترکیبی است از درستی تشخیص و صداقت مدل دربارهی میزان اطمینانش.
برای مقایسه، همان ۲۰۰ مورد به رادیولوژیستهای متخصص هم داده شد. نتیجهی گروه انسانی حدود ۹۸۸٫۷ امتیاز از ۲۰۰۰ بود. این عدد بهخودیخود جالب است: حتی متخصص انسانی هم روی این مجموعه نمرهی درخشانی نمیگیرد، چون پروندهها عمداً سخت انتخاب شدهاند. اما همین سختی، مقایسه را منصفانه میکند.
بهترین مدل هوش مصنوعی حدود ۷۵۸ امتیاز گرفت. یعنی فاصله وجود دارد، ولی دیگر آن شکاف نجومی سالهای گذشته نیست. طبق گزارشها در نسخهی نخست همین بنچمارک، رادیولوژیست متخصص حدود ۸۳ درصد موارد را درست تشخیص داده بود و بهترین مدل تنها حدود ۳۰ درصد؛ یعنی در فاصلهی کوتاهی میان دو نسخه، مدلها جهش قابلتوجهی داشتهاند.
۳) یافتهی اصلی: قاطعیت بهجای دقت
مهمترین نتیجهی این پژوهش یک جمله است: میزان اطمینانی که مدل اعلام میکند، نشانهی درستبودن پاسخش نیست. مدلها در موارد متعددی تشخیص کاملاً نادرست را با لحنی ارائه دادند که هیچ ردی از تردید در آن نبود.
پژوهشگران در جمعبندی خود اشاره کردهاند که چند مدل اگر صرفاً بیشتر سکوت میکردند و بهجای حدسزدن، ناتوانیشان را اعلام میکردند، امتیاز بهمراتب بهتری میگرفتند. این جمله شاید ساده به نظر برسد، اما در فضای پزشکی معنای سنگینی دارد: یک پاسخ نادرستِ مطمئن، از یک «نمیدانم» صادقانه بهمراتب پرهزینهتر است.
در ادبیات فنی به این مسئله «کالیبراسیون اعتماد» میگویند. مدل خوب مدلی است که وقتی میگوید نود درصد مطمئن است، واقعاً در نود درصد موارد درست بگوید. آنچه این بنچمارک نشان داد این است که مدلهای امروزی در حوزهی تصویربرداری پزشکی هنوز به این تعادل نرسیدهاند.

۴) کدام مدلها بهتر عمل کردند
تصویر رتبهبندی یکدست نیست و بسته به اینکه چه چیزی را معیار بگیریم، برنده عوض میشود:
مدل Gemini 3 Pro از گوگل در دقت خام بالاترین جایگاه را داشت و طبق گزارشها در این سنجه تقریباً به عملکرد انسانی نزدیک شد. اما دقت خام همان چیزی است که این بنچمارک عمداً کافی نمیداند.
مدل Claude Fable 5 از آنتروپیک در سنجهی «پاسخهای قابلاتکا و ایمن» بهترین عملکرد را داشت؛ یعنی وقتی مطمئن نبود، این را میگفت. برای کاربرد بالینی، این ویژگی احتمالاً ارزشمندتر از چند درصد دقت بیشتر است.
مدل Muse Spark 1.1 از متا در تشخیص موقعیتهایی که باید پرونده را به انسان واگذار کند بهتر از بقیه بود. این همان قابلیتی است که در طراحی سامانههای بالینی به آن «تحویل به متخصص» میگویند.
در مقابل، Grok 4.5 نمونهی جالبی بود: دانش پزشکیاش نسبت به نسخههای قبلی رشد کرده بود، اما نرخ توهمزاییاش هم بالا رفته بود. یعنی بیشتر میدانست و همزمان بیشتر هم از خودش درمیآورد.
۵) داستان تلخ مدلهای متنباز و مدلهای پزشکی
شاید غیرمنتظرهترین بخش گزارش همین باشد. انتظار میرفت مدلهایی که مشخصاً روی دادهی پزشکی آموزش دیدهاند، در آزمونی پزشکی برتری داشته باشند. اما نتیجه برعکس بود.
مدلهای متنباز و مدلهای تخصصی حوزهی سلامت تقریباً به همهی پروندهها پاسخ دادند؛ یعنی نرخ خودداریشان نزدیک به صفر بود. اما بخش بزرگی از این پاسخها نادرست و در عین حال با اطمینان بالا ارائه شده بود. در سنجهی وزنی، این ترکیب فاجعهبار است.
یک تفسیر محتمل این است که تنظیم دقیق روی دادهی حوزهی خاص، مدل را «جسورتر» میکند: مدل یاد میگیرد که در این حوزه باید پاسخ بدهد، بیآنکه یاد بگیرد کِی نباید. این همان الگویی است که در بحثهای عمومی دربارهی تواناییها و محدودیتهای واقعی هوش مصنوعی بارها تکرار شده است.
۶) چرا این موضوع فراتر از رادیولوژی است
مسئلهی کالیبراسیون اعتماد مخصوص پزشکی نیست. هر جا که خروجی مدل قرار است مبنای تصمیم قرار بگیرد — از تحلیل حقوقی و مالی گرفته تا مهندسی — همین الگو تکرار میشود: مدل با لحن مطمئن پاسخی میدهد که کاربر غیرمتخصص راهی برای راستیآزماییاش ندارد.
تفاوت رادیولوژی این است که هزینهی خطا فوری و انسانی است. به همین دلیل حوزهی پزشکی عملاً به آزمایشگاه سنجش صداقت مدلها تبدیل شده و درسهایش به بقیهی صنایع هم سرریز میکند. اگر میخواهی تصویر کلیتری از نقش این فناوری در کسبوکار داشته باشی، مرور اهمیت هوش مصنوعی در کسبوکار نقطهی شروع خوبی است.
۷) این یافته برای کاربر عادی چه معنایی دارد
اگر عادت داری عکس رادیولوژی یا آزمایش خودت را در چتبات آپلود کنی، این پژوهش چند پیام روشن برایت دارد.
نخست اینکه قاطعیت لحن پاسخ را با اعتبار آن اشتباه نگیر. مدلها طوری آموزش دیدهاند که روان و مطمئن بنویسند؛ این ویژگی سبک نگارش است، نه گواهی صحت.
دوم اینکه پاسخ مدل را در بهترین حالت بهعنوان «فرضیهی اولیه» در نظر بگیر، نه تشخیص. سؤالی که باید از مدل بپرسی این نیست که «این عکس چه مشکلی دارد»، بلکه این است که «چه احتمالهایی مطرح است و برای رد یا تأیید هرکدام چه چیزی لازم است».
سوم اینکه از خود مدل بخواه سطح اطمینانش را اعلام کند و بگوید در چه شرایطی ممکن است اشتباه کند. نحوهی پرسیدن، تأثیر مستقیمی بر کیفیت پاسخ دارد؛ اگر با اصول پرامپتنویسی آشنا نیستی، راهنمای پرامپتنویسی به زبان ساده کمک میکند.

۸) محدودیتهای این پژوهش
هیچ بنچمارکی تصویر کامل نیست و این یکی هم استثنا نیست. مجموعهی ۲۰۰ موردی، هرچقدر هم با دقت انتخاب شده باشد، نمایندهی تمام تنوع بالینی نیست. ضمناً پروندهها عمداً دشوار انتخاب شدهاند، پس نمرات پایین را نباید مستقیماً به عملکرد در موارد روزمره تعمیم داد.
نکتهی دیگر اینکه مدلها در این آزمون تکمرحلهای ارزیابی شدهاند، در حالی که در عمل یک سامانهی بالینی میتواند خروجی چند مدل را ترکیب کند، سابقهی بیمار را در اختیار داشته باشد و در نهایت زیر نظر پزشک کار کند. کارایی چنین سامانهای احتمالاً بالاتر از عدد خام بنچمارک خواهد بود.
در نهایت، سرعت تغییر مدلها بهقدری بالاست که نتیجهی هر بنچمارک عمر کوتاهی دارد. فاصلهی چشمگیر میان نسخهی اول و دوم همین آزمون، خودش گواه این ادعاست. برای دنبالکردن این تغییرات، بخش اخبار هوش مصنوعی را از دست نده.
۹) نگاه به آینده
جهتگیری روشن است: رقابت در حال جابهجا شدن از «چه کسی دقیقتر است» به «چه کسی صادقتر است». مدلی که بتواند مرز دانش خودش را تشخیص بدهد و پرونده را به موقع به انسان واگذار کند، در محیط بالینی ارزش عملی بیشتری دارد تا مدلی که چند درصد دقت خام بالاتر ولی رفتار غیرقابلپیشبینی دارد.
محتملترین مسیر کوتاهمدت، نقش «دستیار» است نه «تشخیصدهنده»: مدل موارد مشکوک را علامت میزند، اولویتبندی نوبتها را انجام میدهد و گزارش اولیه را مینویسد؛ اما امضای نهایی همچنان پای رادیولوژیست است. مقایسهی توانمندی مدلهای مختلف در حوزههای تخصصی موضوعی است که در تحلیلهایی مانند نبرد چتجیپیتی و دیپسیک هم به آن پرداختهایم.
پرسشهای پرتکرار دربارهی بنچمارک آخرین آزمون رادیولوژی
آیا میتوانم برای تشخیص بیماری به چتبات اعتماد کنم؟
خیر. بر پایهی همین پژوهش، مدلها هنوز برای تشخیص مستقل پزشکی آماده نیستند و مهمتر از آن، میزان اطمینانی که اعلام میکنند قابلاتکا نیست. از مدل برای درک بهتر گزارش پزشک و آمادهکردن سؤال استفاده کن، نه برای جایگزینی او.
چرا مدلهای تخصصی پزشکی بدتر عمل کردند؟
چون تقریباً هیچوقت از پاسخدادن خودداری نکردند. در سنجهای که پاسخ نادرست پرقاطعیت را جریمه میکند، این رفتار امتیاز را بهشدت پایین میآورد. مدل عمومی که گاهی میگوید «مطمئن نیستم» در این آزمون جلو میافتد.
معنای عدد ۹۸۸ از ۲۰۰۰ برای رادیولوژیست انسانی چیست؟
یعنی حتی متخصص انسانی هم روی این مجموعهی عمداً دشوار نمرهی کاملی نمیگیرد. این عدد خط پایهی مقایسه است، نه نمرهی عملکرد رادیولوژیست در کار روزمره.
کدام مدل برای پرسشهای پزشکی امنتر است؟
در این آزمون، مدلی که بیشترین امتیاز را در بخش پاسخهای قابلاتکا و ایمن گرفت Claude Fable 5 بود و Gemini 3 Pro در دقت خام پیشتاز بود. اما هیچکدام جایگزین پزشک نیستند و انتخاب میانشان نباید حس امنیت کاذب ایجاد کند.
آیا این وضعیت بهزودی بهتر میشود؟
روند بهبود سریع بوده است، اما مسئلهی کالیبراسیون اعتماد صرفاً با بزرگتر کردن مدل حل نمیشود و به تغییر در روش آموزش و ارزیابی نیاز دارد. برای آشنایی با بازیگران این حوزه، مطلب اوپنایآی چیست را ببین.
