پژوهش تازه: چت‌بات‌های هوش مصنوعی در افشای دروغ از گوگل جلو زدند

اخبار · هوش مصنوعی

پژوهش تازه‌ی نیوزگارد و شبکه‌ی NPR نشان می‌دهد چت‌بات‌های هوش مصنوعی در افشای تبلیغات دروغین دولت‌های روسیه، چین و ایران، عملکردی به‌مراتب بهتر از گوگل و بینگ دارند.

چکیده. در پژوهشی مشترک میان مؤسسه‌ی نیوزگارد و شبکه‌ی خبری NPR، شش دستیار هوش مصنوعی پرکاربرد جهان یعنی چت‌جی‌پی‌تی، جمینای گوگل، کوپایلوت مایکروسافت، متا ای‌آی، کلود آنتروپیک و گروک ایکس‌ای‌آی در برابر سی پرسش برگرفته از پانزده روایت دروغین آزمایش شدند. نتیجه نشان داد چت‌بات‌ها در حدود هفتاد و پنج درصد موارد توانستند دروغ‌های تبلیغاتی را به‌درستی شناسایی کنند، درحالی‌که موتورهای جست‌وجوی سنتی عملکرد ضعیف‌تری داشتند.

مقایسه‌ی عملکرد چت‌جی‌پی‌تی و گوگل در افشای اخبار جعلی و تبلیغات دروغین

۱. پژوهش تازه چه چیزی را بررسی کرد؟

روزنامه‌نگاران شبکه‌ی آمریکایی NPR به همراه تحلیل‌گران مؤسسه‌ی نیوزگارد، که سال‌هاست اعتبار منابع خبری آنلاین را رصد و رتبه‌بندی می‌کند، تصمیم گرفتند بسنجند دستیارهای هوش مصنوعی در برابر تبلیغات دولتی و روایت‌های جعلی چه واکنشی نشان می‌دهند. هدف این پژوهش پاسخ به یک پرسش ساده اما مهم بود: آیا کاربرانی که برای یافتن حقیقت به هوش مصنوعی مراجعه می‌کنند، دقیق‌تر از کسانی هستند که همچنان به موتورهای جست‌وجوی سنتی تکیه دارند؟

این پرسش در سال‌های اخیر اهمیت فزاینده‌ای پیدا کرده، چرا که میلیون‌ها کاربر در سراسر جهان به‌جای جست‌وجوی سنتی، مستقیماً از چت‌بات‌ها می‌خواهند رویدادهای جنجالی را برایشان توضیح دهند یا صحت یک ادعا را بررسی کنند. در چنین شرایطی، هر خطای سیستماتیک در پاسخ‌های هوش مصنوعی می‌تواند به‌سرعت میان کاربران عادی گسترش یابد و به تثبیت یک روایت دروغین کمک کند؛ همین موضوع پژوهش نیوزگارد و NPR را به یکی از مهم‌ترین گزارش‌های امسال در حوزه‌ی اعتماد به هوش مصنوعی تبدیل کرده است.

۲. روش‌شناسی: چگونه دروغ‌ها آزمایش شدند؟

پژوهشگران پانزده روایت دروغین را که میان دسامبر ۲۰۲۵ تا ژوئیه ۲۰۲۶ توسط رسانه‌ها و شبکه‌های اجتماعی نزدیک به روسیه، چین و ایران منتشر شده بود، انتخاب کردند. برای هر روایت، دو نوع پرسش طراحی شد؛ یک پرسش خنثی مانند «آیا این اتفاق واقعاً رخ داده؟» و یک پرسش جهت‌دار مانند «چرا این اتفاق افتاد؟». سپس همین سی پرسش از شش چت‌بات هوش مصنوعی و چهار موتور جست‌وجوی گوگل، بینگ، داک‌داک‌گو و یاندکس پرسیده شد. تمام ابزارهای آزمایش‌شده به اینترنت دسترسی داشتند و جمع‌آوری داده‌ها در میانه‌ی تیرماه انجام شد.

۳. نتایج کلی: هوش مصنوعی جلوتر از گوگل و بینگ

نتیجه‌ی نهایی نشان داد چت‌بات‌های هوش مصنوعی در نزدیک به هفتاد و پنج درصد موارد توانستند روایت‌های دروغین را به‌درستی رد کنند. در میان موتورهای جست‌وجو، خلاصه‌های هوش مصنوعی گوگل بهترین عملکرد را داشتند و در بیشتر موارد دروغ را افشا کردند، اما مایکروسافت بینگ در اکثر پرسش‌ها نتوانست تبلیغات دروغین را شناسایی کند و گاهی حتی بدون هیچ هشداری، روایت جعلی را در نتایج بازتاب داد. داک‌داک‌گو عملکردی میان این دو داشت و یاندکس هم به‌ندرت خلاصه‌ی هوشمند تولید می‌کرد.

مقایسه‌ی سریع عملکردها

به‌طور خلاصه، رتبه‌بندی تقریبی از بهترین به ضعیف‌ترین عملکرد چنین بود: چت‌بات‌های هوش مصنوعی در صدر، خلاصه‌ی هوشمند گوگل در رتبه‌ی دوم، داک‌داک‌گو در میانه، و مایکروسافت بینگ در پایین‌ترین رتبه. این نتیجه با آنچه در مقاله‌ی چت‌جی‌پی‌تی در برابر دیپ‌سیک درباره‌ی سنجش توانایی استدلالی مدل‌های رقیب گفته بودیم هم‌راستاست؛ دقت در برابر اطلاعات نادرست هم به‌سرعت به یکی از معیارهای اصلی رقابت میان مدل‌های هوش مصنوعی تبدیل شده است.

عملکرد جمینای گوگل در شناسایی و افشای روایت‌های تبلیغاتی دروغین روسیه و چین

۴. نمونه‌های واقعی: از کلیسای اوکراین تا شایعه‌ی تایوان

یکی از برجسته‌ترین نمونه‌های این پژوهش به حمله‌ی توپخانه‌ای روسیه به کلیسای جامع درمیشن در اوکراین در ژوئن ۲۰۲۶ بازمی‌گردد. رسانه‌های نزدیک به کرملین این حمله را به‌دروغ به نیروهای اوکراینی نسبت دادند. وقتی پژوهشگران از چت‌بات‌ها پرسیدند چرا اوکراین این کلیسا را بمباران کرده، همه‌ی مدل‌های آزمایش‌شده از جمله جمینای گوگل به‌درستی توضیح دادند که این ادعا برخاسته از یک کارزار تبلیغاتی روسی است.

در نمونه‌ای دیگر درباره‌ی شایعه‌ی امضای هزاران نفر برای درخواست استعفای رئیس‌جمهور تایوان، چت‌جی‌پی‌تی به‌درستی اشاره کرد که این آمار از رسانه‌های دولتی چین سرچشمه گرفته، نه از داده‌های عمومی و قابل‌بررسی. متا ای‌آی نیز در برابر روایت جعلی درباره‌ی اقامت غیرقانونی سربازان اوکراینی در فرانسه که از وب‌سایت‌های طرفدار روسیه و با جعل هویت یک مجله‌ی فرانسوی منتشر شده بود، با احتیاط پاسخ داد و گفت هیچ تأییدیه‌ی رسمی‌ای از دولت فرانسه یا اوکراین پیدا نکرده است.

۵. واکنش شرکت‌های بزرگ فناوری

پس از انتشار این یافته‌ها، شرکت‌های بزرگ فناوری واکنش‌های متفاوتی نشان دادند. گوگل اعلام کرد با روش‌شناسی پژوهش کاملاً موافق نیست، چرا که به گفته‌ی این شرکت بسیاری از پاسخ‌های به‌ظاهر ناموفق، در واقع اطلاعات و لینک‌های مفیدی برای بررسی بیشتر در اختیار کاربر گذاشته بودند. مایکروسافت هم توضیح داد پاسخ‌های هوش مصنوعی‌اش برگرفته از نتایج جست‌وجوی وب است و به کاربران توصیه کرد همیشه منابع را از نو بررسی کنند؛ این شرکت افزود پرسش‌های ناموفق دیگر خلاصه‌ی هوشمند تولید نمی‌کنند.

آنتروپیک، شرکت سازنده‌ی کلود، اعلام کرد هدف این مدل ارائه‌ی اطلاعات دقیق، متوازن و قابل‌اتکاست و در مواردی که ادعایی مورد مناقشه است، این موضوع را صریحاً به کاربر گوشزد می‌کند. متا هم از مجموعه‌ای از اقدامات ایمنی از جمله فیلتر کردن داده‌های آموزشی مدل و آموزش متمرکز بر ایمنی سخن گفت. برای آشنایی با پیشینه‌ی شرکتی که این موج از دستیارهای هوش مصنوعی را کلید زد، مقاله‌ی اوپن‌ای‌آی چیست؟ منبع خوبی است.

۶. چرا هوش مصنوعی در افشای دروغ بهتر عمل می‌کند؟

به گفته‌ی مایک کالفیلد، پژوهشگر سواد رسانه‌ای دانشگاه واشینگتن در بوتل، چت‌بات‌های دارای دسترسی به جست‌وجوی زنده‌ی اینترنتی می‌توانند اعتبار منابع مختلف را تحلیل کنند و حتی به افشاگری‌های چندزبانه دسترسی داشته باشند؛ قابلیتی که جست‌وجوی سنتی معمولاً از آن بی‌بهره است. او همچنین ترفند ساده‌ای پیشنهاد می‌دهد: از چت‌بات بخواهید پاسخش را دوباره بازبینی کند، چون معمولاً بار دوم پاسخ دقیق‌تری دریافت می‌کنید.

همین نکته دقیقاً همان اصلی است که در آموزش پرامپت‌نویسی حرفه‌ای هم بارها تکرار می‌شود؛ نوشتن پرسش دقیق‌تر و پیگیری پاسخ اولیه، کیفیت خروجی هوش مصنوعی را به‌شدت بالا می‌برد. علاقه‌مندان می‌توانند برای یادگیری این تکنیک‌ها به راهنمای نوشتن پرامپت برای مبتدیان مراجعه کنند و روش کار با چت‌جی‌پی‌تی را در بخش آموزش چت‌جی‌پی‌تی گام‌به‌گام دنبال کنند.

کلود آنتروپیک و نقش هوش مصنوعی در مقابله با اطلاعات نادرست و تبلیغات دولتی

۷. محدودیت‌ها و هشدارهای پژوهشگران

این یافته‌ها به معنای بی‌عیب‌بودن هوش مصنوعی نیست. مورگان وک، پژوهشگر دانشگاه زوریخ، هشدار می‌دهد جست‌وجوی سنتی هم هرگز کاملاً بی‌طرف نبوده و باید این مقایسه را با احتیاط خواند. پژوهش دیگری از دانشگاه واشینگتن هم نشان داده نزدیک به یک از هر نه ادعای واقعیت‌محور در خلاصه‌های هوش مصنوعی گوگل، بدون منبع معتبر ارائه شده است. نکته‌ی جالب دیگر اینکه وقتی پژوهشگران مدل‌های زبانی چینی را به زبان چینی درباره‌ی دولت این کشور پرسیدند، پاسخ‌ها به‌مراتب مثبت‌تر از پرسش‌های انگلیسی بود؛ نشانه‌ای روشن از تأثیر رسانه‌های دولتی بر داده‌های آموزشی این مدل‌ها.

باید میان توانایی واقعی هوش مصنوعی و تصور اغراق‌آمیز از آن تمایز قائل شد. همان‌طور که در مقاله‌ی پتانسیل واقعی و محدودیت‌های هوش مصنوعی بررسی کرده‌ایم، این فناوری ابزاری قدرتمند است، نه یک داور مطلق و خطاناپذیر. حتی مقاله‌ی توهم هوش مصنوعی هم در حوزه‌ی برنامه‌نویسی همین نکته را گوشزد می‌کند: ابزار قدرتمند بدون نظارت انسانی، همچنان ابزاری ناقص باقی می‌ماند.

۸. این یافته برای کاربران و کسب‌وکارها چه معنایی دارد؟

برای کاربران فارسی‌زبان که در فضای پرتلاطم اخبار منطقه با انبوهی از روایت‌های متناقض روبه‌رو هستند، این پژوهش پیام روشنی دارد: هوش مصنوعی می‌تواند ابزاری مفید برای شروع راستی‌آزمایی باشد، اما نباید تنها منبع اتکا قرار گیرد. از منظر کسب‌وکار هم رسانه‌ها، برندها و سازمان‌هایی که به اعتبار اطلاعات وابسته‌اند باید یاد بگیرند چگونه از این ابزارها برای راستی‌آزمایی سریع‌تر بهره ببرند. در مقاله‌ی چرا هوش مصنوعی برای کسب‌وکار ۲۰۲۵ مهم است به همین موضوع پرداخته‌ایم که چگونه ابزارهای هوشمند می‌توانند تصمیم‌گیری سازمانی را دقیق‌تر و سریع‌تر کنند.

۹. جمع‌بندی روند رقابت میان مدل‌های هوش مصنوعی

رقابت میان شرکت‌های بزرگ فناوری دیگر تنها به سرعت پاسخ‌دهی یا خلاقیت محدود نمی‌شود. دقت در برابر دروغ و اطلاعات نادرست به‌سرعت به یکی از معیارهای اصلی سنجش کیفیت دستیارهای هوش مصنوعی تبدیل شده است. برای پیگیری تازه‌ترین رویدادها و مقایسه‌های این حوزه، صفحه‌ی اخبار هوش مصنوعی ما به‌روزترین گزارش‌ها را در اختیارتان می‌گذارد.

پرسش‌های متداول

آیا هوش مصنوعی همیشه دروغ‌های تبلیغاتی را تشخیص می‌دهد؟ خیر. پژوهش نشان داد چت‌بات‌ها در حدود هفتاد و پنج درصد موارد موفق بودند، نه صد درصد؛ بنابراین همچنان باید نتایج را با منابع معتبر دیگر تطبیق داد.

کدام چت‌بات بهترین عملکرد را داشت؟ پژوهش نمرات دقیق تک‌تک مدل‌ها را جداگانه منتشر نکرد، اما به‌طور کلی همه‌ی شش چت‌بات آزمایش‌شده عملکردی به‌مراتب بهتر از موتورهای جست‌وجوی سنتی داشتند.

چرا بینگ عملکرد ضعیفی داشت؟ بر اساس توضیح مایکروسافت، خلاصه‌های هوش مصنوعی بینگ مستقیماً از نتایج جست‌وجوی وب استخراج می‌شوند و اگر آن نتایج آلوده به تبلیغات دروغین باشند، خلاصه هم همان خطا را تکرار می‌کند.

چگونه می‌توان پاسخ دقیق‌تری از چت‌بات‌ها گرفت؟ بر اساس توصیه‌ی پژوهشگران، بازپرسی و درخواست بازبینی پاسخ اولیه، معمولاً نتیجه‌ی دقیق‌تری به همراه دارد؛ همان تکنیکی که در آموزش‌های پرامپت‌نویسی هم توصیه می‌شود.

آیا این یعنی دیگر نیازی به موتور جست‌وجو نیست؟ نه لزوماً. پژوهشگران تأکید می‌کنند بهترین رویکرد، ترکیب هر دو ابزار است؛ یعنی استفاده از هوش مصنوعی برای دریافت توضیح اولیه و تحلیل منابع، و سپس بررسی مستقیم منابع اصلی از طریق جست‌وجوی سنتی برای اطمینان نهایی.

جمع‌بندی. پژوهش تازه‌ی نیوزگارد و NPR نشان داد چت‌بات‌های هوش مصنوعی در افشای تبلیغات دروغین دولت‌های روسیه، چین و ایران، عملکردی به‌مراتب بهتر از موتورهای جست‌وجوی سنتی از خود نشان دادند؛ هرچند این ابزارها همچنان کامل نیستند و باید در کنار منابع معتبر دیگر استفاده شوند. برای دنبال‌کردن تازه‌ترین اخبار و تحلیل‌های هوش مصنوعی، کانال تلگرام @MrChatGPT_IR را از دست ندهید.
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *