چهار شرکت بزرگ حسابرسی و پرونده‌ی توهم هوش مصنوعی

چهار غول حسابرسی در دام توهم هوش مصنوعی افتادند

اخبار · هوش مصنوعی

چهار شرکتی که کارشان راستی‌آزمایی اعداد دیگران است، خودشان گزارش‌هایی منتشر کرده‌اند که منابعشان وجود خارجی ندارد. بررسی گروه جی‌پی‌تی‌زیرو روی گزارش‌های شرکت پی‌دبلیو‌سی نشان داد بخشی از استنادها ساختگی‌اند و حتی محصولات و مشتریانی نام برده شده‌اند که هرگز وجود نداشته‌اند. پیش‌تر هم دیلویت و کی‌پی‌ام‌جی گرفتار همین ماجرا شده بودند. این پرونده فقط یک سوتی حرفه‌ای نیست؛ آزمایشی است روی اعتماد به کل زنجیره‌ی تولید محتوای تخصصی.

چکیده. گروه پژوهشی جی‌پی‌تی‌زیرو در بررسی گزارش‌های «رهبری فکری» شرکت پی‌دبلیو‌سی نشانه‌های تولید ماشینی و استنادهای جعلی پیدا کرد. پیش از آن، دیلویت بخشی از دستمزد یک گزارش دولتی در استرالیا را بازگرداند و گزارش کی‌پی‌ام‌جی درباره‌ی هوش مصنوعی هم به توهم‌زایی متهم شد. مسئله‌ی اصلی، نبود لایه‌ی راستی‌آزمایی انسانی در تولید انبوه گزارش است.
چهار شرکت بزرگ حسابرسی و پرونده‌ی توهم هوش مصنوعی

۱) ماجرا چیست؟

گروه جی‌پی‌تی‌زیرو، شرکتی که ابزارهایش برای تشخیص متن تولیدشده با هوش مصنوعی شناخته می‌شود، مجموعه‌ای از گزارش‌های منتشرشده‌ی شرکت پی‌دبلیو‌سی را زیر ذره‌بین برد. نتیجه‌ی بررسی، بخش بزرگی از صنعت مشاوره را غافلگیر کرد.

طبق این بررسی، در چند گزارش تحلیلی این شرکت — از جمله گزارش‌هایی که در حوزه‌ی خاورمیانه منتشر شده بودند — نشانه‌های پررنگ تولید ماشینی دیده می‌شود و مهم‌تر از آن، بخشی از منابع و استنادها اساساً وجود خارجی ندارند.

در یکی از موارد، گزارش به محصول و چارچوبی ارجاع داده بود که به‌گفته‌ی بررسی‌کنندگان ساخته‌ی ذهن مدل زبانی است، نه واقعیت بازار؛ حتی نام سازمان‌هایی به‌عنوان مشتری این محصول آمده بود که چنین محصولی را هرگز به‌کار نگرفته بودند.

نکته‌ی طعنه‌آمیز ماجرا اینجاست که موضوع بخشی از همین گزارش‌ها، حکمرانی مسئولانه‌ی هوش مصنوعی بود؛ یعنی دقیقاً همان خدمتی که این شرکت‌ها به مشتریانشان می‌فروشند.

۲) چرا این خطا با یک اشتباه ساده فرق دارد؟

گزارش‌های شرکت‌های بزرگ مشاوره جایگاه ویژه‌ای دارند. مدیران، سیاست‌گذاران و رسانه‌ها این متن‌ها را نه یک نظر شخصی، بلکه سند تحلیلی می‌دانند و روی اعدادشان تصمیم می‌گیرند. وقتی داخل چنین سندی آمار ساختگی بنشیند، خطا در همان صفحه نمی‌ماند.

مسئله‌ی دوم، اثر زنجیره‌ای است. گزارش منتشرشده در وب‌سایت یک برند معتبر، خیلی زود تبدیل به منبع می‌شود: خبرگزاری به آن ارجاع می‌دهد، تحلیل‌گر بعدی از خبرگزاری نقل می‌کند و در نهایت یک عدد بی‌پایه در چند ده متن دیگر تکثیر می‌شود.

مسئله‌ی سوم و مهم‌تر این است که همین متن‌ها بعداً به خوراک آموزشی و جست‌وجوی مدل‌های زبانی تبدیل می‌شوند. یعنی خطایی که از یک مدل بیرون آمده، دوباره به مدل‌ها برمی‌گردد؛ حلقه‌ای بسته که تشخیص خطا در آن هر روز سخت‌تر می‌شود.

۳) توهم مدل زبانی دقیقاً چگونه کار می‌کند؟

برای فهم ریشه‌ی ماجرا باید بدانیم مدل زبانی چه می‌کند و چه نمی‌کند. مدل، پایگاه‌داده‌ی حقایق نیست؛ سامانه‌ای است که محتمل‌ترین ادامه‌ی متن را می‌سازد. وقتی از آن استناد بخواهید، ساختار یک استناد معتبر را بازتولید می‌کند: نام نویسنده‌ی محتمل، عنوان محتمل، سال محتمل و شماره‌ی صفحه‌ی محتمل.

نتیجه، منبعی است که همه‌ی نشانه‌های ظاهری اعتبار را دارد اما وجود ندارد. همین «درست به‌نظر رسیدن» است که کار را خطرناک می‌کند؛ ارجاع جعلی در نگاه اول از ارجاع واقعی قابل تشخیص نیست.

در حوزه‌ی نام محصول و چارچوب هم همین منطق برقرار است. مدل می‌داند نام چارچوب‌های مدیریتی معمولاً از دو واژه‌ی انگلیسی ساخته می‌شود و یک نمونه‌ی باورپذیر می‌سازد. اگر کسی آن را راستی‌آزمایی نکند، نام ساختگی وارد سند رسمی می‌شود.

اگر می‌خواهید تصویر دقیق‌تری از مرز توانایی و ناتوانی این ابزارها داشته باشید، گزارش توان و محدودیت‌های واقعی هوش مصنوعی این تفکیک را با مثال باز کرده است.

۴) پرونده‌ی دیلویت؛ گران‌ترین درس

این نخستین بار نیست که یک شرکت بزرگ حسابرسی سر همین موضوع دردسر پیدا می‌کند. مشهورترین نمونه به گزارشی برمی‌گردد که دیلویت برای یک نهاد دولتی در استرالیا تهیه کرده بود.

پس از آنکه مشخص شد بخشی از ارجاعات و نقل‌قول‌های آن گزارش با واقعیت نمی‌خواند، شرکت پذیرفت بخشی از مبلغ قرارداد را بازگرداند. طبق گزارش‌های رسانه‌ای، ارزش آن قرارداد حدود ۴۴۰ هزار دلار استرالیا بود.

مبلغ در مقیاس درآمد این شرکت‌ها ناچیز است؛ آنچه گران تمام شد، بازگشت پول نبود بلکه ثبت رسمی این نکته بود که یک گزارش پولی، بدون بازبینی کافی منتشر شده است.

در مورد کی‌پی‌ام‌جی هم گزارشی درباره‌ی هوش مصنوعی منتشر شد که خودش به داشتن نشانه‌های توهم ماشینی متهم شد. درباره‌ی شرکت ای‌وای هم طبق گزارش‌ها موارد مشابهی مطرح شده است.

استنادهای جعلی کشف‌شده در گزارش‌های شرکت پی‌دبلیو‌سی

۵) چرا این اتفاق دقیقاً در این صنعت افتاد؟

صنعت مشاوره چند ویژگی دارد که آن را به زمین مستعدی برای این خطا تبدیل می‌کند. اول، حجم بالای تولید محتوا: این شرکت‌ها سالانه صدها گزارش «رهبری فکری» منتشر می‌کنند که کارکرد اصلی‌شان بازاریابی است، نه پژوهش.

دوم، فشار زمان و هزینه. تولید یک گزارش تحلیلی با پژوهش واقعی هفته‌ها زمان و نیروی متخصص می‌خواهد؛ تولید نسخه‌ای که «شبیه» همان گزارش باشد با ابزارهای امروزی چند ساعت طول می‌کشد. وقتی خروجی از بیرون تفاوت محسوسی ندارد، انگیزه‌ی اقتصادی روشن است.

سوم، خلأ فرایند بازبینی. در بسیاری از سازمان‌ها هنوز مشخص نیست چه کسی مسئول راستی‌آزمایی متنی است که با کمک ابزار هوش مصنوعی نوشته شده. مسئولیت میان نویسنده، ویراستار و تیم انطباق معلق می‌ماند و در عمل هیچ‌کس آن را انجام نمی‌دهد.

این دقیقاً همان الگویی است که در تحلیل توهم توسعه‌دهنده‌ی تنها در برابر مهندس واقعی هم دیده می‌شود: ابزار سرعت را چند برابر می‌کند، اما اگر لایه‌ی مهندسی و بازبینی حذف شود، خروجی فقط سریع‌تر خراب می‌شود.

۶) چطور یک گزارش را راستی‌آزمایی کنیم؟

راهکار عملی پیچیده نیست و چند دقیقه بیشتر وقت نمی‌گیرد. مرحله‌ی اول، بررسی وجود منبع است: عنوان دقیق منبع را در گیومه جست‌وجو کنید. اگر جز خود همان گزارش هیچ نتیجه‌ای برنگشت، پرچم قرمز اول بالا رفته است.

مرحله‌ی دوم، ردیابی عدد است. هر آمار مهم باید به یک سند اولیه برسد؛ نه به گزارش دیگری که آن هم بدون منبع نقل کرده. اگر زنجیره‌ی ارجاع بعد از دو حلقه به بن‌بست خورد، عدد قابل استناد نیست.

مرحله‌ی سوم، آزمون نام‌های خاص است. نام محصول، چارچوب، پروژه یا نهادی که در متن آمده را جداگانه جست‌وجو کنید. نام‌های ساختگی معمولاً هیچ ردی در وب‌سایت رسمی سازنده‌ی ادعایی ندارند.

مرحله‌ی چهارم، پرسیدن درست از خود ابزار است. اگر از مدل بخواهید فقط با منابع قابل بازیابی پاسخ دهد و برای هر ادعا نشانی دقیق بیاورد، نرخ خطا به‌شکل محسوسی پایین می‌آید. راهنمای پرامپت‌نویسی از صفر برای همین دست از تکنیک‌ها نوشته شده است.

۷) این ماجرا برای کسب‌وکارها چه معنایی دارد؟

پیام روشن است: استفاده از هوش مصنوعی در تولید محتوای تخصصی ممنوع نیست، اما بدون فرایند بازبینی، ریسک حقوقی و اعتباری می‌سازد. سازمانی که گزارش منتشر می‌کند، در برابر محتوای آن پاسخ‌گوست؛ حتی اگر متن را ماشین نوشته باشد.

در عمل، سه سیاست ساده بیشتر سازمان‌ها را از این دردسر دور نگه می‌دارد. نخست، ثبت شفاف اینکه کدام بخش از سند با کمک ابزار تولید شده. دوم، الزام به راستی‌آزمایی انسانی همه‌ی اعداد و استنادها پیش از انتشار. سوم، تعیین یک مالک مشخص برای صحت محتوا.

نکته‌ی مهم این است که هیچ‌کدام از این سه بند، بهره‌وری را از بین نمی‌برد. بحث چرا هوش مصنوعی برای کسب‌وکارها مهم است دقیقاً همین است: ارزش واقعی این فناوری وقتی آزاد می‌شود که در یک فرایند کنترل‌شده بنشیند.

روش راستی‌آزمایی استنادهای تولیدشده با هوش مصنوعی

۸) گام بعدی صنعت چه خواهد بود؟

احتمال زیادی وجود دارد که ادامه‌ی این پرونده به سمت الزام‌های افشا برود؛ یعنی گزارش‌های حرفه‌ای ناچار شوند سهم ابزارهای خودکار در تولیدشان را اعلام کنند، همان‌طور که امروز تعارض منافع را اعلام می‌کنند.

مسیر دوم، رشد بازار ابزارهای راستی‌آزمایی است. اگر تشخیص متن ماشینی و اعتبارسنجی خودکار استنادها به بخشی از فرایند انتشار تبدیل شود، هزینه‌ی این خطاها به‌شدت پایین می‌آید.

در نهایت شاید مهم‌ترین اثر این ماجرا، تغییر عادت خواننده باشد: اینکه دیدن لوگوی یک برند معتبر روی جلد گزارش، دیگر جای بررسی منابع را نگیرد. برای دنبال‌کردن ادامه‌ی این پرونده، بخش اخبار هوش مصنوعی به‌روز می‌شود.

پرسش‌های پرتکرار درباره‌ی توهم هوش مصنوعی در گزارش‌ها

گروه جی‌پی‌تی‌زیرو دقیقاً چه چیزی را کشف کرد؟

این گروه در بررسی گزارش‌های منتشرشده‌ی شرکت پی‌دبلیو‌سی نشانه‌های تولید ماشینی و استنادهای جعلی پیدا کرد؛ از جمله ارجاع به محصول و چارچوبی که طبق این بررسی وجود خارجی نداشت و نام سازمان‌هایی که به‌اشتباه به‌عنوان کاربر آن معرفی شده بودند.

آیا شرکت‌های دیگر هم گرفتار همین ماجرا شده‌اند؟

بله. پیش‌تر دیلویت پذیرفت بخشی از دستمزد یک گزارش دولتی در استرالیا را بازگرداند و گزارشی از کی‌پی‌ام‌جی درباره‌ی هوش مصنوعی هم به داشتن خطاهای ماشینی متهم شد. درباره‌ی ای‌وای هم طبق گزارش‌ها موارد مشابهی مطرح شده است.

توهم در مدل‌های زبانی یعنی چه؟

یعنی مدل به‌جای بازیابی یک واقعیت، متنی می‌سازد که از نظر آماری محتمل به‌نظر می‌رسد. نتیجه می‌تواند نام، عدد یا منبعی باشد که ساختار درستی دارد اما در دنیای واقعی وجود ندارد.

چطور بفهمیم یک استناد جعلی است؟

عنوان دقیق منبع را در گیومه جست‌وجو کنید؛ اگر جز همان گزارش هیچ ردی از آن نبود، احتمالاً ساختگی است. نام محصول‌ها و چارچوب‌ها را هم جداگانه بررسی کنید و زنجیره‌ی ارجاع هر عدد مهم را تا سند اولیه دنبال کنید.

آیا باید استفاده از هوش مصنوعی در تولید گزارش را کنار گذاشت؟

لازم نیست. مشکل خود ابزار نیست، حذف لایه‌ی بازبینی انسانی است. با افشای شفاف نقش ابزار، راستی‌آزمایی اجباری اعداد و تعیین یک مسئول مشخص برای صحت محتوا، بیشتر این ریسک از بین می‌رود.

جمع‌بندی. پرونده‌ی گزارش‌های توهم‌زده‌ی شرکت‌های بزرگ حسابرسی نشان داد که اعتبار برند، جایگزین راستی‌آزمایی نمی‌شود. تا وقتی فرایند بازبینی انسانی جای خودش را در تولید محتوای تخصصی پیدا نکند، این خطاها تکرار خواهند شد. برای دنبال‌کردن این پرونده و داغ‌ترین اخبار هوش مصنوعی به @MrChatGPT_IR سر بزنید.
— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *