پژوهش مرکور: هوش مصنوعی کلود در وظایف حسابداری از حسابداران مجاز جلو زد

هوش مصنوعی · حسابداری و اقتصاد

پژوهشی تازه از شرکت Mercor نشان می‌دهد مدل‌های زبانی پیشرفته، از جمله Claude Opus 5، در وظایف واقعی حسابداری سریع‌تر، دقیق‌تر و بسیار ارزان‌تر از حسابداران مجاز عمل می‌کنند؛ نتیجه‌ای که می‌تواند آینده‌ی شغل حسابداری را دگرگون کند.

چکیده. در آزمونی تازه، ۱۲ حسابدار رسمی در برابر چند مدل هوش مصنوعی از جمله Claude Opus 5 قرار گرفتند تا سناریوهای واقعی بستن حساب‌های پایان ماه را انجام دهند. هوش مصنوعی در تمام تلاش‌ها دقت صد درصد گرفت، کار را چند برابر سریع‌تر تمام کرد و هزینه‌ای نزدیک به پنجاه برابر کمتر داشت؛ اما نویسندگان پژوهش هشدار می‌دهند این یعنی پایان شغل حسابداری نیست.

نمودار نتایج پژوهش مرکور درباره دقت مدل کلود اوپوس ۵ در وظایف حسابداری در مقابل حسابداران مجاز

۱. چرا این خبر در میان صدها خبر هوش مصنوعی مهم است؟

هر هفته ده‌ها مدل و ویژگی تازه از آزمایشگاه‌های هوش مصنوعی معرفی می‌شود، اما بیشتر آن‌ها در آزمون‌های انتزاعی و دانشگاهی سنجیده می‌شوند، نه در کار واقعی روزمره. تازگی این پژوهش دقیقاً همین‌جاست: به‌جای مقایسه‌ی نمره‌ی آزمون‌های استاندارد، پژوهشگران مدل‌ها را مستقیماً در کنار انسان‌های حرفه‌ای، روی وظایفی که هر روز در شرکت‌های واقعی تکرار می‌شود، قرار دادند. برای آشنایی بیشتر با روند کلی این‌گونه مقایسه‌ها، می‌توانید سری اخبار روز هوش مصنوعی در سایت ما را هم دنبال کنید.

۲. مرکور کیست و APEX-Accounting چه آزمونی است؟

شرکت Mercor یکی از شناخته‌شده‌ترین پلتفرم‌های ارزیابی مهارت نیروی انسانی در دنیای فناوری است که در سال‌های اخیر به سمت ساخت بنچمارک‌های تخصصی برای سنجش مدل‌های هوش مصنوعی هم رفته است. یکی از مجموعه‌آزمون‌های این شرکت با نام APEX-Accounting به‌طور خاص برای سنجش توانایی مدل‌ها در وظایف مالی و حسابداری طراحی شده، درست در کنار مجموعه‌ی دیگری به نام APEX-Agents که توانایی عاملیت و انجام کارهای چندمرحله‌ای را می‌سنجد.

نسخه‌ی تازه‌ی این پژوهش، برای نخستین بار، به‌جای تکیه‌ی صرف بر امتیاز خام مدل‌ها، یک گروه واقعی از حسابداران دارای مجوز رسمی را هم وارد میدان کرد تا «خط پایه‌ی انسانی» دقیقی برای مقایسه به‌دست آید؛ رویکردی که نتایج آن را بسیار قابل‌اعتمادتر از مقایسه‌های معمول می‌کند.

۳. طراحی آزمون: دقیقاً چه کاری از حسابداران خواسته شد؟

در این پژوهش، ۱۲ حسابدار دارای مجوز رسمی با میانگین ۵.۵ سال تجربه‌ی کاری انتخاب شدند. از آن‌ها خواسته شد چهار سناریوی واقعی و پرتکرار در حسابداری شرکتی را انجام دهند: فرایندهایی شبیه به بستن حساب‌های پایان ماه، که در آن باید داده‌های لازم در میان فایل‌های شرکت پیدا شود، محاسبات مالی به‌درستی انجام شود و در نهایت نتیجه در قالب جدول‌های استاندارد تحویل داده شود. دقیقاً همین سناریوها، بدون هیچ تغییری، در اختیار مدل‌های هوش مصنوعی هم قرار گرفت تا مقایسه کاملاً عادلانه باشد.

مدل‌هایی که در این دور از آزمون شرکت داشتند شامل Claude Opus 5 از Anthropic، GPT-5 و o3 از OpenAI، GPT-4o به‌عنوان یک مدل قدیمی‌تر برای مقایسه‌ی روند پیشرفت، و Qwen3.5-122B به‌عنوان یک مدل متن‌باز و کم‌هزینه‌تر بودند. برای آشنایی با پیشینه‌ی شرکت OpenAI و مدل‌هایش، مقاله‌ی OpenAI چیست و چگونه شکل گرفت در سایت ما می‌تواند مفید باشد.

مقایسه عملکرد مدل‌های کلود اوپوس ۵، جی‌پی‌تی ۵ و اُ۳ در آزمون حسابداری مرکور

۴. نتایج دقت: صد درصد در برابر میانگین سی‌وهفت درصد

نتیجه‌ی اصلی این پژوهش برای بسیاری غیرمنتظره بود. در هر ۲۰ تلاش ثبت‌شده، مدل‌های پیشرفته‌ی هوش مصنوعی دقت صد درصد گرفتند؛ یعنی در هیچ‌کدام از موارد، خطایی در محاسبات یا داده‌های نهایی باقی نماند. در مقابل، عملکرد حسابداران انسانی نوسان زیادی داشت: برخی نزدیک به نود درصد دقت گرفتند، اما برخی دیگر در همان وظیفه کاملاً ناموفق بودند و میانگین کلی گروه انسانی تنها نزدیک به ۳۷ درصد بود.

این فاصله نشان می‌دهد مشکل اصلی حسابداران انسانی در این آزمون، نه کمبود دانش، بلکه خطاهای ناشی از خستگی، عجله و حجم بالای جزئیات بوده؛ دقیقاً همان نوع خطایی که مدل‌های زبانی، به‌خاطر ثبات بالا در پردازش داده‌های حجیم، کمتر دچارش می‌شوند.

۵. رقابت سرعت: چند دقیقه در برابر چند ساعت

فاصله‌ی زمانی هم به همان اندازه چشمگیر بود. Claude Opus 5 هر یک از این سناریوهای حسابداری را در کمتر از ۱۰ دقیقه به پایان می‌رساند، در حالی که حسابداران انسانی برای همان وظیفه بین ۳۰ تا ۱۸۰ دقیقه وقت صرف می‌کردند. به زبان ساده، سریع‌ترین حسابدار انسانی در این آزمون هم حدود سه برابر کندتر از هوش مصنوعی عمل کرده است، و این فاصله برای کندترین نفرها به نزدیک هجده برابر می‌رسد.

۶. تحلیل هزینه: چرا هوش مصنوعی این‌قدر ارزان‌تر تمام می‌شود؟

شاید مهم‌ترین رقم این پژوهش، نه دقت و نه سرعت، بلکه هزینه باشد. پژوهشگران هزینه‌ی انجام هر معیار ارزیابی را محاسبه کردند: برای هوش مصنوعی، این رقم تنها حدود ۰.۲۱ دلار بود، در برابر ۱۰.۳۵ دلار برای نیروی انسانی. این یعنی فاصله‌ای نزدیک به پنجاه برابر، رقمی که نویسندگان پژوهش آن را «بیش از یک مرتبه‌ی بزرگی» توصیف کرده‌اند. برای شرکت‌هایی که حجم بالایی از این‌گونه وظایف تکراری مالی را هر ماه انجام می‌دهند، چنین فاصله‌ی هزینه‌ای می‌تواند به‌معنای صرفه‌جویی‌های میلیونی در سال باشد.

برای درک بهتر این‌که چرا هوش مصنوعی در کسب‌وکارها این‌قدر پراهمیت شده، پیشنهاد می‌کنیم مقاله‌ی چرا هوش مصنوعی برای کسب‌وکارها اهمیت دارد را هم بخوانید.

۶.۱. مقایسه‌ی سریع در یک نگاه

اگر بخواهیم نتایج را خلاصه کنیم: دقت هوش مصنوعی صد درصد در برابر میانگین ۳۷ درصدی انسان، سرعت زیر ۱۰ دقیقه در برابر ۳۰ تا ۱۸۰ دقیقه، و هزینه‌ی ۰.۲۱ دلار در برابر ۱۰.۳۵ دلار برای هر معیار. سه رقمی که در کنار هم، تصویر روشنی از فاصله‌ی عملکرد در این نوع وظایف مشخص و تکراری ترسیم می‌کنند.

مقایسه هزینه انجام وظایف حسابداری توسط هوش مصنوعی و حسابداران انسانی بر اساس پژوهش مرکور

۷. کلود اوپوس ۵.۵ و صعود در رتبه‌بندی APEX

همزمان با انتشار این پژوهش، شرکت Anthropic نسخه‌ی به‌روزشده‌ی Claude Opus 5.5 را هم معرفی کرد که طبق تازه‌ترین رتبه‌بندی‌های همین مجموعه‌ی APEX، در هر دو بخش APEX-Agents و APEX-Accounting به رتبه‌ی نخست رسیده و نسبت به بهترین مدل رقیب قبلی خود چند واحد درصد پیشرفت نشان داده است. این موضوع نشان می‌دهد رقابت اصلی آزمایشگاه‌های هوش مصنوعی دیگر فقط روی چت‌بات‌های عمومی نیست، بلکه به سمت وظایف تخصصی، عاملیت‌محور و کاربردی در دنیای واقعی کسب‌وکار حرکت کرده است.

برای مقایسه‌ی کلی‌تر میان مدل‌های مختلف هوش مصنوعی و این‌که هر کدام در چه زمینه‌ای قوی‌تر عمل می‌کنند، می‌توانید مطلب مقایسه‌ی چت‌جی‌پی‌تی و دیپ‌سیک را هم در سایت ما بخوانید.

۸. آیا حسابداران واقعاً جای خود را از دست می‌دهند؟

با وجود همه‌ی این ارقام چشمگیر، نویسندگان پژوهش به‌صراحت هشدار می‌دهند که نباید نتیجه‌گیری زودهنگام کرد. این آزمون فقط بخش محدودی از مهارت‌های واقعی یک حسابدار حرفه‌ای را سنجیده است: وظایفی با تعریف نسبتاً مشخص و قابل اندازه‌گیری. اما بخش بزرگی از شغل حسابداری شامل مهارت‌هایی است که در این آزمون سنجیده نشده، مثل ارتباط مؤثر با مشتری، قضاوت حرفه‌ای در شرایط مبهم و پرابهام، مسئولیت قانونی در برابر اشتباهات، و توانایی مذاکره و توضیح تصمیم‌های مالی برای مدیران.

برای درک دقیق‌تر مرز میان توانایی واقعی هوش مصنوعی و محدودیت‌های آن، مقاله‌ی پتانسیل واقعی و محدودیت‌های هوش مصنوعی در سایت ما تحلیل مفصلی از این موضوع ارائه می‌دهد. همچنین مطلب توهم هوش مصنوعی در برابر مهارت واقعی نشان می‌دهد چرا نتیجه‌ی خوب در یک آزمون محدود، به‌معنای جایگزینی کامل یک متخصص انسانی نیست.

۹. چه معنایی برای کسب‌وکارهای ایرانی دارد؟

برای شرکت‌های کوچک و متوسط ایرانی که هزینه‌ی نیروی حسابداری بخش مهمی از هزینه‌های ثابت ماهانه است، این پژوهش یک پیام روشن دارد: وظایف تکراری، قاعده‌مند و قابل تعریف دقیق، بهترین کاندید برای واگذاری به ابزارهای هوش مصنوعی هستند. منظور جایگزینی کامل حسابدار نیست، بلکه استفاده از هوش مصنوعی به‌عنوان دستیار برای کارهایی مثل آماده‌سازی گزارش‌های اولیه، مغایرت‌گیری حساب‌ها یا استخراج داده از فایل‌های پراکنده است، در حالی که تصمیم‌های نهایی و حساس همچنان با حسابدار انسانی باقی می‌ماند.

اگر می‌خواهید خودتان چنین کارهایی را با ابزارهای هوش مصنوعی امتحان کنید، آموزش نحوه‌ی کار با چت‌جی‌پی‌تی در سایت ما نقطه‌ی شروع خوبی است؛ و برای نوشتن دستورهای دقیق‌تر برای این‌گونه وظایف مالی، مقاله‌ی آموزش نوشتن پرامپت برای تازه‌کارها هم کاربردی خواهد بود.

۹.۱. مقایسه با سایر مدل‌ها در همین آزمون

یکی از نکات جالب این پژوهش، تفاوت نسبی میان مدل‌های شرکت‌کننده است. اگرچه گزارش نهایی تمرکز اصلی را روی دقت صد درصدی مدل‌های پیشرو گذاشته، اما نسخه‌ی قدیمی‌تر GPT-4o و مدل متن‌باز Qwen3.5-122B به‌عنوان نقطه‌ی مرجع برای سنجش روند پیشرفت در طول زمان استفاده شدند. این نشان می‌دهد شکاف میان مدل‌های رایگان یا ارزان و مدل‌های پیشرفته و گران‌قیمت، در وظایف تخصصی مثل حسابداری، همچنان محسوس است؛ نکته‌ای که برای کسب‌وکارهایی که می‌خواهند هزینه و کیفیت را هم‌زمان مدیریت کنند، اهمیت زیادی دارد.

سوالات متداول

آیا هوش مصنوعی به‌طور کامل جای حسابداران را می‌گیرد؟

بر اساس همین پژوهش، نه؛ هوش مصنوعی در وظایف مشخص و قابل تعریف دقیق بسیار قوی عمل کرده، اما مهارت‌هایی مثل قضاوت حرفه‌ای، ارتباط با مشتری و مسئولیت قانونی هنوز در حوزه‌ی تخصص انسان باقی می‌مانند.

چرا دقت هوش مصنوعی در این آزمون صد درصد بود؟

وظایف این آزمون قاعده‌مند و دارای معیارهای مشخص بودند، دقیقاً نوع کاری که مدل‌های زبانی در پردازش حجم بالای داده و محاسبات تکراری، با ثبات بیشتری نسبت به انسان عمل می‌کنند.

کدام مدل هوش مصنوعی در این پژوهش بهترین عملکرد را داشت؟

مدل Claude Opus 5 به‌عنوان یکی از سریع‌ترین و دقیق‌ترین مدل‌ها در این آزمون شناخته شد و هم‌زمان نسخه‌ی به‌روزشده‌ی آن، Claude Opus 5.5، در رتبه‌بندی‌های تخصصی APEX به رتبه‌ی نخست رسیده است.

آیا این یافته‌ها برای همه‌ی شرکت‌ها قابل تعمیم است؟

نه کاملاً؛ نتایج به نوع وظیفه، کیفیت داده‌های ورودی و سطح پیچیدگی کار بستگی دارد. وظایف ساده و تکراری بهترین نتیجه را از هوش مصنوعی می‌گیرند، اما کارهای پیچیده و مبهم همچنان به نظارت انسانی نیاز دارند.

جمع‌بندی. پژوهش تازه‌ی Mercor یکی از روشن‌ترین تصویرها تا امروز از فاصله‌ی عملکرد هوش مصنوعی و انسان در وظایف حسابداری تکراری ارائه می‌دهد: دقت بالاتر، سرعت چند برابر و هزینه‌ای نزدیک به پنجاه برابر کمتر. با این حال، جایگزینی کامل حسابداران هنوز دور از واقعیت است. برای دنبال‌کردن ادامه‌ی این‌گونه تحلیل‌ها و مهم‌ترین اخبار روزانه‌ی دنیای هوش مصنوعی، کانال ما، @MrChatGPT_IR، را در تلگرام دنبال کنید.
— (0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *