پژوهشی تازه از شرکت Mercor نشان میدهد مدلهای زبانی پیشرفته، از جمله Claude Opus 5، در وظایف واقعی حسابداری سریعتر، دقیقتر و بسیار ارزانتر از حسابداران مجاز عمل میکنند؛ نتیجهای که میتواند آیندهی شغل حسابداری را دگرگون کند.

لیست مطالب
۱. چرا این خبر در میان صدها خبر هوش مصنوعی مهم است؟
هر هفته دهها مدل و ویژگی تازه از آزمایشگاههای هوش مصنوعی معرفی میشود، اما بیشتر آنها در آزمونهای انتزاعی و دانشگاهی سنجیده میشوند، نه در کار واقعی روزمره. تازگی این پژوهش دقیقاً همینجاست: بهجای مقایسهی نمرهی آزمونهای استاندارد، پژوهشگران مدلها را مستقیماً در کنار انسانهای حرفهای، روی وظایفی که هر روز در شرکتهای واقعی تکرار میشود، قرار دادند. برای آشنایی بیشتر با روند کلی اینگونه مقایسهها، میتوانید سری اخبار روز هوش مصنوعی در سایت ما را هم دنبال کنید.
۲. مرکور کیست و APEX-Accounting چه آزمونی است؟
شرکت Mercor یکی از شناختهشدهترین پلتفرمهای ارزیابی مهارت نیروی انسانی در دنیای فناوری است که در سالهای اخیر به سمت ساخت بنچمارکهای تخصصی برای سنجش مدلهای هوش مصنوعی هم رفته است. یکی از مجموعهآزمونهای این شرکت با نام APEX-Accounting بهطور خاص برای سنجش توانایی مدلها در وظایف مالی و حسابداری طراحی شده، درست در کنار مجموعهی دیگری به نام APEX-Agents که توانایی عاملیت و انجام کارهای چندمرحلهای را میسنجد.
نسخهی تازهی این پژوهش، برای نخستین بار، بهجای تکیهی صرف بر امتیاز خام مدلها، یک گروه واقعی از حسابداران دارای مجوز رسمی را هم وارد میدان کرد تا «خط پایهی انسانی» دقیقی برای مقایسه بهدست آید؛ رویکردی که نتایج آن را بسیار قابلاعتمادتر از مقایسههای معمول میکند.
۳. طراحی آزمون: دقیقاً چه کاری از حسابداران خواسته شد؟
در این پژوهش، ۱۲ حسابدار دارای مجوز رسمی با میانگین ۵.۵ سال تجربهی کاری انتخاب شدند. از آنها خواسته شد چهار سناریوی واقعی و پرتکرار در حسابداری شرکتی را انجام دهند: فرایندهایی شبیه به بستن حسابهای پایان ماه، که در آن باید دادههای لازم در میان فایلهای شرکت پیدا شود، محاسبات مالی بهدرستی انجام شود و در نهایت نتیجه در قالب جدولهای استاندارد تحویل داده شود. دقیقاً همین سناریوها، بدون هیچ تغییری، در اختیار مدلهای هوش مصنوعی هم قرار گرفت تا مقایسه کاملاً عادلانه باشد.
مدلهایی که در این دور از آزمون شرکت داشتند شامل Claude Opus 5 از Anthropic، GPT-5 و o3 از OpenAI، GPT-4o بهعنوان یک مدل قدیمیتر برای مقایسهی روند پیشرفت، و Qwen3.5-122B بهعنوان یک مدل متنباز و کمهزینهتر بودند. برای آشنایی با پیشینهی شرکت OpenAI و مدلهایش، مقالهی OpenAI چیست و چگونه شکل گرفت در سایت ما میتواند مفید باشد.

۴. نتایج دقت: صد درصد در برابر میانگین سیوهفت درصد
نتیجهی اصلی این پژوهش برای بسیاری غیرمنتظره بود. در هر ۲۰ تلاش ثبتشده، مدلهای پیشرفتهی هوش مصنوعی دقت صد درصد گرفتند؛ یعنی در هیچکدام از موارد، خطایی در محاسبات یا دادههای نهایی باقی نماند. در مقابل، عملکرد حسابداران انسانی نوسان زیادی داشت: برخی نزدیک به نود درصد دقت گرفتند، اما برخی دیگر در همان وظیفه کاملاً ناموفق بودند و میانگین کلی گروه انسانی تنها نزدیک به ۳۷ درصد بود.
این فاصله نشان میدهد مشکل اصلی حسابداران انسانی در این آزمون، نه کمبود دانش، بلکه خطاهای ناشی از خستگی، عجله و حجم بالای جزئیات بوده؛ دقیقاً همان نوع خطایی که مدلهای زبانی، بهخاطر ثبات بالا در پردازش دادههای حجیم، کمتر دچارش میشوند.
۵. رقابت سرعت: چند دقیقه در برابر چند ساعت
فاصلهی زمانی هم به همان اندازه چشمگیر بود. Claude Opus 5 هر یک از این سناریوهای حسابداری را در کمتر از ۱۰ دقیقه به پایان میرساند، در حالی که حسابداران انسانی برای همان وظیفه بین ۳۰ تا ۱۸۰ دقیقه وقت صرف میکردند. به زبان ساده، سریعترین حسابدار انسانی در این آزمون هم حدود سه برابر کندتر از هوش مصنوعی عمل کرده است، و این فاصله برای کندترین نفرها به نزدیک هجده برابر میرسد.
۶. تحلیل هزینه: چرا هوش مصنوعی اینقدر ارزانتر تمام میشود؟
شاید مهمترین رقم این پژوهش، نه دقت و نه سرعت، بلکه هزینه باشد. پژوهشگران هزینهی انجام هر معیار ارزیابی را محاسبه کردند: برای هوش مصنوعی، این رقم تنها حدود ۰.۲۱ دلار بود، در برابر ۱۰.۳۵ دلار برای نیروی انسانی. این یعنی فاصلهای نزدیک به پنجاه برابر، رقمی که نویسندگان پژوهش آن را «بیش از یک مرتبهی بزرگی» توصیف کردهاند. برای شرکتهایی که حجم بالایی از اینگونه وظایف تکراری مالی را هر ماه انجام میدهند، چنین فاصلهی هزینهای میتواند بهمعنای صرفهجوییهای میلیونی در سال باشد.
برای درک بهتر اینکه چرا هوش مصنوعی در کسبوکارها اینقدر پراهمیت شده، پیشنهاد میکنیم مقالهی چرا هوش مصنوعی برای کسبوکارها اهمیت دارد را هم بخوانید.
۶.۱. مقایسهی سریع در یک نگاه
اگر بخواهیم نتایج را خلاصه کنیم: دقت هوش مصنوعی صد درصد در برابر میانگین ۳۷ درصدی انسان، سرعت زیر ۱۰ دقیقه در برابر ۳۰ تا ۱۸۰ دقیقه، و هزینهی ۰.۲۱ دلار در برابر ۱۰.۳۵ دلار برای هر معیار. سه رقمی که در کنار هم، تصویر روشنی از فاصلهی عملکرد در این نوع وظایف مشخص و تکراری ترسیم میکنند.

۷. کلود اوپوس ۵.۵ و صعود در رتبهبندی APEX
همزمان با انتشار این پژوهش، شرکت Anthropic نسخهی بهروزشدهی Claude Opus 5.5 را هم معرفی کرد که طبق تازهترین رتبهبندیهای همین مجموعهی APEX، در هر دو بخش APEX-Agents و APEX-Accounting به رتبهی نخست رسیده و نسبت به بهترین مدل رقیب قبلی خود چند واحد درصد پیشرفت نشان داده است. این موضوع نشان میدهد رقابت اصلی آزمایشگاههای هوش مصنوعی دیگر فقط روی چتباتهای عمومی نیست، بلکه به سمت وظایف تخصصی، عاملیتمحور و کاربردی در دنیای واقعی کسبوکار حرکت کرده است.
برای مقایسهی کلیتر میان مدلهای مختلف هوش مصنوعی و اینکه هر کدام در چه زمینهای قویتر عمل میکنند، میتوانید مطلب مقایسهی چتجیپیتی و دیپسیک را هم در سایت ما بخوانید.
۸. آیا حسابداران واقعاً جای خود را از دست میدهند؟
با وجود همهی این ارقام چشمگیر، نویسندگان پژوهش بهصراحت هشدار میدهند که نباید نتیجهگیری زودهنگام کرد. این آزمون فقط بخش محدودی از مهارتهای واقعی یک حسابدار حرفهای را سنجیده است: وظایفی با تعریف نسبتاً مشخص و قابل اندازهگیری. اما بخش بزرگی از شغل حسابداری شامل مهارتهایی است که در این آزمون سنجیده نشده، مثل ارتباط مؤثر با مشتری، قضاوت حرفهای در شرایط مبهم و پرابهام، مسئولیت قانونی در برابر اشتباهات، و توانایی مذاکره و توضیح تصمیمهای مالی برای مدیران.
برای درک دقیقتر مرز میان توانایی واقعی هوش مصنوعی و محدودیتهای آن، مقالهی پتانسیل واقعی و محدودیتهای هوش مصنوعی در سایت ما تحلیل مفصلی از این موضوع ارائه میدهد. همچنین مطلب توهم هوش مصنوعی در برابر مهارت واقعی نشان میدهد چرا نتیجهی خوب در یک آزمون محدود، بهمعنای جایگزینی کامل یک متخصص انسانی نیست.
۹. چه معنایی برای کسبوکارهای ایرانی دارد؟
برای شرکتهای کوچک و متوسط ایرانی که هزینهی نیروی حسابداری بخش مهمی از هزینههای ثابت ماهانه است، این پژوهش یک پیام روشن دارد: وظایف تکراری، قاعدهمند و قابل تعریف دقیق، بهترین کاندید برای واگذاری به ابزارهای هوش مصنوعی هستند. منظور جایگزینی کامل حسابدار نیست، بلکه استفاده از هوش مصنوعی بهعنوان دستیار برای کارهایی مثل آمادهسازی گزارشهای اولیه، مغایرتگیری حسابها یا استخراج داده از فایلهای پراکنده است، در حالی که تصمیمهای نهایی و حساس همچنان با حسابدار انسانی باقی میماند.
اگر میخواهید خودتان چنین کارهایی را با ابزارهای هوش مصنوعی امتحان کنید، آموزش نحوهی کار با چتجیپیتی در سایت ما نقطهی شروع خوبی است؛ و برای نوشتن دستورهای دقیقتر برای اینگونه وظایف مالی، مقالهی آموزش نوشتن پرامپت برای تازهکارها هم کاربردی خواهد بود.
۹.۱. مقایسه با سایر مدلها در همین آزمون
یکی از نکات جالب این پژوهش، تفاوت نسبی میان مدلهای شرکتکننده است. اگرچه گزارش نهایی تمرکز اصلی را روی دقت صد درصدی مدلهای پیشرو گذاشته، اما نسخهی قدیمیتر GPT-4o و مدل متنباز Qwen3.5-122B بهعنوان نقطهی مرجع برای سنجش روند پیشرفت در طول زمان استفاده شدند. این نشان میدهد شکاف میان مدلهای رایگان یا ارزان و مدلهای پیشرفته و گرانقیمت، در وظایف تخصصی مثل حسابداری، همچنان محسوس است؛ نکتهای که برای کسبوکارهایی که میخواهند هزینه و کیفیت را همزمان مدیریت کنند، اهمیت زیادی دارد.
سوالات متداول
آیا هوش مصنوعی بهطور کامل جای حسابداران را میگیرد؟
بر اساس همین پژوهش، نه؛ هوش مصنوعی در وظایف مشخص و قابل تعریف دقیق بسیار قوی عمل کرده، اما مهارتهایی مثل قضاوت حرفهای، ارتباط با مشتری و مسئولیت قانونی هنوز در حوزهی تخصص انسان باقی میمانند.
چرا دقت هوش مصنوعی در این آزمون صد درصد بود؟
وظایف این آزمون قاعدهمند و دارای معیارهای مشخص بودند، دقیقاً نوع کاری که مدلهای زبانی در پردازش حجم بالای داده و محاسبات تکراری، با ثبات بیشتری نسبت به انسان عمل میکنند.
کدام مدل هوش مصنوعی در این پژوهش بهترین عملکرد را داشت؟
مدل Claude Opus 5 بهعنوان یکی از سریعترین و دقیقترین مدلها در این آزمون شناخته شد و همزمان نسخهی بهروزشدهی آن، Claude Opus 5.5، در رتبهبندیهای تخصصی APEX به رتبهی نخست رسیده است.
آیا این یافتهها برای همهی شرکتها قابل تعمیم است؟
نه کاملاً؛ نتایج به نوع وظیفه، کیفیت دادههای ورودی و سطح پیچیدگی کار بستگی دارد. وظایف ساده و تکراری بهترین نتیجه را از هوش مصنوعی میگیرند، اما کارهای پیچیده و مبهم همچنان به نظارت انسانی نیاز دارند.
