قطعی ۷ ساعته سرویس کلود آنتروپیک در اوت ۲۰۲۶

قطعی ۷ساعته کلود؛ ۱۶۴مین اختلال آنتروپیک در سال ۲۰۲۶

اخبار · هوش مصنوعی

کلود برای ۷ ساعت و ۲۹ دقیقه از دسترس خارج شد و چهار مدل اصلی آنتروپیک را با خود پایین کشید. این قطعی، طبق شمارش گزارش‌ها، صدوشصت‌وچهارمین اختلال ثبت‌شده‌ی این شرکت در سال ۲۰۲۶ است. نکته‌ی تلخ ماجرا زمان‌بندی آن بود: تنها یک روز پس از رونمایی از قرارداد ۳۶ میلیارد دلاری تازه برای خرید تراشه. پولی که قرار بود همین مشکل را حل کند، هنوز به سرور تبدیل نشده است.

چکیده. روز ۵ اوت ۲۰۲۶ سرویس‌های claude.ai، کلود کد و API آنتروپیک از ساعت ۳:۰۵ تا ۱۰:۳۴ به وقت شرق آمریکا دچار خطای گسترده شدند. مدل‌های Mythos 5، Fable 5، Opus 5 و Sonnet 5 هر چهار مدل از کار افتادند. میانگین آپ‌تایم ۹۰ روزه‌ی این سرویس‌ها حدود ۹۹.۳ تا ۹۹.۴ درصد است؛ رقمی که یعنی هر فصل بین ۱۴ تا ۲۳ ساعت قطعی. در همین حال آنتروپیک ظرف ۶۰ روز ۷۱ میلیارد دلار تعهد مالی برای تراشه جمع کرده، اما شکاف میان تقاضا و ظرفیت همچنان باز است.
قطعی ۷ ساعته سرویس کلود آنتروپیک در اوت ۲۰۲۶

۱) روایت دقیق آن ۷ ساعت و ۲۹ دقیقه

ماجرا از بامداد چهارشنبه ۵ اوت ۲۰۲۶ شروع شد. حوالی ساعت ۳:۰۵ بامداد به وقت شرق آمریکا، کاربران در سراسر جهان با خطاهای پیاپی روبه‌رو شدند؛ درخواست‌ها یا اصلاً پاسخ نمی‌گرفتند یا با تأخیرهای طولانی و پیام خطا برمی‌گشتند. صفحه‌ی وضعیت رسمی آنتروپیک ابتدا با جمله‌ی کوتاه «چند مدل کلود دچار مشکل شده‌اند» ماجرا را تأیید کرد و سپس اعلام شد که تیم فنی «علت خطاهای افزایش‌یافته را شناسایی کرده» و «در حال کار روی راه‌حل» است.

نخستین اصلاحیه حدود ساعت ۹:۰۸ صبح منتشر شد و بخشی از ترافیک به حالت عادی برگشت. اما ماجرا همان‌جا تمام نشد: حوالی ساعت ۹:۵۱، یک افت کیفیت جداگانه روی مدل Opus 5 گزارش شد که عملاً موج دوم اختلال را ساخت. بازگشت کامل سرویس تا ساعت ۱۰:۳۴ صبح طول کشید. جمع کل زمان قطعی، ۷ ساعت و ۲۹ دقیقه ثبت شد؛ طولانی‌ترین قطعی کلود در سال جاری میلادی و تقریباً یک‌ونیم برابر قطعی ۵ ساعت و ۴۴ دقیقه‌ای دوم ژوئن.

آنتروپیک تا لحظه‌ی نگارش این گزارش، ریشه‌ی فنی دقیق حادثه را عمومی نکرده است. الگوی شرکت در ماه‌های اخیر همین بوده: اعلام سریع وضعیت، انتشار اصلاحیه، و سکوت درباره‌ی تحلیل ریشه‌ای. برای کاربر عادی این سکوت شاید مهم نباشد، اما برای تیم‌هایی که محصولشان روی API کلود سوار است، نبودِ گزارش پس از حادثه یعنی نمی‌توانند بدانند دفعه‌ی بعد چه زمانی باید منتظر تکرار باشند.

۲) کدام مدل‌ها و کدام سرویس‌ها زمین خوردند

گستره‌ی این قطعی چیزی بود که آن را از اختلال‌های معمولی جدا می‌کرد. معمولاً یک مدل یا یک درگاه دچار مشکل می‌شود؛ این‌بار هر چهار مدل پرچم‌دار یعنی Mythos 5، Fable 5، Opus 5 و Sonnet 5 هم‌زمان از کار افتادند. یعنی راهکار همیشگی «موقتاً روی مدل ارزان‌تر سوییچ کن» هم جواب نمی‌داد.

سه کانال دسترسی هم هم‌زمان آسیب دیدند: وب‌اپلیکیشن claude.ai برای کاربران عادی، ابزار خط فرمان کلود کد برای برنامه‌نویس‌ها، و API که ستون فقرات محصولات شرکت‌های ثالث است. وقتی هر سه با هم پایین می‌آیند، تصویر روشن است: مشکل در لایه‌ی مدل و ظرفیت محاسباتی بوده، نه در یک سرویس جانبی. برای درک بهتر اینکه این لایه‌ها چطور به هم وصل‌اند، مرور توانایی‌ها و محدودیت‌های واقعی هوش مصنوعی کمک می‌کند.

پیامد عملی برای توسعه‌دهنده‌ها سنگین بود. تیم‌هایی که کلود کد را در خط لوله‌ی توسعه و بازبینی کد خود گذاشته‌اند، عملاً یک نوبت کاری کامل را از دست دادند. سرویس‌های چت پشتیبانی که پشت‌صحنه‌شان کلود است، در ساعات اوج کاری اروپا با پیام خطا مواجه شدند.

۳) عدد ۱۶۴ چه می‌گوید؟ یک اختلال در هر ۱.۳ روز

شمارش گزارش‌ها می‌گوید تا ۵ اوت ۲۰۲۶، آنتروپیک ۱۶۴ رخداد ثبت‌شده در صفحه‌ی وضعیت خود داشته است. اگر این عدد را بر تعداد روزهای سپری‌شده از سال تقسیم کنیم، به میانگین تقریبی یک رخداد در هر ۱.۳ روز می‌رسیم. مهم است بدانیم همه‌ی این ۱۶۴ مورد قطعی کامل نیستند؛ بخش بزرگی از آن‌ها افت کیفیت، کندی، یا اختلال جزئی در یک منطقه‌ی جغرافیایی است.

اما همین توضیح هم چیزی را عوض نمی‌کند: نرخ ثبت رخداد برای سرویسی که ادعای زیرساخت سازمانی دارد بالاست. مقایسه با خود شرکت هم گویاست؛ قطعی دوم ژوئن ۵ ساعت و ۴۴ دقیقه بود و حالا در فاصله‌ی کمتر از دو ماه، رکورد شکسته شده. روند رو به وخامت است، نه رو به بهبود.

نکته‌ی ظریف دیگر شفافیت است. شرکتی که صفحه‌ی وضعیت دقیق‌تری دارد، طبیعتاً رخدادهای بیشتری ثبت می‌کند. بخشی از این عدد ۱۶۴ ممکن است نتیجه‌ی همین صداقت در گزارش‌دهی باشد، در حالی که رقبا اختلال‌های کوچک را اصلاً ثبت نمی‌کنند. با این حال، قطعی هفت‌ساعته چیزی نیست که بتوان با تفاوت روش گزارش‌دهی توضیحش داد.

آمار ۱۶۴ اختلال ثبت‌شده کلود در سال ۲۰۲۶

۴) آپ‌تایم ۹۹.۴ درصد؛ عددی که خوب به نظر می‌رسد و نیست

میانگین ۹۰ روزه‌ی در دسترس بودن سرویس‌های آنتروپیک بر اساس داده‌های منتشرشده چنین است: claude.ai حدود ۹۹.۳۶ درصد، API کلود حدود ۹۹.۴۲ درصد و کلود کد حدود ۹۹.۳۴ درصد. در نگاه اول هر سه عدد عالی به نظر می‌رسند؛ چه کسی از ۹۹ درصد ناراضی می‌شود؟

حساب ساده اما تصویر دیگری می‌سازد. یک فصل تقریباً ۲۱۹۰ ساعت است. آپ‌تایم ۹۹.۴ درصد یعنی حدود ۱۳ ساعت قطعی در فصل، و آپ‌تایم ۹۹.۳۴ درصد یعنی نزدیک ۲۳ ساعت. یعنی هر سه ماه، بین نیم روز تا یک روز کاری کامل سرویس در دسترس نیست. استاندارد رایج سازمانی یعنی ۹۹.۹ درصد، سقف قطعی فصلی را حدود ۲ ساعت تعیین می‌کند. فاصله‌ی میان این دو عدد، فاصله‌ی میان «ابزار جانبی» و «زیرساخت قابل اتکا» است.

ریاضیات نُه‌ها به زبان ساده

هر نُهِ اضافه در آپ‌تایم، زمان قطعی را ده برابر کم می‌کند اما هزینه‌ی مهندسی را چند برابر بالا می‌برد. رفتن از ۹۹ به ۹۹.۹ نیازمند افزونگی در سطح منطقه است؛ رفتن از ۹۹.۹ به ۹۹.۹۹ نیازمند افزونگی در سطح قاره و خودکارسازی کامل بازیابی. آنتروپیک هنوز روی پله‌ی اول ایستاده، در حالی که مشتریانش انتظار پله‌ی سوم را دارند.

۵) پول هست، ظرفیت نیست: ۷۱ میلیارد دلار در ۶۰ روز

طنز تلخ ماجرا در فاصله‌ی زمانی است. تنها یک روز پیش از این قطعی، خبر رسید که بلک‌استون و آپولو در حال جمع‌آوری دست‌کم ۳۶ میلیارد دلار بدهی برای تأمین مالی خرید تراشه‌های اختصاصی گوگل برای آنتروپیک هستند. این دومین معامله‌ی بزرگ در ۶۰ روز گذشته بود؛ معامله‌ی اول حدود ۳۵ میلیارد دلار ارزش داشت. جمع دو رقم می‌شود ۷۱ میلیارد دلار تعهد مالی برای محاسبات، فقط در دو ماه.

اما میان امضای قرارداد و روشن شدن سرور، یک فاصله‌ی فیزیکی وجود دارد که با پول پر نمی‌شود. تراشه باید تولید شود، مرکز داده باید ساخته یا اجاره شود، برق و خنک‌کننده باید تأمین شود، شبکه باید سیم‌کشی شود و نرم‌افزار زمان‌بندی باید روی سخت‌افزار جدید تنظیم شود. این چرخه معمولاً ماه‌ها و گاهی بیش از یک سال طول می‌کشد. پس قطعی امروز نتیجه‌ی ظرفیتی است که ۱۸ ماه پیش سفارش داده شده، نه پولی که دیروز جمع شده.

نکته‌ی دوم ساختار تأمین مالی است. این‌ها سرمایه‌گذاری سهامی نیستند، بدهی‌اند. یعنی آنتروپیک باید بازپرداخت کند و برای بازپرداخت باید درآمد بسازد و برای درآمد بیشتر باید ظرفیت بیشتری بفروشد. اگر ظرفیت به موقع نرسد، شرکت در وضعیتی گیر می‌کند که هم بدهی دارد و هم نمی‌تواند تقاضای موجود را جواب دهد. برای درک بهتر اقتصاد این صنعت، خواندن اهمیت هوش مصنوعی در کسب‌وکار زمینه‌ی خوبی می‌دهد.

۶) جهش درآمد از ۹ به ۴۷ میلیارد دلار و فشاری که می‌سازد

درآمد سالانه‌شده‌ی آنتروپیک در پایان سال ۲۰۲۵ حدود ۹ میلیارد دلار برآورد می‌شد. تا میانه‌ی ماه مه ۲۰۲۶ این رقم به حدود ۴۷ میلیارد دلار رسیده است. رشد بیش از پنج برابری در حدود پنج ماه، در تاریخ نرم‌افزار سازمانی تقریباً بی‌سابقه است.

مشکل اینجاست که تقاضای محاسباتی خطی رشد نمی‌کند. هر مشتری سازمانی جدید نه فقط توکن بیشتر مصرف می‌کند، بلکه معمولاً پنجره‌ی متن بلندتر، عامل‌های خودکار طولانی‌مدت و فراخوانی‌های پیاپی ابزار می‌خواهد؛ همه‌ی این‌ها بار محاسباتی را چند برابر می‌کنند. مدیران آنتروپیک خودشان در گفت‌وگویی در آوریل ۲۰۲۶ اعتراف کرده بودند که تقاضا برای کلود «با سرعتی بی‌سابقه رشد کرده و زیرساخت ما برای پاسخ‌گویی به آن کشیده شده است».

وقتی زیرساخت در حالت اشباع کار می‌کند، حاشیه‌ی امنیت از بین می‌رود. در سیستم سالم، خرابی یک خوشه با هدایت ترافیک به خوشه‌ی دیگر جبران می‌شود. در سیستم اشباع، همان خرابی کوچک آبشاری از خطا می‌سازد؛ دقیقاً همان چیزی که الگوی قطعی‌های اخیر کلود را توضیح می‌دهد. برای پیگیری روزانه‌ی این روندها می‌توانید بخش اخبار هوش مصنوعی را دنبال کنید.

قرارداد ۷۱ میلیارد دلاری آنتروپیک برای خرید تراشه

۷) قراردادهای سطح خدمت؛ کاربر عادی چه تضمینی دارد

پرسش منطقی این است که آیا کسی بابت این هفت ساعت غرامت می‌گیرد. پاسخ کوتاه برای اکثریت کاربران منفی است. سطح استاندارد API آنتروپیک هیچ تضمین آپ‌تایمی ندارد و بر پایه‌ی «بهترین تلاش» ارائه می‌شود. سطح موسوم به Priority Tier هدف ۹۹.۵ درصد را تعریف می‌کند و قراردادهای سازمانی موردی مذاکره می‌شوند و معمولاً حوالی ۹۹.۹۹ درصد تنظیم می‌شوند.

حتی در همان قراردادهای سازمانی هم جبران خسارت به شکل اعتبار سرویس است، نه پول نقد؛ و معمولاً سقف آن بین ۵ تا ۱۰ درصد هزینه‌ی ماهانه است. یعنی اگر کسب‌وکاری به خاطر هفت ساعت قطعی، یک روز فروش را از دست بدهد، حداکثر چند درصد از صورت‌حساب همان ماه را پس می‌گیرد. این عدم‌تقارن، دقیقاً دلیلی است که تیم‌های حرفه‌ای دیگر روی یک ارائه‌دهنده‌ی واحد حساب باز نمی‌کنند.

۸) اشتباه رایج تیم‌ها: تک‌ارائه‌دهنده بودن

درس عملی این حادثه ساده است. هر معماری که تنها یک مدل و یک ارائه‌دهنده دارد، آپ‌تایم آن ارائه‌دهنده را به ارث می‌برد. اگر محصول شما روی API کلود سوار است، آپ‌تایم شما نمی‌تواند از ۹۹.۴ درصد بهتر باشد، هرچقدر هم کد خودتان بی‌نقص باشد.

راهکارهای عملی چند لایه دارد. لایه‌ی اول، تعریف مدل جایگزین در همان درخواست است تا در صورت خطا ترافیک به‌طور خودکار به ارائه‌دهنده‌ی دیگر برود. لایه‌ی دوم، صف‌بندی درخواست‌های غیرفوری است تا کار به‌جای شکست خوردن، عقب بیفتد. لایه‌ی سوم، حافظه‌ی نهان برای پاسخ‌های پرتکرار است. لایه‌ی چهارم، طراحی رابط کاربری برای حالت خرابی است؛ یعنی به کاربر پیام روشن بدهید به‌جای چرخ در حال چرخش. مقایسه‌ی دقیق مدل‌های رقیب هم نقطه‌ی شروع خوبی برای انتخاب مدل پشتیبان است.

نکته‌ی آخر اینکه اتکای بیش از حد به تولید خودکار کد هم ریسک خودش را دارد؛ بحثی که در توهم برنامه‌نویس تنها در برابر مهندس واقعی مفصل بررسی شده است.

۹) چشم‌انداز؛ آیا وضعیت بهتر می‌شود

سه سناریو پیش روی آنتروپیک است. سناریوی خوش‌بینانه این است که ظرفیت تراشه‌های خریداری‌شده از نیمه‌ی دوم ۲۰۲۶ به مدار بیاید و نرخ رخداد به‌تدریج پایین بیاید. سناریوی میانه این است که ظرفیت جدید صرفاً پابه‌پای رشد تقاضا اضافه شود و وضعیت در همین سطح ۹۹.۴ درصد تثبیت بماند.

سناریوی بدبینانه این است که رشد تقاضا از سرعت اضافه شدن ظرفیت جلو بزند و قطعی‌های طولانی به بخشی از عادت روزمره تبدیل شود. در این حالت، فشار رقابتی جدی می‌شود؛ چون مشتری سازمانی که دو بار در یک فصل خط تولیدش خوابیده، سراغ ارائه‌دهنده‌ی دوم می‌رود، حتی اگر کیفیت مدلش کمی پایین‌تر باشد.

آنچه در کوتاه‌مدت می‌تواند اعتماد را برگرداند لزوماً سخت‌افزار نیست، بلکه شفافیت است: انتشار گزارش ریشه‌ای پس از هر حادثه‌ی بزرگ، اعلام صریح ظرفیت باقی‌مانده، و بازتعریف تعهدات سطح خدمت. تا آن زمان، عاقلانه‌ترین کار برای کاربر و توسعه‌دهنده‌ی ایرانی این است که همیشه یک نقشه‌ی دوم داشته باشد. آموزش‌های کاربردی در بخش آموزش چت‌جی‌پی‌تی و راهنمای آشنایی با اوپن‌ای‌آی برای ساختن این نقشه‌ی دوم مفیدند.

پرسش‌های پرتکرار درباره‌ی قطعی کلود

قطعی اخیر کلود دقیقاً چقدر طول کشید؟

مدت این قطعی ۷ ساعت و ۲۹ دقیقه بود؛ از ساعت ۳:۰۵ بامداد تا ۱۰:۳۴ صبح ۵ اوت ۲۰۲۶ به وقت شرق آمریکا. نخستین اصلاحیه ساعت ۹:۰۸ منتشر شد، اما افت کیفیت جداگانه‌ی Opus 5 بازگشت کامل را تا ۱۰:۳۴ عقب انداخت.

کدام مدل‌ها و سرویس‌ها از دسترس خارج شدند؟

هر چهار مدل اصلی یعنی Mythos 5، Fable 5، Opus 5 و Sonnet 5 تحت تأثیر قرار گرفتند و سه کانال claude.ai، کلود کد و API هم‌زمان دچار خطا شدند.

آیا واقعاً ۱۶۴ بار در سال ۲۰۲۶ قطعی رخ داده است؟

عدد ۱۶۴ به تعداد رخدادهای ثبت‌شده در صفحه‌ی وضعیت رسمی تا ۵ اوت اشاره دارد، نه ۱۶۴ قطعی کامل. بخش قابل‌توجهی از این موارد افت کیفیت، کندی یا اختلال منطقه‌ای بوده‌اند، اما میانگین یک رخداد در هر ۱.۳ روز همچنان بالاست.

آیا آنتروپیک بابت قطعی غرامت می‌دهد؟

سطح استاندارد API هیچ تضمین آپ‌تایمی ندارد. سطح Priority هدف ۹۹.۵ درصد را دنبال می‌کند و قراردادهای سازمانی جداگانه مذاکره می‌شوند؛ جبران معمولاً به شکل اعتبار سرویس با سقف ۵ تا ۱۰ درصد هزینه‌ی ماهانه است، نه بازگشت وجه.

چطور کسب‌وکارم را در برابر قطعی کلود مقاوم کنم؟

ساده‌ترین راه، تعریف یک مدل جایگزین از ارائه‌دهنده‌ی دیگر، صف‌بندی درخواست‌های غیرفوری، استفاده از حافظه‌ی نهان برای پاسخ‌های تکراری، و طراحی پیام خطای روشن برای کاربر است تا خرابی سرویس به توقف کامل کسب‌وکار تبدیل نشود.

جمع‌بندی. قطعی هفت‌ساعته‌ی کلود نشان داد که پول و ظرفیت دو چیز متفاوت‌اند؛ ۷۱ میلیارد دلار قرارداد تراشه هنوز به سرور روشن تبدیل نشده و شکاف میان رشد انفجاری تقاضا و زیرساخت موجود همچنان باز است. تا زمانی که این شکاف بسته نشود، داشتن نقشه‌ی دوم برای هر تیمی که روی کلود حساب باز کرده ضروری است. برای دنبال کردن لحظه‌ای اخبار هوش مصنوعی به ما بپیوندید: @MrChatGPT_IR
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *