معرفی مدل فوگو-سایبر ساکانا برای امنیت سایبری

فوگو-سایبر ساکانا؛ مدل ژاپنی که بازار امنیت سایبری را تکان داد

اخبار · هوش مصنوعی

یک آزمایشگاه ژاپنی با معرفی مدلی تخصصی برای امنیت سایبری، رقابت این حوزه را وارد مرحله‌ی تازه‌ای کرد. ساکانا ای‌آی می‌گوید مدل فوگو-سایبر در سخت‌ترین بنچمارک‌های کشف آسیب‌پذیری از رقبای آمریکایی جلو زده است. اما پشت این اعداد، پرسش‌های جدی درباره‌ی روش سنجش و امکان تأیید مستقل باقی مانده است. این گزارش هم ادعاها را مرور می‌کند و هم نقدها را.

چکیده. ساکانا ای‌آی در ۲۱ ژوئیه ۲۰۲۶ مدل فوگو-سایبر را معرفی کرد؛ سامانه‌ای تخصصی برای شناسایی آسیب‌پذیری‌ها که به‌جای یک مدل غول‌پیکر، چند مدل تخصصی را هماهنگ می‌کند. طبق اعداد اعلام‌شده‌ی خود شرکت، این سامانه ۸۶.۹ درصد در بنچمارک CyberGym دانشگاه برکلی و ۷۲.۱ درصد در CTI-REALM مایکروسافت امتیاز گرفته و از GPT-5.5-Cyber و Claude Mythos Preview جلو زده است. دسترسی به آن مشروط به بررسی دستی درخواست و تعهد به کاربرد دفاعی است و در اتحادیه اروپا، بریتانیا و سوئیس عرضه نشده. مهم‌ترین نکته این است که هیچ آزمایشگاه مستقلی تاکنون این نتایج را بازتولید نکرده است.
معرفی مدل فوگو-سایبر ساکانا برای امنیت سایبری

۱) چه اتفاقی افتاد؟ معرفی فوگو-سایبر

بازار مدل‌های هوش مصنوعی تخصصی امنیت سایبری تا پیش از این عمدتاً در اختیار آزمایشگاه‌های آمریکایی بود. اما در ۲۱ ژوئیه ۲۰۲۶، شرکت ژاپنی ساکانا ای‌آی مدلی با نام فوگو-سایبر معرفی کرد که مستقیماً همین بازار را هدف گرفته است.

نام این مدل از ماهی فوگو گرفته شده و بخشی از خانواده‌ی بزرگ‌تری به نام فوگو است که ساکانا حدود یک ماه پیش‌تر، در ۲۲ ژوئن ۲۰۲۶، رونمایی کرده بود. نکته‌ی مهم این است که فوگو-سایبر یک مدل پایه‌ی مستقل نیست؛ بلکه یک نقطه‌ی پایانی تخصصی روی همان چارچوب ارکستراسیون فوگو است.

به بیان ساده، ساکانا به‌جای آموزش یک مدل بسیار بزرگ برای همه‌ی کارها، سامانه‌ای ساخته که تصمیم می‌گیرد هر بخش از یک مسئله را به کدام مدل تخصصی بسپارد. این تفاوت رویکرد، هسته‌ی داستان است.

۲) بنچمارک‌ها چه می‌گویند؟

ساکانا دو عدد کلیدی منتشر کرده است که هر دو مربوط به بنچمارک‌های شناخته‌شده‌ی این حوزه‌اند.

آزمون CyberGym دانشگاه برکلی

این بنچمارک عامل‌های هوش مصنوعی را روی ۱۵۰۷ آسیب‌پذیری واقعی در ۱۸۸ پروژه‌ی متن‌باز می‌سنجد. سازوکار آزمون این‌گونه است: به عامل، توصیف یک آسیب‌پذیری و کد وصله‌نشده داده می‌شود و او باید یک نمونه‌ی اثبات مفهوم بسازد که روی نسخه‌ی وصله‌نشده باعث کرش شود، اما روی نسخه‌ی اصلاح‌شده کار نکند. ساکانا امتیاز ۸۶.۹ درصد را گزارش کرده است.

آزمون CTI-REALM مایکروسافت

این بنچمارک روی مهندسی تشخیص تهدید تمرکز دارد و از ۳۷ گزارش تهدید گلچین‌شده استفاده می‌کند. عامل باید تکنیک‌های حمله را نگاشت کند، داده‌های تله‌متری را تحلیل کند، پرس‌وجوها را پالایش کند و قواعد تشخیص را برای محیط‌های لینوکس، کوبرنتیز و آژور تولید کند. عدد اعلام‌شده برای فوگو-سایبر ۷۲.۱ درصد است.

مقایسه با رقبا

طبق ارقام منتشرشده از سوی ساکانا، در CyberGym مدل GPT-5.5-Cyber امتیاز ۸۵.۶ درصد و Claude Mythos Preview امتیاز ۸۳.۱ درصد گرفته‌اند. یعنی فاصله‌ی فوگو-سایبر با نزدیک‌ترین رقیب حدود ۱.۳ واحد درصد است؛ فاصله‌ای که در نبود بازه‌ی اطمینان، تفسیر آن دشوار است.

امتیاز فوگو-سایبر در بنچمارک CyberGym دانشگاه برکلی

۳) معماری ارکستراسیون؛ چرا یک مدل بزرگ کافی نیست

ایده‌ی مرکزی فوگو این است که هوشمندی می‌تواند در «هماهنگی» باشد، نه فقط در «مقیاس». سامانه یک پرس‌وجو را می‌خواند، به‌صورت پویا یک داربست عاملی می‌سازد و زیرکارها را میان مدل‌های تخصصی توزیع می‌کند.

در این معماری، نقش‌هایی مانند متفکر، کارگر و راستی‌آزما میان چند مدل زبانی تقسیم می‌شود و استراتژی هماهنگی از طریق یادگیری تقویتی آموخته شده است. طبق گزارش‌ها، هسته‌ی هماهنگ‌کننده‌ی این سامانه از یک مؤلفه‌ی بسیار کوچک در حد کسری از میلیارد پارامتر و یک مؤلفه‌ی بزرگ‌تر در حد چند میلیارد پارامتر تشکیل شده است؛ یعنی خودِ هماهنگ‌کننده اصلاً غول‌پیکر نیست.

استخر مدل‌هایی که فوگو-سایبر به آن‌ها کار می‌سپارد، طبق گزارش‌ها شامل مدل‌های تجاری بزرگ و چند مدل متن‌باز افشانشده است. منطق مسیریابی — یعنی این‌که چه کاری به کدام مدل می‌رود — همچنان اختصاصی و منتشرنشده باقی مانده است. اگر می‌خواهید تصویر روشن‌تری از این‌که چنین سامانه‌هایی واقعاً چه می‌توانند و چه نمی‌توانند، بخش توانایی‌ها و محدودیت‌های واقعی هوش مصنوعی نقطه‌ی شروع خوبی است.

۴) قیمت، دسترسی و محدودیت‌های جغرافیایی

برخلاف بسیاری از مدل‌های امروزی، فوگو-سایبر به‌سادگی در دسترس نیست. دسترسی به آن نیازمند بررسی دستی درخواست و پذیرش سیاست استفاده‌ی مجاز با محوریت کاربرد دفاعی است. وزن‌های مدل هم منتشر نشده‌اند.

از نظر قیمت، ارقام اعلام‌شده حدود ۶ دلار به ازای هر میلیون توکن ورودی و ۳۶ دلار به ازای هر میلیون توکن خروجی است؛ و طبق گزارش‌ها این نرخ برای کانتکست‌های بلندتر از حدود ۲۷۲ هزار توکن تقریباً دوبرابر می‌شود. این سطح قیمت‌گذاری نشان می‌دهد مخاطب هدف، تیم‌های امنیتی سازمانی‌اند نه کاربر عادی.

نکته‌ی جالب توجه، محدودیت جغرافیایی است: این سرویس در اتحادیه اروپا، منطقه‌ی اقتصادی اروپا، بریتانیا و سوئیس عرضه نشده است. دلیل اعلام‌شده، انطباق با الزامات حفاظت از داده است؛ چرا که مسیریابی پویا و افشانشده‌ی فوگو با الزام مستندسازی پردازنده‌های فرعی در مقررات اروپا سازگار نیست.

۵) نقدها؛ چرا کارشناسان محتاط‌اند

مهم‌ترین نکته درباره‌ی این اعداد، نه بزرگی‌شان بلکه منبعشان است: همه‌ی ارقام خوداظهاری شرکت‌اند و تا زمان انتشار این گزارش، هیچ آزمایشگاه ثالثی آن‌ها را بازتولید نکرده است.

فهرست چیزهایی که منتشر نشده، کوتاه نیست: نسخه‌ی دقیق بنچمارک مشخص نشده، تعداد دفعات اجرای آزمون اعلام نشده، داربست عاملی مورد استفاده افشا نشده، بازه‌ی اطمینان و عدم قطعیت گزارش نشده و حتی تاریخ اجرای آزمون‌ها هم در دسترس نیست. در ارزیابی مدل‌های عاملی، هر کدام از این متغیرها می‌تواند نتیجه را به‌شکل معناداری جابه‌جا کند.

نقد دومی هم مطرح شده است: امتیاز حدود ۷۲ درصدی در مهندسی تشخیص تهدید، هرچند چشمگیر است، برای محیط عملیاتی کافی نیست. یک ناظر مستقل تأکید کرده قواعد تولیدشده پیش از رسیدن به محیط واقعی نیاز به بازبینی انسانی مستمر دارند؛ چون هزینه‌ی هشدار نادرست در مرکز عملیات امنیت بسیار بالاست.

معماری ارکستراسیون چند مدل تخصصی به جای یک مدل بزرگ

۶) شکاف مهمی که بی‌پاسخ مانده است

یکی از جدی‌ترین ابهام‌ها این است که سازندگان خودِ بنچمارک CyberGym، در ارائه‌ی علمی خود امتیازهایی به‌مراتب پایین‌تر برای بهترین ترکیب‌های مدلی گزارش کرده بودند. فاصله‌ی میان آن عدد و ۸۶.۹ درصد اعلام‌شده، بسیار بزرگ است.

سه توضیح ممکن برای این فاصله مطرح شده است: نخست، یک جهش واقعی در توانمندی که ارکستراسیون آن را ممکن کرده؛ دوم، استفاده از نسخه یا زیرمجموعه‌ای آسان‌تر از همان بنچمارک؛ و سوم، اثر جانبی تنظیمات ارزیابی. بدون انتشار جزئیات روش، انتخاب میان این سه توضیح ممکن نیست.

این وضعیت یادآور الگویی آشناست: در نبود استاندارد مشترک برای گزارش نتایج، بنچمارک از ابزار سنجش به ابزار بازاریابی تبدیل می‌شود. همین موضوع در مقایسه‌های دیگر حوزه هم دیده شده؛ برای نمونه در پرونده‌ی نبرد چت‌جی‌پی‌تی و دیپ‌سیک که در آن روش سنجش به‌اندازه‌ی نتیجه اهمیت داشت.

۷) لبه‌ی تیز میان دفاع و حمله

هر سامانه‌ای که بتواند با دقت بالا برای آسیب‌پذیری‌های واقعی نمونه‌ی اثبات مفهوم بسازد، به‌طور ذاتی کاربرد تهاجمی هم دارد. این دقیقاً همان توانایی است که یک مهاجم برای تبدیل یک گزارش باگ به یک اکسپلویت عملی نیاز دارد.

ساکانا ظاهراً همین ریسک را دلیل اصلی سازوکار دسترسی محدود و بررسی دستی درخواست‌ها عنوان کرده است. اما تاریخ نشان داده که کنترل دسترسی، راه‌حل قطعی نیست؛ فشار بازار و رقابت معمولاً به‌مرور همان قابلیت را در دسترس‌تر می‌کند.

پرسش راهبردی این است: اگر توانایی کشف آسیب‌پذیری با هوش مصنوعی سریع‌تر از توانایی وصله‌کردن رشد کند، تعادل میان مهاجم و مدافع به کدام سو می‌رود؟ پاسخ روشنی برای این پرسش وجود ندارد، اما اهمیت آن برای هر سازمانی که نرم‌افزار تولید می‌کند، غیرقابل چشم‌پوشی است. برای درک بهتر ابعاد تجاری این تحول، مرور اهمیت هوش مصنوعی در کسب‌وکار کمک‌کننده است.

۸) این خبر برای مخاطب فارسی‌زبان چه معنایی دارد؟

برای بیشتر کاربران فارسی‌زبان، فوگو-سایبر ابزاری نیست که مستقیماً به آن دسترسی پیدا کنند؛ هم قیمت و هم سازوکار تأیید دستی مانع‌اند. اما پیام این خبر فراتر از یک محصول است.

نخست، این‌که برتری در هوش مصنوعی لزوماً از دل بزرگ‌ترین مدل بیرون نمی‌آید. یک تیم کوچک‌تر با معماری هوشمندانه‌ی هماهنگی می‌تواند در یک حوزه‌ی باریک با غول‌ها رقابت کند. این خبر خوبی برای تیم‌های کوچک است.

دوم، این‌که سواد ارزیابی اهمیت پیدا کرده است. وقتی هر هفته مدلی با ادعای رکوردشکنی معرفی می‌شود، توانایی خواندن دقیق ادعاها — این‌که چه کسی آزمون گرفته، با چه نسخه‌ای و چند بار — به یک مهارت حرفه‌ای تبدیل می‌شود. همین منطق در نوشتن دستور به مدل‌ها هم صادق است؛ چیزی که در راهنمای پرامپت‌نویسی به‌تفصیل بررسی شده است.

سوم، این‌که تبلیغات پیرامون توانایی‌های هوش مصنوعی گاهی از واقعیت جلو می‌زند؛ موضوعی که در تحلیل توهم هوش مصنوعی؛ توسعه‌دهنده‌ی تنها در برابر مهندس واقعی به آن پرداخته‌ایم.

۹) جمع‌بندی روند؛ در ادامه چه انتظاری داشته باشیم؟

معرفی فوگو-سایبر دو چیز را همزمان نشان می‌دهد: بلوغ سریع مدل‌های تخصصی امنیت سایبری، و شکنندگی نظام فعلی گزارش‌دهی بنچمارک. تا زمانی که ارزیابی مستقل انجام نشود، عدد ۸۶.۹ درصد باید به‌عنوان یک ادعا خوانده شود، نه یک واقعیت تثبیت‌شده.

سناریوی محتمل این است که در ماه‌های آینده، آزمایشگاه‌های دانشگاهی تلاش کنند این نتایج را بازتولید کنند. اگر موفق شوند، رویکرد ارکستراسیون به الگوی غالب حوزه‌ی امنیت تبدیل خواهد شد. اگر نه، این ماجرا به نمونه‌ی دیگری از فاصله‌ی میان ادعا و واقعیت اضافه می‌شود. تازه‌ترین تحولات این پرونده را می‌توانید در بخش اخبار هوش مصنوعی دنبال کنید.

پرسش‌های پرتکرار درباره‌ی مدل فوگو-سایبر

مدل فوگو-سایبر دقیقاً چه کاری انجام می‌دهد؟

این سامانه برای کارهای دفاعی امنیت سایبری طراحی شده است؛ از جمله تحلیل آسیب‌پذیری‌ها، ساخت نمونه‌ی اثبات مفهوم برای کدهای وصله‌نشده و تولید قواعد تشخیص تهدید برای محیط‌های سازمانی.

آیا این مدل واقعاً از GPT-5.5 و کلود بهتر است؟

بر پایه‌ی اعداد خوداظهاری ساکانا بله، اما اختلاف در بنچمارک اصلی حدود یک واحد درصد است و هیچ ارزیابی مستقلی این نتایج را تأیید نکرده است. بنابراین پاسخ قطعی وجود ندارد.

چطور می‌توان به فوگو-سایبر دسترسی گرفت؟

دسترسی از طریق درخواست و بررسی دستی انجام می‌شود و به پذیرش سیاست استفاده‌ی دفاعی مشروط است. وزن‌های مدل منتشر نشده و سرویس در اتحادیه اروپا، بریتانیا و سوئیس عرضه نمی‌شود.

معماری ارکستراسیون چه تفاوتی با یک مدل بزرگ دارد؟

در معماری ارکستراسیون، به‌جای یک مدل واحد، یک هماهنگ‌کننده‌ی کوچک تصمیم می‌گیرد هر زیرکار به کدام مدل تخصصی سپرده شود. مزیت آن انعطاف و هزینه‌ی کمتر است و عیب آن پیچیدگی و دشواری حسابرسی مسیر تصمیم.

آیا چنین مدلی می‌تواند برای حمله استفاده شود؟

توانایی ساخت نمونه‌ی اثبات مفهوم ذاتاً دو کاربرده است. ساکانا با محدودسازی دسترسی و سیاست استفاده‌ی مجاز تلاش کرده این ریسک را مهار کند، اما کارشناسان این نوع کنترل‌ها را راه‌حل کامل نمی‌دانند.

جمع‌بندی. فوگو-سایبر نشان می‌دهد رقابت هوش مصنوعی امنیتی دیگر انحصار آمریکا نیست و معماری هماهنگی می‌تواند جای مقیاس خام را بگیرد. با این حال تا زمان تأیید مستقل، بهتر است این اعداد را ادعا بدانیم نه نتیجه. برای دنبال کردن تازه‌ترین اخبار و آموزش‌های هوش مصنوعی به @MrChatGPT_IR بپیوندید.
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *