رسوایی بنچمارک GPT-6 Astra؛ از عذرخواهی آلتمن تا هشدار امنیتی

اخبار · هوش مصنوعی

مدلی که قرار بود آغازگر دوران هوش مصنوعی عمومی باشد، در همان ساعت‌های اول عرضه به یکی از جنجالی‌ترین رویدادهای سال در دنیای فناوری تبدیل شد.

چکیده. شرکت OpenAI مدل تازه‌ی خود، جی‌پی‌تی-۶ آسترا، را با ادعای ورود به «دوران AGI» معرفی کرد؛ اما دسترسی کاربران مشترک به‌هم ریخت، عدد رسمی ۹۹.۹ درصد در آزمون ARC-AGI-3 در اجرای مستقل به ۶۲.۷ درصد رسید، و دانشمند ارشد این شرکت پذیرفت که نظارت بر روند فکری مدل روزبه‌روز شکننده‌تر می‌شود.
مقایسه دو نتیجه متفاوت مدل جی‌پی‌تی-۶ آسترا در آزمون ARC-AGI-3

بخش یکم: عرضه‌ای که قرار بود لحظه‌ی تاریخی باشد

شرکت OpenAI عصر روز سه‌شنبه، سوم سپتامبر، مدل جی‌پی‌تی-۶ آسترا را رونمایی کرد و آن را گامی به‌سوی «دوران هوش مصنوعی عمومی» توصیف کرد. این مدل با پنجره‌ی متنی نزدیک به یک میلیون و پنجاه هزار توکن و ظرفیت خروجی تا ۱۲۸ هزار توکن عرضه شده و قیمت‌گذاری آن ده دلار برای هر یک میلیون توکن ورودی، یک دلار برای توکن‌های کش‌شده، دوازده و نیم دلار برای نوشتن در کش، و پنجاه دلار برای هر یک میلیون توکن خروجی اعلام شده است.

نکته‌ی فنی مهم‌تر، معماری تازه‌ای به نام «عمق بازگشتی» است؛ روشی که در آن متن چندین بار میان لایه‌های شبکه‌ی عصبی عبور داده می‌شود تا مدل بتواند استدلال عمیق‌تری انجام دهد، بدون آن‌که لزوماً اندازه‌ی مدل بزرگ‌تر شود. برای آشنایی بیشتر با ساختار این شرکت و مسیر توسعه‌ی محصولاتش، این مطلب درباره‌ی OpenAI را هم بخوانید.

واژه‌ی «دوران AGI» که این شرکت برای معرفی مدل تازه به کار برد، عبارتی سنگین است که در تاریخ این شرکت کم‌سابقه بوده؛ پیش از این، مدیران OpenAI معمولاً از عباراتی محتاطانه‌تر مثل «گامی رو به جلو» یا «پیشرفت قابل‌توجه» استفاده می‌کردند. همین انتخاب کلمات باعث شد انتظارات کاربران و رسانه‌ها از همان لحظه‌ی اول بسیار بالا برود؛ انتظاراتی که وقتی با واقعیت مشکلات فنی و اختلاف در اعداد بنچمارک برخورد کرد، جنجال را چند برابر شدیدتر کرد.

بخش دوم: رول‌اوت پرمشکل و کاربرانی که پشت در ماندند

بر اساس گزارش‌های منتشرشده، دسترسی به مدل تازه ابتدا فقط برای سازمان‌ها و مشتریان بزرگ سازمانی باز شد و کاربران عادی طرح‌های پلاس، پرو، بیزینس و حتی برخی مشترکان اینترپرایز، با وجود پرداخت هزینه، دسترسی فوری نداشتند. شرکت اعلام کرده بود که این محدودیت عمدی و برای انجام آزمایش‌های ایمنی بیشتر، به‌ویژه درباره‌ی توانایی‌های امنیت سایبری مدل، در نظر گرفته شده است.

زمان‌بندی دقیق ماجرا خودش گویاست: نخست مدیرعامل شرکت خبر عرضه‌ی مدل را اعلام کرد، تنها چند دقیقه بعد پذیرفت که کاربران ناراضی هستند، همان شب برنامه‌ی جبرانی را اعلام کرد، و سرانجام در ساعات اولیه‌ی روز بعد عذرخواهی رسمی و کامل‌تری منتشر شد. چنین فاصله‌ی زمانی کوتاهی میان اعلام خبر و پذیرفتن اشتباه، نشان می‌دهد که واکنش منفی کاربران بسیار سریع‌تر و گسترده‌تر از چیزی بود که تیم ارتباطات این شرکت پیش‌بینی کرده بود.

ساعاتی پس از آغاز جنجال، مدیرعامل این شرکت شخصاً واکنش نشان داد و نوشت که «وقتی خراب می‌کنیم، تلاش می‌کنیم درستش کنیم». او بدون قول قطعی، امیدوار بود دسترسی کامل تا پایان همان هفته فراهم شود. ساعتی بعد، برنامه‌ی جبرانی نیز اعلام شد: به‌ازای هر روزی که کاربران پولی به مدل دسترسی نداشتند، یک بازنشانی رایگان اضافه به حساب آن‌ها اضافه می‌شد. مسئول مهندسی یکی از محصولات کدنویسی این شرکت نیز جداگانه قول داد این جبران هر روز تا رسیدن دسترسی کامل ادامه یابد. برای کسب‌وکارهایی که این روزها به چنین مدل‌هایی وابسته‌اند، اهمیت هوش مصنوعی در کسب‌وکار بیش از هر زمان دیگری ملموس شده است؛ چرا که حتی چند روز تأخیر در دسترسی به یک مدل کلیدی می‌تواند برنامه‌ی کاری تیم‌های فنی را مختل کند.

بخش سوم: رسوایی بنچمارک؛ نود و نه درصد یا شصت‌ودو درصد؟

جنجالی‌ترین بخش ماجرا اما به ادعای عملکرد مدل در آزمون معروف ARC-AGI-3 بازمی‌گردد؛ آزمونی که به‌عنوان یکی از سخت‌ترین معیارهای سنجش استدلال انتزاعی هوش مصنوعی شناخته می‌شود و برخلاف بسیاری از بنچمارک‌های رایج، صرفاً بر حفظ اطلاعات یا الگوهای زبانی تکیه ندارد؛ بلکه توانایی مدل در حل مسائل تصویری تازه و کاملاً ناآشنا را می‌سنجد، مسائلی که حتی برای انسان‌ها هم نیاز به استدلال گام‌به‌گام دارد. همین ویژگی باعث شده این آزمون به یکی از معتبرترین معیارهای صنعت برای ادعای نزدیک‌شدن به هوش مصنوعی عمومی تبدیل شود. شرکت OpenAI عدد نود و نه و نه‌دهم درصد را به‌عنوان دستاورد این مدل اعلام کرد، اما آزمایشگاه مستقل ARC Prize، همان آزمون را با یک «رابط استاندارد و بی‌طرف نسبت به سازنده» اجرا کرد و نتیجه فقط شصت‌ودو و هفت‌دهم درصد بود.

دلیل این شکاف بزرگ، تفاوت در روش اجراست. در حالت استاندارد، مدل باید خودش تصمیم بگیرد چه بخشی از استدلال میان‌مرحله‌ای را در یادداشت‌های قابل‌مشاهده نگه دارد، درست مثل رقبایش. اما در حالت اختصاصیِ همان شرکت، مدل اجازه دارد وضعیت استدلال پنهان خود را میان درخواست‌ها حفظ کند و از فشرده‌سازی برای مکالمه‌های طولانی استفاده کند؛ روشی که هزینه‌ی اجرا را نزدیک به چهل و نه درصد کاهش داد و سرعت را نزدیک به سه و نیم برابر افزایش داد، اما آن را با شرایط سایر رقبا غیرقابل‌مقایسه کرد. این شکاف میان عدد تبلیغاتی و عدد واقعی، دقیقاً همان بحثی است که در مطلب توهم هوش مصنوعی، توسعه‌دهنده‌ی تنها در برابر مهندس واقعی بررسی کرده‌ایم.

سم آلتمن برای رول‌اوت پرمشکل مدل جی‌پی‌تی-۶ آسترا عذرخواهی کرد

بخش چهارم: آسترا در برابر جمنای و کلود

عرضه‌ی این مدل درست در میانه‌ی هفته‌ای اتفاق افتاد که چند رقیب بزرگ نیز محصولات تازه‌ی خود را معرفی کرده بودند؛ از جمله جمنای ۳.۸ فلش و نسخه‌ی امنیتی آن به نام فلش سایبر از سوی گوگل، و کلود فیبل ۵.۱ و کلود میتوس ۵.۱ از سوی آنتروپیک. تحلیلگران مستقل بلافاصله مقایسه‌هایی میان نتایج آسترا و این مدل‌ها منتشر کردند و نشان دادند که در برخی آزمون‌های مهندسی نرم‌افزار، فاصله‌ی واقعی میان مدل‌ها بسیار کمتر از چیزی است که اعداد تبلیغاتی نشان می‌دهند.

این رقابت فشرده و گاه گمراه‌کننده روی اعداد، شباهت زیادی به نبرد قبلی چت‌جی‌پی‌تی و دیپ‌سیک دارد؛ جایی که باز هم اختلاف‌نظر بر سر روش سنجش، مهم‌تر از خود عدد نهایی شده بود.

جالب این‌جاست که نسخه‌ی امنیتی جمنای، یعنی فلش سایبر، دقیقاً همان روزهایی معرفی شد که تمرکز اصلی OpenAI هم روی آزمایش‌های امنیت سایبری مدل تازه‌اش بود؛ نشانه‌ای از این‌که در حال حاضر، امنیت سایبری به یکی از میدان‌های اصلی رقابت میان آزمایشگاه‌های بزرگ هوش مصنوعی تبدیل شده، نه فقط توانایی خام مدل‌ها در نوشتن کد یا پاسخ‌گویی عمومی.

بخش پنجم: هشدار ایمنی؛ وقتی حتی سازنده هم مدل را نمی‌بیند

فراتر از جنجال بنچمارک، نگرانی عمیق‌تری از درون خود OpenAI مطرح شد. دانشمند ارشد این شرکت به‌صراحت گفت که روش «نظارت بر زنجیره‌ی تفکر» مدل، یعنی خواندن مراحل استدلال آن به زبان قابل‌فهم انسانی برای جلوگیری از رفتارهای خطرناک، «شکننده» است و روند آن «رو به بدتر شدن» می‌رود.

دلیل فنی این نگرانی به همان معماری «عمق بازگشتی» برمی‌گردد؛ بخشی از فرایند تفکر مدل دیگر در قالب متن خوانا اتفاق نمی‌افتد، بلکه در بازنمایی‌های عددی درونی رخ می‌دهد که برای ناظران انسانی کاملاً نامرئی است. به بیان ساده، هرچه مدل‌ها قدرتمندتر می‌شوند، ابزار نظارت بر آن‌ها ضعیف‌تر عمل می‌کند؛ دقیقاً پارادوکسی که کارشناسان ایمنی هوش مصنوعی سال‌هاست درباره‌اش هشدار می‌دهند. برای درک عمیق‌تر مرز میان توانایی واقعی و محدودیت‌های امروز هوش مصنوعی، این مطلب را از دست ندهید.

نقل‌قول کلیدی از درون شرکت

طبق نقل‌قول‌های منتشرشده، این دانشمند ارشد گفته است که نمی‌خواهد شاهد «مسابقه‌ای به‌سمت غیرقابل‌نظارت‌شدن» باشد که از گزارش‌های نادقیق شعله‌ور شده، و تأکید کرده که تقویت نظارت هم‌چنان هدف اصلی تیم‌های ایمنی این شرکت است.

هشدار درباره شکننده شدن نظارت بر زنجیره تفکر مدل جی‌پی‌تی-۶ آسترا

بخش ششم: این ماجرا برای کاربر عادی چه معنایی دارد

برای کسی که فقط از چت‌جی‌پی‌تی برای کارهای روزمره استفاده می‌کند، شاید جزئیات فنی این جنجال چندان مهم نباشد؛ اما نتیجه‌ی عملی آن روشن است: به اعداد تبلیغاتی شرکت‌های هوش مصنوعی با احتیاط بیشتری نگاه کنید و عملکرد واقعی مدل را در کاربرد خودتان بسنجید، نه فقط در جدول‌های مقایسه‌ای. اگر می‌خواهید با وجود همه‌ی این جنجال‌ها بهترین بهره را از مدل‌های جدید ببرید، راهنمای نوشتن پرامپت حرفه‌ای و مجموعه‌ی آموزش‌های چت‌جی‌پی‌تی در سایت می‌تواند به شما کمک کند.

بخش هفتم: واکنش جامعه‌ی فناوری و مسیر پیش‌رو

واکنش کارشناسان امنیت و پژوهشگران مستقل به این رویداد عمدتاً محتاطانه بوده است؛ بسیاری از آن‌ها ارزش فنی معماری «عمق بازگشتی» را می‌پذیرند، اما نسبت به شفافیت در گزارش‌دهی بنچمارک‌ها و سرعت عرضه‌ی مدل‌های قدرتمند بدون آماده‌بودن کامل زیرساخت انتقاد دارند. برخی تحلیلگران حتی پیشنهاد داده‌اند که نهادهای مستقلی مانند ARC Prize باید به‌جای شرکت‌های سازنده، مرجع اصلی اعلام نتایج بنچمارک‌ها باشند تا این نوع اختلاف‌نظرها تکرار نشود.

در روزهای آینده باید دید آیا OpenAI روش گزارش‌دهی بنچمارک‌های آینده‌ی خود را شفاف‌تر می‌کند یا خیر، و آیا دسترسی کامل کاربران عادی طبق وعده‌ی داده‌شده تحقق می‌یابد. تا آن زمان، این رویداد یادآوری خوبی است که در صنعت هوش مصنوعی، سرعت رقابت گاهی از سرعت آماده‌سازی درست یک محصول پیشی می‌گیرد. برای دنبال‌کردن ادامه‌ی این ماجرا و دیگر خبرهای لحظه‌ای هوش مصنوعی، سری به بخش اخبار سایت بزنید.

بخش هشتم: پرسش‌های پرتکرار درباره‌ی جی‌پی‌تی-۶ آسترا

آیا جی‌پی‌تی-۶ آسترا هنوز در دسترس همه هست؟

در ساعات اولیه‌ی عرضه، دسترسی محدود به سازمان‌ها و مشتریان بزرگ بود، اما شرکت وعده داده دسترسی کامل مشترکان پلاس، پرو و بیزینس را به‌تدریج و طی روزهای پس از عرضه باز می‌کند.

چرا دو عدد متفاوت برای بنچمارک این مدل منتشر شده است؟

یک عدد از اجرای آزمون با رابط استاندارد و بی‌طرف به‌دست آمده و عدد دیگر از اجرای همان آزمون با ابزارهای اختصاصی خود شرکت که امکاناتی مانند حفظ وضعیت استدلال پنهان را فراهم می‌کند؛ همین تفاوت شرایط اجراست که باعث اختلاف بزرگ در نتیجه شده است.

آیا نگرانی امنیتی مطرح‌شده درباره‌ی این مدل واقعی است؟

بله؛ این هشدار را نه منتقدان بیرونی، بلکه دانشمند ارشد خود شرکت مطرح کرده و آن را ناشی از معماری تازه‌ی مدل دانسته، نه صرفاً یک احتیاط بازاریابی.

تفاوت اصلی آسترا با نسخه‌های قبلی OpenAI چیست؟

مهم‌ترین تفاوت، استفاده از معماری «عمق بازگشتی» برای استدلال عمیق‌تر و پنجره‌ی متنی بسیار بزرگ‌تر است؛ ویژگی‌هایی که هم توان مدل را افزایش داده‌اند و هم نظارت بر آن را دشوارتر کرده‌اند.

جمع‌بندی. عرضه‌ی جی‌پی‌تی-۶ آسترا نشان داد که در رقابت شدید امروز میان غول‌های هوش مصنوعی، فاصله‌ی میان ادعای تبلیغاتی و واقعیت فنی می‌تواند به‌سرعت آشکار شود؛ از رول‌اوت پرمشکل و عذرخواهی رسمی گرفته تا رسوایی بنچمارک و هشدار درباره‌ی شکننده‌شدن نظارت ایمنی. برای دنبال‌کردن ادامه‌ی این خبر و تازه‌ترین تحولات هوش مصنوعی، به کانال تلگرام @MrChatGPT_IR بپیوندید.
(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *