شرکت اوپنایآی اینبار یک مدل معرفی نکرد؛ یک خانوادهی کامل رونمایی کرد. جیپیتی ۵.۶ با سه عضو به نامهای سول، ترا و لونا آمده و هرکدام برای یک نوع کار طراحی شدهاند. شعار این نسل ساده است: هوش بیشتر از هر توکن، با هزینهی کمتر. عددهای بنچمارک و جدول قیمتها نشان میدهند این شعار فقط تبلیغات نیست.

لیست مطالب
۱) چه اتفاقی افتاد؛ پایان دوران «یک مدل برای همه»
تا پیش از این، هر بار که اوپنایآی نسخهی تازهای از مدلهای خود را معرفی میکرد، داستان کمابیش یکسان بود: یک مدل پرچمدار میآمد، چند نسخهی کوچکتر و ارزانتر هم پشت سرش عرضه میشد و کاربر عملاً یک انتخاب دوگزینهای داشت؛ یا گران و دقیق، یا ارزان و سطحی. رونمایی نهم جولای ۲۰۲۶ این الگو را شکست. اوپنایآی بهجای یک مدل، یک خانوادهی سهعضوی معرفی کرد که اعضایش نه نسخههای کوچکشدهی یکدیگر، بلکه سه نقطهی متفاوت روی منحنی «هزینه در برابر توانایی» هستند.
نامها هم معنادار انتخاب شدهاند. سول، ترا و لونا؛ خورشید، زمین و ماه. سول در مرکز است و بیشترین انرژی را مصرف میکند؛ ترا جایی است که بیشتر کارهای واقعی انجام میشود؛ و لونا سبکترین جرم مدار است که با کمترین هزینه میچرخد. این استعاره در عمل هم درست از آب درآمده: تفاوت قیمت سول و لونا در ازای هر میلیون توکن، پنج برابر است.
معنای این تغییر برای کاربر حرفهای روشن است. دیگر لازم نیست کل یک محصول را روی گرانترین مدل بنا کنید. میتوانید مسیرهای ساده را به لونا بسپارید، جریان اصلی کار را به ترا بدهید و فقط گرههای واقعاً سخت را به سول ارجاع دهید. این همان معماریای است که تا دیروز تیمهای بزرگ با ترکیب مدلهای چند شرکت مختلف میساختند و حالا داخل یک خانواده در دسترس است. اگر تازه با این اکوسیستم آشنا میشوید، مرور معرفی کامل اوپنایآی نقطهی شروع خوبی است.
۲) سول، ترا و لونا؛ هرکدام دقیقاً برای چه کاری
سول پرچمدار خانواده است و برای کارهایی طراحی شده که در آنها خطا گران تمام میشود: کدنویسی پیچیده، تحلیلهای چندمرحلهای، بازبینی اسناد حقوقی و فنی، و هر جریان کاری که در آن مدل باید دهها گام پشت سر هم بردارد بدون اینکه رشتهی کار از دستش در برود. اوپنایآی برای کاربران ردههای حرفهای نسخهای با نام سول پرو هم در نظر گرفته که برای بالاترین کیفیت خروجی تنظیم شده است.
ترا عضو متعادل خانواده است و احتمالاً پرکاربردترین آنها خواهد بود. سرعت پاسخدهی بالاتر، هزینهی نصف سول و کیفیتی که برای اکثریت قاطع کارهای روزمره کافی است. طبق اعلام رسمی، کاربران رایگان و ردهی گو در بخشهایی از سرویس به ترا دسترسی دارند؛ یعنی مدل متعادل خانواده عملاً به مدل پیشفرض بخش بزرگی از کاربران تبدیل میشود.
لونا ارزانترین و پرشتابترین عضو است. جای واقعی لونا آنجاست که حجم درخواست بالاست و پیچیدگی هر درخواست پایین: دستهبندی پیامها، خلاصهسازی انبوه، استخراج داده از متنهای ساختاریافته، پاسخهای اولیهی پشتیبانی. با قیمت یک دلار برای هر میلیون توکن ورودی، لونا اقتصاد بسیاری از محصولاتی را که تا دیروز توجیه مالی نداشتند تغییر میدهد.
یک نکتهی مهم دربارهی انتخاب مدل
اشتباه رایج این است که همهچیز را به گرانترین مدل بسپاریم چون «قطعاً بهتر است». در عمل، بخش بزرگی از کیفیت خروجی به کیفیت پرامپت برمیگردد، نه به ردهی مدل. یک پرامپت دقیق روی ترا اغلب خروجی بهتری از یک پرامپت مبهم روی سول میدهد. اگر میخواهید در این زمینه جدی شوید، راهنمای پرامپتنویسی از صفر دقیقاً همین شکاف را پر میکند.
۳) نمرههای بنچمارک؛ آنچه عددها میگویند
شاخصترین عددی که اوپنایآی روی آن تأکید کرده، نتیجهی سول در آزمون Agents’ Last Exam است: ۵۲.۷ درصد. این آزمون توانایی مدل را در انجام جریانهای کاری حرفهای در دهها حوزهی تخصصی میسنجد و به همین دلیل به یکی از سختترین سنجههای امروزی تبدیل شده است. طبق اعلام رسمی، این نمره ۱۳.۱ واحد بالاتر از نزدیکترین رقیب ثبت شده است.
در حوزهی کدنویسی، سول در شاخص Coding Agent Index مؤسسهی Artificial Analysis نمرهی ۸۰ گرفته است. در سنجهی SWE-Bench Pro که مسائل مهندسی نرمافزار واقعی را ارزیابی میکند، طبق گزارشها سول به ۶۴.۶ درصد رسیده؛ عددی که پیشرفت محسوسی نسبت به نسل قبل است اما نشان میدهد رقابت در این حوزه هنوز تمامنشده باقی مانده و مدلهای رقیب در برخی سنجههای کدنویسی همچنان جلوترند.

دو عدد دیگر هم ارزش توجه دارند، چون مستقیماً به کاربردهای عملی مربوطاند. در BrowseComp که توانایی مدل در گشتوگذار و یافتن اطلاعات در وب را میسنجد، سول به ۹۲.۲ درصد رسیده. در OSWorld 2.0 که کار مستقیم با محیط سیستمعامل و رابط گرافیکی را ارزیابی میکند، نمره ۶۲.۶ درصد ثبت شده است. این دو عدد یعنی خانوادهی جدید نهفقط بهتر «حرف میزند»، بلکه بهتر «کار میکند» — و همین، مرز میان یک چتبات و یک ایجنت واقعی است.
البته همیشه یادآوری یک نکته لازم است: بنچمارکها تصویر کاملی از تجربهی روزمره نمیدهند. تفاوت چند واحدی در یک آزمون استاندارد ممکن است در کار واقعی شما اصلاً محسوس نباشد، و برعکس، ضعفی که در هیچ بنچمارکی دیده نمیشود ممکن است کل جریان کاریتان را مختل کند. برای مقایسهی عملی مدلها در یک موقعیت مشخص، این رویارویی چتجیپیتی و دیپسیک مثال خوبی از فاصلهی عدد و واقعیت است.
۴) جهش امنیت سایبری؛ بخش کمسروصدا اما مهمتر
در حاشیهی سروصدای بنچمارکهای هوش، بخشی از گزارش رسمی که کمتر دیده شد به تواناییهای امنیت سایبری مربوط است — و دقیقاً همان بخشی است که برای سازمانها بیشترین اهمیت را دارد.
در سنجهی ExploitBench، نمره از ۴۷.۹ درصد در نسل قبل به ۷۳.۵ درصد رسیده است. در SEC-Bench Pro، جهش از ۴۵.۸ به ۷۱.۲ درصد ثبت شده. و در ExploitGym که مدل باید در یک بازهی زمانی محدود روی مسئله کار کند، نرخ موفقیت زیر سقف دو ساعت ۲۴.۹ درصد و با شش ساعت زمان بیشتر ۳۳.۷ درصد گزارش شده؛ در برابر ۱۵.۱ درصد نسل قبل. همین عدد آخر است که ادعای «تقریباً دو برابر شدن» را پشتیبانی میکند.
این پیشرفت دو رو دارد. روی روشن آن، تیمهای امنیتی ابزار قدرتمندتری برای یافتن آسیبپذیریها در کد خودشان دارند. روی تاریک آن، همین توانایی در دست بازیگر بدخواه معنای دیگری پیدا میکند؛ به همین دلیل اوپنایآی دسترسی به بخشی از این قابلیتها را محدود و مشروط کرده است. بحث دربارهی مرز میان توانمندسازی و خطر، یکی از پرتنشترین گفتوگوهای امسال صنعت بوده است.
۵) قیمتها و اقتصاد تازهی توکن
جدول قیمت خانوادهی جدید به ازای هر یک میلیون توکن به این شکل اعلام شده است: سول با ۵ دلار ورودی و ۳۰ دلار خروجی، ترا با ۲.۵ دلار ورودی و ۱۵ دلار خروجی، و لونا با ۱ دلار ورودی و ۶ دلار خروجی. نکتهی مهم، نسبتهاست: فاصلهی هر رده تا ردهی بعدی دقیقاً دو برابر است، که انتخاب را برای توسعهدهنده ساده میکند.
پنجرهی متنی هر سه مدل یک میلیون توکن اعلام شده و بیشینهی خروجی ۱۲۸ هزار توکن است. تاریخ قطع دانش مدلها نیز شانزدهم فوریه ۲۰۲۶ گزارش شده؛ یعنی برای رویدادهای پس از آن تاریخ همچنان باید به ابزارهای جستوجو یا دادهی خودتان تکیه کنید.
برای کسبوکارها، معنای واقعی این جدول قیمت در معماری است نه در تخفیف. وقتی سه رده با تفاوتهای شفاف در دسترس باشد، میتوانید هزینهی هر درخواست را به سطح دشواری همان درخواست گره بزنید. تفاوت میان یک محصول با حاشیهی سود و یک محصول زیانده، اغلب دقیقاً همینجا رقم میخورد. اگر میخواهید این نگاه را در سطح سازمان جا بیندازید، اهمیت هوش مصنوعی در کسبوکار چارچوب خوبی برای شروع گفتوگو با مدیران است.
۶) دسترسی در چتجیپیتی و ابزارهای جانبی
برخلاف بعضی رونماییهای گذشته که فاصلهی میان اعلام و دسترسی عمومی هفتهها طول میکشید، اینبار مدلها از همان روز در دسترس قرار گرفتند. کاربران ردههای پلاس، پرو، بیزنس و اینترپرایز به سول دسترسی دارند و ردههای پرو و اینترپرایز میتوانند نسخهی سول پرو را برای بالاترین کیفیت انتخاب کنند. کاربران رایگان و ردهی گو نیز در بخشهایی از سرویس به ترا دسترسی گرفتند.

در کنار خود مدلها، اوپنایآی حالتهای تلاش محاسباتی متفاوتی هم معرفی کرده که به کاربر اجازه میدهد میان سرعت و عمق تحلیل توازن برقرار کند؛ حالتی با نام اولترا برای ردههای بالاتر در نظر گرفته شده است. اگر میخواهید از این تنظیمات در کار روزمرهتان بیشترین بهره را ببرید، مجموعهی آموزشهای چتجیپیتی گامبهگام همین موارد را پوشش میدهد.
۷) این خانواده برای کاربر فارسیزبان چه معنایی دارد
نکتهی اول، کیفیت زبان فارسی است. مدلهای نسل جدید معمولاً در زبانهای غیرانگلیسی هم پیشرفت میکنند، اما این پیشرفت هیچگاه به اندازهی انگلیسی نیست. تجربه نشان داده که برای کارهای حساس فارسی، پرامپت دقیقتر و نمونهی بیشتر، تأثیری بیشتر از ارتقای ردهی مدل دارد.
نکتهی دوم، هزینه است. برای کاربر ایرانی که پرداخت ارزی دشوارتر و گرانتر تمام میشود، وجود ردهی لونا با قیمت یکپنجم سول یک فرصت واقعی است. بسیاری از کارهایی که تا دیروز بهخاطر هزینه کنار گذاشته میشدند، حالا با انتخاب درست ردهی مدل قابل اجرا هستند.
نکتهی سوم، سرعت تغییر است. فاصلهی میان نسلهای مدل به چند ماه کاهش پیدا کرده و هر تصمیم فنی که امروز میگیرید باید قابلیت جابهجایی مدل را در خود داشته باشد. معماریای بسازید که تعویض مدل در آن یک تغییر تنظیمات باشد، نه یک بازنویسی کامل. تازهترین تحولات را میتوانید در بخش اخبار هوش مصنوعی دنبال کنید.
۸) نقطهضعفها و آنچه هنوز روشن نیست
هیچ رونماییای بدون ابهام نیست و این یکی هم استثنا نبود. نخست، بخشی از نمرههای اعلامشده از سوی خود سازنده منتشر شده و ارزیابیهای مستقل معمولاً با فاصلهی چند هفتهای میرسند؛ تا آن زمان بهتر است عددها را با احتیاط بخوانید. دوم، در برخی سنجههای کدنویسی، مدلهای رقیب همچنان جلوتر گزارش شدهاند و ادعای برتری مطلق در همهی حوزهها درست نیست.
سوم، در روزهای نخست عرضه، محدودیتهای ظرفیت و دسترسی مرحلهای معمول است و ممکن است تجربهی اولیهی کاربران با آنچه در گزارش رسمی توصیف شده فاصله داشته باشد. چهارم، هزینهی واقعی یک ایجنت چندمرحلهای بسیار بیشتر از یک پرسشوپاسخ ساده است؛ قیمت هر میلیون توکن جذاب بهنظر میرسد تا وقتی که ببینید یک جریان کاری کامل چند میلیون توکن مصرف میکند.
و در نهایت، مسئلهی همیشگی: توهمزایی و خطای واقعیتی هرچند کاهش یافته، اما حذف نشده است. هیچ ردهای از این خانواده جای بازبینی انسانی را در کارهای حساس نمیگیرد. برای درک بهتر مرز میان توانایی واقعی و تصور اغراقآمیز، پتانسیل و محدودیتهای واقعی هوش مصنوعی خواندنی است.
پرسشهای پرتکرار دربارهی خانوادهی جیپیتی ۵.۶
تفاوت اصلی سول، ترا و لونا در چیست؟
هر سه از یک نسل هستند اما در توان محاسباتی و قیمت تفاوت دارند. سول بالاترین کیفیت را برای کارهای پیچیده میدهد، ترا تعادل سرعت و کیفیت را برای کارهای روزمره فراهم میکند و لونا ارزانترین و سریعترین گزینه برای کارهای پرحجم و ساده است. فاصلهی قیمت هر رده تا ردهی بعدی دو برابر است.
آیا کاربران رایگان هم به این مدلها دسترسی دارند؟
بله، طبق اعلام رسمی کاربران رایگان و ردهی گو در بخشهایی از سرویس به مدل ترا دسترسی گرفتهاند. دسترسی به سول به ردههای پلاس، پرو، بیزنس و اینترپرایز محدود است و نسخهی سول پرو تنها برای ردههای بالاتر در دسترس قرار دارد.
پنجرهی متنی این مدلها چقدر است؟
پنجرهی متنی هر سه مدل یک میلیون توکن اعلام شده و بیشینهی خروجی ۱۲۸ هزار توکن است. این یعنی میتوانید حجم بسیار بزرگی از سند یا کد را یکجا به مدل بدهید، هرچند در عمل کیفیت تحلیل در متنهای بسیار طولانی همیشه یکنواخت نیست.
آیا برای کار با زبان فارسی هم بهتر شده است؟
هر نسل تازه معمولاً در زبانهای غیرانگلیسی هم پیشرفت میکند، اما اوپنایآی عدد جداگانهای برای فارسی منتشر نکرده است. تجربه نشان میدهد بهبود پرامپت و افزودن نمونهی فارسی، اثر محسوستری بر کیفیت خروجی دارد تا صرفاً ارتقا به ردهی گرانتر.
کدام رده را برای شروع انتخاب کنم؟
توصیهی عملی این است که کار را با ترا شروع کنید و فقط وقتی خروجی به کیفیت لازم نرسید، همان بخش مشخص را به سول ارجاع دهید. برای کارهای پرتکرار و ساده هم لونا را امتحان کنید؛ در بسیاری از موارد تفاوت کیفیت محسوس نیست اما تفاوت هزینه چشمگیر است.
