شرکت چینی Z.ai مدل تازهی خود GLM-5.3 را منتشر کرد؛ مدلی که در کدنویسی جهشی بزرگ داشت، اما یک توانایی جانبی و غیرمنتظره در حوزهی امنیت سایبری هم با خودش آورد و باعث شد انتشار عمومی وزنهایش به تعویق بیفتد.

لیست مطالب
۱. معرفی مدل GLM-5.3 چه زمانی و توسط چه کسی انجام شد؟
شرکت چینی Z.ai، توسعهدهندهی خانوادهی مدلهای GLM، در تاریخ ۱۴ اوت ۲۰۲۶ نسخهی تازهای از مدل خود با نام GLM-5.3 را عرضه کرد. این مدل در ادامهی مسیر شرکتهای بزرگ هوش مصنوعی برای رقابت در حوزهی کدنویسی و عاملهای خودکار قرار میگیرد؛ حوزهای که این روزها میدان اصلی رقابت شرکتهایی مانند OpenAI، Anthropic و Google هم هست. برای آشنایی بیشتر با فضای رقابتی این بازار، میتوانید سری مطالب اخبار هوش مصنوعی در سایت Mr ChatGPT را دنبال کنید.
خانوادهی مدلهای GLM طی دو سال گذشته به یکی از جدیترین رقبای چینی مدلهای آمریکایی تبدیل شده است. این شرکت پیشتر با انتشار نسخههای ۴.۵ و ۵.۲ توانسته بود توجه توسعهدهندگان زیادی را به خود جلب کند، اما معرفی GLM-5.3 به دلیل ترکیب همزمان جهش در کدنویسی و بروز یک توانایی جانبی حساس، توجه رسانههای تخصصی فناوری در سراسر جهان از جمله Bloomberg و MarkTechPost را هم به خود جلب کرد.
۲. چطور بدون آموزش دوباره، مدل قویتر شد؟
نکتهی فنی جالب توجه در معرفی GLM-5.3 این است که مهندسان Z.ai شبکهی پایه را دستنخورده نگه داشتند؛ همان مدل ۷۴۳ میلیارد پارامتری GLM-5.2 مبنای کار قرار گرفت. تمام بهبودهای عملکردی از مسیر «پسآموزش» به دست آمد: گسترش محیطهای تمرینی، افزایش تنوع سناریوها و طولانیتر شدن دورهی آموزش. این رویکرد نشان میدهد که در این مرحله از توسعهی مدلهای زبانی بزرگ، صرفاً بزرگتر کردن مدل کافی نیست و شیوهی آموزش میتواند بهاندازهی معماری پایه اهمیت داشته باشد.
۲.۱. مقایسهی امتیازهای پیش و پس از پسآموزش
در آزمون Terminal-Bench 3.0، امتیاز مدل از ۴.۶ به ۲۸.۳ رسید؛ یعنی رشدی نزدیک به شش برابر. در آزمون DeepSWE v1.1 نیز امتیاز از ۴۶.۲ به ۶۶.۹ افزایش یافت. این دو آزمون بهطور خاص توانایی مدل در حل وظایف طولانی و چندمرحلهای برنامهنویسی را میسنجند؛ دقیقاً همان مهارتی که برای عاملهای خودکار کدنویسی حیاتی است.
همچنین در آزمون «آخرین امتحان عاملها» با تمرکز بر خط فرمان، امتیاز مدل از ۲۳.۸ به ۲۸.۵ رسید. اهمیت این آزمون در آن است که سناریوهایی شبیه به کار واقعی یک برنامهنویس حرفهای را شبیهسازی میکند؛ جایی که مدل باید چندین ابزار را پشت سر هم فراخوانی کند، خروجی هرکدام را تحلیل کند و بر اساس آن تصمیم بعدی را بگیرد. رشد پیوسته در این نوع آزمونها نشان میدهد صنعت هوش مصنوعی بهجای تمرکز صرف بر پاسخهای کوتاه، به سمت ساخت عاملهای خودکار توانمند در وظایف طولانی حرکت کرده است.

۳. جهش در کدنویسی؛ اما هنوز عقبتر از رقبا در برخی آزمونها
در آزمون داخلی Z.ai Code Bench، مدل نسبت به نسخهی قبلی خود حدود ۵۰ درصد بهبود نشان داد و امتیاز ۳۱.۴ درصد را با حدود ۵۰ هزار توکن کسب کرد. با این حال، در مقایسه با رقبای غربی، تصویر یکدست نیست؛ مدلهایی مانند GPT-5.6 Sol و Claude Fable 5 در چند آزمون سختتر همچنان جلوتر هستند. Z.ai این فاصله را تا حدی به آلودگی دادههای آزمونهای عمومی نسبت میدهد، موضوعی که این روزها در ارزیابی مدلهای زبانی بزرگ به یک چالش رایج تبدیل شده است. علاقهمندان به درک بهتر این رقابت میتوانند مطلب مقایسهی ChatGPT و DeepSeek را هم بخوانند.
نکتهی جالب دیگر این است که در ارزیابی داخلی Z.ai، مدل Claude Opus 4.8 در حجم توکن بسیار بیشتری (حدود ۱۲۰ هزار توکن) به امتیاز ۲۹.۵ درصد رسیده، در حالی که GLM-5.3 با هزینهی توکن کمتر عملکردی نزدیک نشان میدهد. این موضوع نشاندهندهی تلاش Z.ai برای رقابت نهفقط بر سر دقت، بلکه بر سر کارایی و هزینهی هر پاسخ است؛ معیاری که برای کسبوکارهایی که این مدلها را در مقیاس بزرگ استفاده میکنند، اهمیت زیادی دارد.
۴. توانایی سایبری غیرمنتظره؛ نگرانی اصلی این خبر
مهمترین بخش این معرفی، پیامدی جانبی و پیشبینینشده بود. طبق گزارشهای فنی، مدل بهجای آنکه فقط در شناسایی تکتک آسیبپذیریهای نرمافزاری بهتر شود، توانست زنجیرههای کامل بهرهبرداری چندمرحلهای را طراحی و اجرا کند؛ یعنی برنامهریزی منسجم برای نفوذ کامل به یک سامانه، نه فقط یافتن یک نقطهضعف مجزا. Z.ai رسماً اعلام کرد که این توانایی «سریعتر از پیشبینی» رشد کرده است.
۴.۱. اعداد و آمار امنیت سایبری
در آزمون CyberGym، مدل امتیاز ۸۴.۵ درصد را ثبت کرد که حتی از GPT-5.6 Sol با ۸۳.۶ درصد هم پیشی گرفت. در آزمون ExploitBench نیز امتیاز مدل با رشدی دوبرابری به ۵۴.۴ درصد رسید. به گفتهی شرکت، از زمان انتشار نسخهی قبلی یعنی GLM-5.2 تاکنون، این خانواده از مدلها به شناسایی ۲٬۴۳۶ آسیبپذیری واقعی در ۲۶۹ پروژهی متنباز کمک کردهاند که بیش از هزار مورد از آنها در ردهی بحرانی یا پرخطر طبقهبندی شدهاند.
البته باید توجه داشت که در آزمون تخصصیتر ExploitGym، مدل مدعی شده که در بازهی زمانی دو ساعته توانسته ۱۰۵ وظیفهی امنیتی را کامل کند؛ اما همچنان از مدلهای تخصصیتری مثل Mythos 5 که امتیاز ۷۸ درصد در ExploitBench دارد عقبتر است. این تفاوت نشان میدهد که با وجود رشد چشمگیر GLM-5.3 در این حوزه، هنوز شکاف قابل توجهی میان مدلهای عمومی کدنویس و مدلهای تخصصی امنیت سایبری وجود دارد؛ شکافی که به گفتهی کارشناسان صنعت، بهسرعت در حال کوچکتر شدن است.
۵. چرا انتشار وزنهای مدل به تأخیر افتاد؟
به دلیل همین رشد غیرمنتظره در تواناییهای سایبری، Z.ai تصمیم گرفت انتشار عمومی وزنهای مدل را حدود دو هفته به تعویق بیندازد تا فرآیند «ارزیابی و تحکیم ایمنی» تکمیل شود. این رویکرد احتیاطی، الگویی است که این روزها در معرفی مدلهای قدرتمند دیگر هم دیده میشود؛ آزمایشگاههایی که پیش از انتشار عمومی، زمان بیشتری را صرف بررسی ریسکهای احتمالی میکنند. برای درک بهتر اهمیت این نوع احتیاط، مطالعهی مطلب پتانسیلها و محدودیتهای واقعی هوش مصنوعی پیشنهاد میشود.

۶. جایگاه GLM-5.3 در رقابت جهانی مدلهای کدنویس
این رویداد یکبار دیگر نشان میدهد که رقابت روی مدلهای کدنویس و عاملهای خودکار، دیگر فقط به سرعت و دقت محدود نمیشود، بلکه مستقیماً با چالشهای امنیت سایبری گره خورده است. شرکتهای آمریکایی و چینی هر دو در تلاشاند تا مدلهایی بسازند که بتوانند وظایف طولانی و پیچیدهی برنامهنویسی را بهطور خودکار انجام دهند؛ اما هرچه این توانایی قویتر شود، احتمال بروز مهارتهای جانبی حساس مانند تحلیل امنیتی هم بیشتر میشود. کسبوکارهایی که به دنبال استفاده از این نسل جدید مدلها هستند، بهتر است ابتدا مطلب اهمیت هوش مصنوعی در کسبوکار را مطالعه کنند تا با فرصتها و ریسکهای این فناوری آشنا شوند.
در ماههای اخیر، رقابت میان آزمایشگاههای چینی و آمریکایی وارد فاز تازهای شده است. شرکتهایی مانند DeepSeek، Moonshot و اکنون Z.ai با انتشار مدلهای متنباز یا نیمهباز، فشار قیمتی زیادی بر آزمایشگاههای آمریکایی وارد کردهاند. در همین حال، شرکتهایی مانند Anthropic و OpenAI با تمرکز بر ایمنی و کنترل دقیقتر روند انتشار، سعی میکنند تعادلی میان سرعت نوآوری و مدیریت ریسک برقرار کنند. ماجرای GLM-5.3 نشان میدهد این تعادل، حتی برای آزمایشگاههای چینی هم به یک ضرورت اجتنابناپذیر تبدیل شده است.
۷. کاربران چگونه میتوانند از این مدل استفاده کنند؟
در حال حاضر دسترسی به GLM-5.3 از طریق رابط برنامهنویسی Z.ai، طرح اشتراک کدنویسی این شرکت و ابزار ZCode ممکن است. یک نکتهی فنی مهم این است که این مدل بدون فعال بودن حالت «تفکر» (thinking) کار نمیکند؛ تغییری که میتواند در برخی ابزارهای متصل به رابط برنامهنویسی، سازگاری را بر هم بزند. کاربرانی که میخواهند با چنین مدلهایی به شکل مؤثرتری کار کنند، میتوانند راهنمای نوشتن پرامپت برای مبتدیان را هم مطالعه کنند.
۸. تفاوت توسعهدهندهی واقعی با کدنویسی صرف با کمک هوش مصنوعی
با قدرت گرفتن روزافزون مدلهای کدنویس، این پرسش دوباره مطرح میشود که مرز میان استفادهی هوشمندانه از این ابزارها و اتکای کامل به آنها کجاست. رشد ناگهانی تواناییهای جانبی مانند تحلیل امنیتی در GLM-5.3 نشان میدهد که درک عمیق از نحوهی کار این سامانهها همچنان برای توسعهدهندگان حرفهای ضروری است. برای بحثی کاملتر دربارهی این موضوع، مطلب توهم هوش مصنوعی؛ برنامهنویس تنها در برابر مهندس واقعی را از دست ندهید. برای یادگیری گامبهگام کار با ابزارهای هوش مصنوعی نیز میتوانید سری آموزشهای آموزش ChatGPT در سایت Mr ChatGPT را دنبال کنید.
پرسشهای متداول
مدل GLM-5.3 چه زمانی منتشر شد؟
این مدل در تاریخ ۱۴ اوت ۲۰۲۶ توسط شرکت چینی Z.ai معرفی شد.
چرا انتشار وزنهای مدل به تأخیر افتاد؟
به دلیل رشد غیرمنتظرهی توانایی مدل در برنامهریزی زنجیرههای کامل نفوذ سایبری، شرکت زمان بیشتری را برای ارزیابی و تحکیم ایمنی مدل در نظر گرفت.
آیا GLM-5.3 از مدلهای آمریکایی مانند Claude یا GPT قویتر است؟
در برخی آزمونهای کدنویسی داخلی، عملکردی نزدیک یا برتر نشان داده، اما در چند آزمون سختتر عمومی همچنان از مدلهایی مثل GPT-5.6 Sol و Claude Fable 5 عقبتر است.
آیا مدل هماکنون در دسترس عموم است؟
دسترسی از طریق رابط برنامهنویسی و طرح اشتراک کدنویسی Z.ai ممکن است؛ اما انتشار کامل وزنهای مدل حدود دو هفته پس از معرفی اولیه انجام میشود.
نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید
