معرفی مدل هوش مصنوعی GLM-5.3 شرکت Z.ai با جهش در کدنویسی و توانایی سایبری

مدل GLM-5.3 شرکت Z.ai: جهش در کدنویسی و یک توانایی سایبری غیرمنتظره

اخبار · هوش مصنوعی

شرکت چینی Z.ai مدل تازه‌ی خود GLM-5.3 را منتشر کرد؛ مدلی که در کدنویسی جهشی بزرگ داشت، اما یک توانایی جانبی و غیرمنتظره در حوزه‌ی امنیت سایبری هم با خودش آورد و باعث شد انتشار عمومی وزن‌هایش به تعویق بیفتد.

چکیده. در ۱۴ اوت ۲۰۲۶، شرکت Z.ai مدل GLM-5.3 را معرفی کرد که بدون آموزش دوباره‌ی شبکه‌ی پایه و فقط با پس‌آموزش گسترده، جهشی چندبرابری در آزمون‌های کدنویسی طولانی‌مدت ثبت کرد. اما در کنار این پیشرفت، مدل توانایی برنامه‌ریزی زنجیره‌های کامل نفوذ سایبری را هم به‌دست آورد؛ توانایی‌ای که سریع‌تر از پیش‌بینی مهندسان رشد کرد و شرکت را وادار به تأخیر دو هفته‌ای در انتشار وزن‌های مدل کرد.

معرفی مدل هوش مصنوعی GLM-5.3 شرکت Z.ai با جهش در کدنویسی و توانایی سایبری

۱. معرفی مدل GLM-5.3 چه زمانی و توسط چه کسی انجام شد؟

شرکت چینی Z.ai، توسعه‌دهنده‌ی خانواده‌ی مدل‌های GLM، در تاریخ ۱۴ اوت ۲۰۲۶ نسخه‌ی تازه‌ای از مدل خود با نام GLM-5.3 را عرضه کرد. این مدل در ادامه‌ی مسیر شرکت‌های بزرگ هوش مصنوعی برای رقابت در حوزه‌ی کدنویسی و عامل‌های خودکار قرار می‌گیرد؛ حوزه‌ای که این روزها میدان اصلی رقابت شرکت‌هایی مانند OpenAI، Anthropic و Google هم هست. برای آشنایی بیشتر با فضای رقابتی این بازار، می‌توانید سری مطالب اخبار هوش مصنوعی در سایت Mr ChatGPT را دنبال کنید.

خانواده‌ی مدل‌های GLM طی دو سال گذشته به یکی از جدی‌ترین رقبای چینی مدل‌های آمریکایی تبدیل شده است. این شرکت پیش‌تر با انتشار نسخه‌های ۴.۵ و ۵.۲ توانسته بود توجه توسعه‌دهندگان زیادی را به خود جلب کند، اما معرفی GLM-5.3 به دلیل ترکیب هم‌زمان جهش در کدنویسی و بروز یک توانایی جانبی حساس، توجه رسانه‌های تخصصی فناوری در سراسر جهان از جمله Bloomberg و MarkTechPost را هم به خود جلب کرد.

۲. چطور بدون آموزش دوباره، مدل قوی‌تر شد؟

نکته‌ی فنی جالب توجه در معرفی GLM-5.3 این است که مهندسان Z.ai شبکه‌ی پایه را دست‌نخورده نگه داشتند؛ همان مدل ۷۴۳ میلیارد پارامتری GLM-5.2 مبنای کار قرار گرفت. تمام بهبودهای عملکردی از مسیر «پس‌آموزش» به دست آمد: گسترش محیط‌های تمرینی، افزایش تنوع سناریوها و طولانی‌تر شدن دوره‌ی آموزش. این رویکرد نشان می‌دهد که در این مرحله از توسعه‌ی مدل‌های زبانی بزرگ، صرفاً بزرگ‌تر کردن مدل کافی نیست و شیوه‌ی آموزش می‌تواند به‌اندازه‌ی معماری پایه اهمیت داشته باشد.

۲.۱. مقایسه‌ی امتیازهای پیش و پس از پس‌آموزش

در آزمون Terminal-Bench 3.0، امتیاز مدل از ۴.۶ به ۲۸.۳ رسید؛ یعنی رشدی نزدیک به شش برابر. در آزمون DeepSWE v1.1 نیز امتیاز از ۴۶.۲ به ۶۶.۹ افزایش یافت. این دو آزمون به‌طور خاص توانایی مدل در حل وظایف طولانی و چندمرحله‌ای برنامه‌نویسی را می‌سنجند؛ دقیقاً همان مهارتی که برای عامل‌های خودکار کدنویسی حیاتی است.

همچنین در آزمون «آخرین امتحان عامل‌ها» با تمرکز بر خط فرمان، امتیاز مدل از ۲۳.۸ به ۲۸.۵ رسید. اهمیت این آزمون در آن است که سناریوهایی شبیه به کار واقعی یک برنامه‌نویس حرفه‌ای را شبیه‌سازی می‌کند؛ جایی که مدل باید چندین ابزار را پشت سر هم فراخوانی کند، خروجی هرکدام را تحلیل کند و بر اساس آن تصمیم بعدی را بگیرد. رشد پیوسته در این نوع آزمون‌ها نشان می‌دهد صنعت هوش مصنوعی به‌جای تمرکز صرف بر پاسخ‌های کوتاه، به سمت ساخت عامل‌های خودکار توانمند در وظایف طولانی حرکت کرده است.

بهبود عملکرد کدنویسی مدل GLM-5.3 در آزمون‌های Terminal-Bench و DeepSWE

۳. جهش در کدنویسی؛ اما هنوز عقب‌تر از رقبا در برخی آزمون‌ها

در آزمون داخلی Z.ai Code Bench، مدل نسبت به نسخه‌ی قبلی خود حدود ۵۰ درصد بهبود نشان داد و امتیاز ۳۱.۴ درصد را با حدود ۵۰ هزار توکن کسب کرد. با این حال، در مقایسه با رقبای غربی، تصویر یکدست نیست؛ مدل‌هایی مانند GPT-5.6 Sol و Claude Fable 5 در چند آزمون سخت‌تر همچنان جلوتر هستند. Z.ai این فاصله را تا حدی به آلودگی داده‌های آزمون‌های عمومی نسبت می‌دهد، موضوعی که این روزها در ارزیابی مدل‌های زبانی بزرگ به یک چالش رایج تبدیل شده است. علاقه‌مندان به درک بهتر این رقابت می‌توانند مطلب مقایسه‌ی ChatGPT و DeepSeek را هم بخوانند.

نکته‌ی جالب دیگر این است که در ارزیابی داخلی Z.ai، مدل Claude Opus 4.8 در حجم توکن بسیار بیشتری (حدود ۱۲۰ هزار توکن) به امتیاز ۲۹.۵ درصد رسیده، در حالی که GLM-5.3 با هزینه‌ی توکن کمتر عملکردی نزدیک نشان می‌دهد. این موضوع نشان‌دهنده‌ی تلاش Z.ai برای رقابت نه‌فقط بر سر دقت، بلکه بر سر کارایی و هزینه‌ی هر پاسخ است؛ معیاری که برای کسب‌وکارهایی که این مدل‌ها را در مقیاس بزرگ استفاده می‌کنند، اهمیت زیادی دارد.

۴. توانایی سایبری غیرمنتظره؛ نگرانی اصلی این خبر

مهم‌ترین بخش این معرفی، پیامدی جانبی و پیش‌بینی‌نشده بود. طبق گزارش‌های فنی، مدل به‌جای آنکه فقط در شناسایی تک‌تک آسیب‌پذیری‌های نرم‌افزاری بهتر شود، توانست زنجیره‌های کامل بهره‌برداری چندمرحله‌ای را طراحی و اجرا کند؛ یعنی برنامه‌ریزی منسجم برای نفوذ کامل به یک سامانه، نه فقط یافتن یک نقطه‌ضعف مجزا. Z.ai رسماً اعلام کرد که این توانایی «سریع‌تر از پیش‌بینی» رشد کرده است.

۴.۱. اعداد و آمار امنیت سایبری

در آزمون CyberGym، مدل امتیاز ۸۴.۵ درصد را ثبت کرد که حتی از GPT-5.6 Sol با ۸۳.۶ درصد هم پیشی گرفت. در آزمون ExploitBench نیز امتیاز مدل با رشدی دوبرابری به ۵۴.۴ درصد رسید. به گفته‌ی شرکت، از زمان انتشار نسخه‌ی قبلی یعنی GLM-5.2 تاکنون، این خانواده از مدل‌ها به شناسایی ۲٬۴۳۶ آسیب‌پذیری واقعی در ۲۶۹ پروژه‌ی متن‌باز کمک کرده‌اند که بیش از هزار مورد از آن‌ها در رده‌ی بحرانی یا پرخطر طبقه‌بندی شده‌اند.

البته باید توجه داشت که در آزمون تخصصی‌تر ExploitGym، مدل مدعی شده که در بازه‌ی زمانی دو ساعته توانسته ۱۰۵ وظیفه‌ی امنیتی را کامل کند؛ اما همچنان از مدل‌های تخصصی‌تری مثل Mythos 5 که امتیاز ۷۸ درصد در ExploitBench دارد عقب‌تر است. این تفاوت نشان می‌دهد که با وجود رشد چشمگیر GLM-5.3 در این حوزه، هنوز شکاف قابل توجهی میان مدل‌های عمومی کدنویس و مدل‌های تخصصی امنیت سایبری وجود دارد؛ شکافی که به گفته‌ی کارشناسان صنعت، به‌سرعت در حال کوچک‌تر شدن است.

۵. چرا انتشار وزن‌های مدل به تأخیر افتاد؟

به دلیل همین رشد غیرمنتظره در توانایی‌های سایبری، Z.ai تصمیم گرفت انتشار عمومی وزن‌های مدل را حدود دو هفته به تعویق بیندازد تا فرآیند «ارزیابی و تحکیم ایمنی» تکمیل شود. این رویکرد احتیاطی، الگویی است که این روزها در معرفی مدل‌های قدرتمند دیگر هم دیده می‌شود؛ آزمایشگاه‌هایی که پیش از انتشار عمومی، زمان بیشتری را صرف بررسی ریسک‌های احتمالی می‌کنند. برای درک بهتر اهمیت این نوع احتیاط، مطالعه‌ی مطلب پتانسیل‌ها و محدودیت‌های واقعی هوش مصنوعی پیشنهاد می‌شود.

تأخیر شرکت Z.ai در انتشار وزن‌های مدل GLM-5.3 برای ارزیابی ایمنی سایبری

۶. جایگاه GLM-5.3 در رقابت جهانی مدل‌های کدنویس

این رویداد یک‌بار دیگر نشان می‌دهد که رقابت روی مدل‌های کدنویس و عامل‌های خودکار، دیگر فقط به سرعت و دقت محدود نمی‌شود، بلکه مستقیماً با چالش‌های امنیت سایبری گره خورده است. شرکت‌های آمریکایی و چینی هر دو در تلاش‌اند تا مدل‌هایی بسازند که بتوانند وظایف طولانی و پیچیده‌ی برنامه‌نویسی را به‌طور خودکار انجام دهند؛ اما هرچه این توانایی قوی‌تر شود، احتمال بروز مهارت‌های جانبی حساس مانند تحلیل امنیتی هم بیشتر می‌شود. کسب‌وکارهایی که به دنبال استفاده از این نسل جدید مدل‌ها هستند، بهتر است ابتدا مطلب اهمیت هوش مصنوعی در کسب‌وکار را مطالعه کنند تا با فرصت‌ها و ریسک‌های این فناوری آشنا شوند.

در ماه‌های اخیر، رقابت میان آزمایشگاه‌های چینی و آمریکایی وارد فاز تازه‌ای شده است. شرکت‌هایی مانند DeepSeek، Moonshot و اکنون Z.ai با انتشار مدل‌های متن‌باز یا نیمه‌باز، فشار قیمتی زیادی بر آزمایشگاه‌های آمریکایی وارد کرده‌اند. در همین حال، شرکت‌هایی مانند Anthropic و OpenAI با تمرکز بر ایمنی و کنترل دقیق‌تر روند انتشار، سعی می‌کنند تعادلی میان سرعت نوآوری و مدیریت ریسک برقرار کنند. ماجرای GLM-5.3 نشان می‌دهد این تعادل، حتی برای آزمایشگاه‌های چینی هم به یک ضرورت اجتناب‌ناپذیر تبدیل شده است.

۷. کاربران چگونه می‌توانند از این مدل استفاده کنند؟

در حال حاضر دسترسی به GLM-5.3 از طریق رابط برنامه‌نویسی Z.ai، طرح اشتراک کدنویسی این شرکت و ابزار ZCode ممکن است. یک نکته‌ی فنی مهم این است که این مدل بدون فعال بودن حالت «تفکر» (thinking) کار نمی‌کند؛ تغییری که می‌تواند در برخی ابزارهای متصل به رابط برنامه‌نویسی، سازگاری را بر هم بزند. کاربرانی که می‌خواهند با چنین مدل‌هایی به شکل مؤثرتری کار کنند، می‌توانند راهنمای نوشتن پرامپت برای مبتدیان را هم مطالعه کنند.

۸. تفاوت توسعه‌دهنده‌ی واقعی با کدنویسی صرف با کمک هوش مصنوعی

با قدرت گرفتن روزافزون مدل‌های کدنویس، این پرسش دوباره مطرح می‌شود که مرز میان استفاده‌ی هوشمندانه از این ابزارها و اتکای کامل به آن‌ها کجاست. رشد ناگهانی توانایی‌های جانبی مانند تحلیل امنیتی در GLM-5.3 نشان می‌دهد که درک عمیق از نحوه‌ی کار این سامانه‌ها همچنان برای توسعه‌دهندگان حرفه‌ای ضروری است. برای بحثی کامل‌تر درباره‌ی این موضوع، مطلب توهم هوش مصنوعی؛ برنامه‌نویس تنها در برابر مهندس واقعی را از دست ندهید. برای یادگیری گام‌به‌گام کار با ابزارهای هوش مصنوعی نیز می‌توانید سری آموزش‌های آموزش ChatGPT در سایت Mr ChatGPT را دنبال کنید.

پرسش‌های متداول

مدل GLM-5.3 چه زمانی منتشر شد؟
این مدل در تاریخ ۱۴ اوت ۲۰۲۶ توسط شرکت چینی Z.ai معرفی شد.

چرا انتشار وزن‌های مدل به تأخیر افتاد؟
به دلیل رشد غیرمنتظره‌ی توانایی مدل در برنامه‌ریزی زنجیره‌های کامل نفوذ سایبری، شرکت زمان بیشتری را برای ارزیابی و تحکیم ایمنی مدل در نظر گرفت.

آیا GLM-5.3 از مدل‌های آمریکایی مانند Claude یا GPT قوی‌تر است؟
در برخی آزمون‌های کدنویسی داخلی، عملکردی نزدیک یا برتر نشان داده، اما در چند آزمون سخت‌تر عمومی همچنان از مدل‌هایی مثل GPT-5.6 Sol و Claude Fable 5 عقب‌تر است.

آیا مدل هم‌اکنون در دسترس عموم است؟
دسترسی از طریق رابط برنامه‌نویسی و طرح اشتراک کدنویسی Z.ai ممکن است؛ اما انتشار کامل وزن‌های مدل حدود دو هفته پس از معرفی اولیه انجام می‌شود.

جمع‌بندی. معرفی GLM-5.3 نشان داد که پیشرفت در مدل‌های کدنویس هوش مصنوعی می‌تواند توانایی‌های جانبی و حساسی مانند تحلیل امنیت سایبری را هم به‌همراه بیاورد؛ توانایی‌هایی که گاهی سریع‌تر از پیش‌بینی مهندسان رشد می‌کنند. این رویداد بار دیگر اهمیت ارزیابی ایمنی پیش از انتشار عمومی مدل‌های قدرتمند را یادآوری می‌کند. برای دنبال کردن آخرین و مهم‌ترین اخبار هوش مصنوعی، کانال @MrChatGPT_IR را دنبال کنید.

نسخهٔ فوری این مطلب در تلگرام: اینجا بخوانید

(0 رأی)

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *