GLM-5.3 بدون تغییر معماری، با Post-training جهشی بزرگ در کدنویسی و امنیت سایبری داشته است؛ اما آیا واقعا میتواند رقبای قدرتمندش را شکست دهد؟
هر چند وقت یکبار یک مدل هوش مصنوعی جدید معرفی میشود که در نگاه اول شبیه یک بهروزرسانی معمولی است، اما در عمل تصویر رقابت را جابهجا میکند. GLM-5.3 از همین جنس است؛ نه به این دلیل که مدل پایهای بزرگتر یا معماری تازهای دارد، بلکه چون Z.ai توانسته با تمرکز بالا روی Post-training، در چند بنچمارک کلیدی کدنویسی و اتوماسیون جهشهایی چندینبرابری ثبت کند.
در این مقاله، GLM-5.3 را از زاویهی مشخصات، بنچمارکهای رسمی Z.ai، اولین ارزیابی مستقل و بازخورد کاربران بررسی میکنیم و نقاط ضعف و قدرت این مدل را میبینیم.
تمام جهش عملکردی GLM-5.3 از مقیاسدهی و بهبود فرایند Post-training میآید
Z.ai، آزمایشگاه چینی جداشده از دانشگاه تسینگهوا که پیشتر با نام Zhipu AI شناخته میشد، در ۱۴ آگوست ۲۰۲۶ از GLM-5.3 رونمایی کرد. نکتهی مهم این عرضه، مسیر متفاوت آن است: مدل جدید همان مدل پایهی ۷۴۳ میلیارد پارامتری GLM-5.2 را حفظ کرده و هیچ تغییری در معماری یا اندازهی آن داده نشده است.
به گفتهی Z.ai، تمام جهش عملکردی از مقیاسدهی و بهبود فرایند پسآموزش (Post-training) میآید؛ یعنی مدل روی محیطهای اجرایی و وظایف واقعیتر مهندسی نرمافزار، از تشخیص گلوگاه در زیرساخت یادگیری ماشین گرفته تا تغییر کد، اجرای تست و تحویل نتیجه نهایی آموزش داده شده است.
تمرکز اصلی GLM-5.3 روی سه حوزهی کدنویسی طولانیمدت در محیط ترمینال، کار عاملمحور روی پروژههای چندفایلی و تحلیل امنیتی است. این ترکیب باعث شده Z.ai آن را با شعار «Built to Code. Ready for Cyber Defense» معرفی کند.
Z.ai بخش قابلتوجهی از Post-training مدل را به دادهها و محیطهای مرتبط با کشف آسیبپذیری اختصاص داده است.
GLM-5.3 ابزاری جدی برای تحلیل امنیتی است
به گفتهی شرکت، هدف اولیه فقط بهتر شدن در پیدا کردن باگهای منفرد بود، اما در عمل مدل توانایی بیشتری برای دنبالکردن زنجیرهی چندمرحلهای بهرهبرداری از آسیبپذیریها نشان داد؛ نتیجهای که Z.ai میگوید از قبل برنامهریزیشده نبود.
Z.ai همچنین اعلام کرده که در آزمایش روی ۲۶۹ پروژهی متنباز، GLM-5.3 به ۲٬۴۳۶ آسیبپذیری رسیده که ۱٬۰۹۷ مورد از آنها در دستهی شدت متوسط تا بالا قرار داشتهاند؛ از جمله در نرمافزارهایی مثل هستههای سیستمعامل، موتورهای مرورگر و زیرساختهای متنباز. این آسیبپذیریها بهطور میانگین ۲۶٫۶ سال در کدها باقی مانده بودند و قدیمیترین مورد به سال ۱۹۸۱ برمیگردد.
GLM-5.3 در ۲۶۹ پروژه متنباز، ۲۴۳۶ آسیبپذیری پیدا کرد
این اعداد ادعای خود Z.ai هستند و همچنان نباید با یک آزمون امنیتی مستقل اشتباه گرفته شوند. با این حال، جهتگیری محصول روشن است؛ GLM-5.3 فقط یک مدل کدنویسی نیست و Z.ai آن را بهعنوان یک ابزار جدی برای تحلیل امنیتی هم مطرح میکند و به همین دلیل انتشار عمومی وزنهایش هم با تأخیر و بررسی ایمنی بیشتری همراه شده است.
برخلاف نسلهای قبلی GLM که با مجوز MIT و بهصورت کاملاً باز عرضه شده بودند، وزنهای GLM-5.3 در زمان رونمایی منتشر نشدند. Z.ai دلیل این تأخیر را نیاز به تکمیل ارزیابیهای ایمنی، بهویژه با توجه به قابلیتهای امنیت سایبری مدل، اعلام کرده و گفته انتشار عمومی وزنها حدود دو هفته پس از رونمایی، یعنی حوالی پایان آگوست ۲۰۲۶، در نظر گرفته شده است.
انتشار عمومی وزنهای GLM-5.3 بهدلیل توانایی بالای مدل در کشف آسیبپذیریهای امنیتی به تعویق افتاده است
تا زمان نگارش این مقاله، این وزنها هنوز منتشر نشدهاند و توصیف GLM-5.3 بهعنوان یک مدل «کاملاً باز» باید فعلاً زمان آینده در نظر گرفته شود، نه وضعیت فعلی. در حال حاضر، تنها راه استفاده از این مدل، API رسمی Z.ai و طرح Coding Plan است.
GLM-5.3 در حال حاضر مدلی کاملاً متنی است و ورودی تصویری بومی ندارد. پنجرهی کانتکست آن یک میلیون توکن است و حداکثر طول خروجی به ۱۲۸ هزار توکن میرسد. یکی از تغییرات مهم نسبت به نسل قبل این است که در GLM-5.3 استدلال (reasoning) همیشه فعال است و دیگر امکان غیرفعالکردن کامل آن وجود ندارد.
GLM-5.3 در حال حاضر مدلی کاملاً متنی است و ورودی تصویری بومی ندارد
کاربر فقط میتواند شدت استدلال را در سه سطح low، high و max تنظیم کند که max بهصورت پیشفرض انتخاب شده است.
توسعهدهندگانی که پیشتر درخواستهایشان را با غیرفعالکردن reasoning میفرستادند، هنگام مهاجرت باید این تنظیم را به سطح low تغییر دهند، وگرنه درخواست رد میشود.
ویژگی
GLM-5.3
مدل پایه
همان پایهی ۷۴۳ میلیاردی GLM-5.2؛ بهبودها صرفاً از Post-training
نوع ورودی و خروجی
متن به متن
پنجرهی زمینه
۱ میلیون توکن
حداکثر خروجی
۱۲۸ هزار توکن
استدلال
همیشه فعال؛ سه سطح low / high / max (پیشفرض max)
فراخوانی ابزار، خروجی ساختاریافته، کش کردن زمینه، استریم
پشتیبانی میشود
تاریخ عرضه
۱۴ آگوست ۲۰۲۶
بخش اصلی ادعای Z.ai مربوط به وظایف طولانی و عاملمحور است. جدول زیر نتایج رسمی منتشرشده توسط خود شرکت را در برابر GLM-5.2 نشان میدهد.
بنچمارک
چه چیزی را میسنجد
GLM-5.3
GLM-5.2
Terminal-Bench 3.0
کدنویسی عاملمحور در محیط ترمینال
۲۸٫۳٪
۴٫۶٪
DeepSWE v1.1
حل وظایف بلندمدت مهندسی نرمافزار
۶۶٫۹٪
۴۶٫۲٪
AutomationBench v1.0.6
اجرای گردشکارهای سازمانی چندمرحلهای
۴۸٫۲٪
۲۶٫۲٪
Agents' Last Exam (pass@1)
وظایف دشوار چندمرحلهای عامل هوش مصنوعی
۲۸٫۵٪
۲۳٫۸٪
Z.ai Code Bench (سطح Max، نرخ تکمیل)
عملکرد در محیطهای توسعهی محلی واقعی
۳۴٫۵٪ (~۷۵ هزار توکن خروجی)
۲۳٫۴٪ (~۹۶ هزار توکن خروجی)
GDPval-AA v2 (امتیاز Elo، ارزیابی مستقل Artificial Analysis)
انجام کارهای دانشی و حرفهای
۱۷۶۹
۱۵۰۸
نکتهی جالب در همین جدول این است که Z.ai فقط از افزایش دقت صحبت نمیکند؛ در بنچمارک داخلیZ.ai Code Bench، مدل جدید در سطح Max با مصرف توکن کمتر (حدود ۷۵ هزار در برابر ۹۶ هزار توکن) به نتیجهی بهتری رسیده است. با این حال، همانطور که در بخش بعد میبینیم، ارزیابی مستقل Artificial Analysis روایت دیگری از کارایی توکنی GLM-5.3 ارائه میدهد.
همهی نتایج بالا (بهجز GDPval-AA v2 که از Artificial Analysis گرفته شده) از ارزیابیهای منتشرشدهی خود Z.ai هستند. Terminal-Bench 3.0 بنچمارکی عمومی است، اما Z.ai آن را با پیکربندی و هارنس اختصاصی خودش (Claude Code 2.1.207) اجرا کرده و Z.ai Code Bench هم کاملاً خصوصی است. بنابراین این اعداد جهت پیشرفت را بهخوبی نشان میدهند، اما جای اجرای مستقل و قابلبازتولید را نمیگیرند.
تصویر واقعی پیچیدهتر از تیترهایی مثل قویترین مدل کدنویسی جهان است. در جدول منتشرشده توسط Z.ai، این مدل جدید در بعضی ارزیابیها از مدلهای بستهی رقیب عقب میماند.
بنچمارک (چه چیزی را میسنجد)
GLM-5.3
GPT-5.6 Sol
Claude Fable 5
Claude Mythos 5
Terminal-Bench 3.0 (کدنویسی عاملمحور در محیط ترمینال)
۲۸٫۳٪
۳۴٫۶٪
۳۳٫۷٪
—
DeepSWE v1.1 (حل وظایف بلندمدت مهندسی نرمافزار)
۶۶٫۹٪
۷۲٫۷٪
۶۹٫۷٪
—
Z.ai Code Bench، سطح Max (نرخ تکمیل وظیفه در محیط توسعهی محلی واقعی)
۳۴٫۵٪
—
۳۹٫۵٪
—
Z.ai Code Bench، سطح High
۳۱٫۴٪
—
—
— (Claude Opus 4.8: ۲۹٫۵٪)
CyberGym (پیداکردن و اثبات آسیبپذیری امنیتی در کد)
۸۴٫۵٪
۸۳٫۶٪
—
۸۳٫۸٪
ExploitBench (نوشتن یک اکسپلویت کاربردی از آسیبپذیری پیداشده)
۵۴٫۴٪
۷۶٫۵٪
—
۷۸٫۰٪
ExploitGym، بودجهی ششساعته (تعداد این کدهای اکسپلویت کاملشده در زمان محدود)
۱۳۰ وظیفه
—
—
۲۴۷ وظیفه
الگوی این جدول واضح است: هرچه یک آزمون در زنجیرهی «کشف آسیبپذیری تا ساخت اکسپلویت کامل» عمیقتر میشود، فاصلهی GLM-5.3 با مدلهای بستهی رقیب بیشتر میشود.
تمرکز GLM-5.3 روی دفاع سایبری است، نه تولید اکسپلویت
در CyberGym که کشف و اعتبارسنجی آسیبپذیری از روی کد منبع را میسنجد، GLM-5.3 بالاترین امتیاز را دارد؛ اما در ExploitBench و ExploitGym که ساخت اکسپلویت واقعی را ارزیابی میکنند، هم Claude Mythos 5 و هم GPT-5.6 Sol فاصلهی معناداری با آن دارند.
Z.ai این الگو را طبیعی میداند و میگوید تمرکز GLM-5.3 روی دفاع سایبری است، نه تولید اکسپلویت.
در مقابل، در AutomationBench که اجرای گردشکارهای سازمانی چندمرحلهای را میسنجد، GLM-5.3 با ۴۸٫۲ درصد از مدلهای ذکرشده در جدول Z.ai جلوتر است. این نشان میدهد که عملکرد عامل هوش مصنوعی یک معیار واحد نیست و بسته به نوع تسک، رتبهبندی مدلها میتواند کاملاً تغییر کند.
مهمترین دادهی مستقلی که پس از عرضهی GLM-5.3 منتشر شده، از Artificial Analysis است؛ مجموعهای که مدلها را با شاخص ترکیبی Intelligence Index و ارزیابیهای خودش مقایسه میکند، نه با اعداد سازنده. طبق این ارزیابی، GLM-5.3 در حالت max امتیاز ۶۰ گرفته که هفت واحد بالاتر از GLM-5.2 است و آن را همتراز با Kimi K3، در جایگاه مدل باز رتبهبالای فعلی، قرار میدهد. مدلهای بستهی ردهبالا مانند Claude Opus 5 همچنان امتیاز بالاتری دارند.
GLM-5.3 پرحرفتر از GLM-5.2 شده است
نتایج جالبتر Artificial Analysis دربارهی هزینه و کارایی توکنی است. برخلاف ادعای Z.ai مبنی بر کارآمدتر شدن مصرف توکن، این ارزیابی مستقل نشان میدهد GLM-5.3 با وجود قیمت پایینتر، پرحرفتر شده است.
مدل برای هر وظیفه بهطور میانگین حدود ۱۸٬۷۰۰ توکن خروجی تولید میکند، در برابر حدود ۱۵٬۷۰۰ توکن برای GLM-5.2 و حدود ۱۴٬۷۰۰ توکن برای Kimi K3. با این حال، چون قیمت هر توکن GLM-5.3 پایین است، هزینهی هر وظیفه (حدود ۰٫۶۸ دلار) هنوز کمتر از Kimi K3 (حدود ۰٫۸۴ دلار) و GPT-5.6 Sol (حدود ۱٫۲۳ دلار) است، هرچند نسبت به هزینهی حدود ۰٫۳۳ دلاری GLM-5.2 گرانتر شده است.
GLM-5.3 در کارهای دانشی و حرفهای از Kimi K3 بیش از صد واحد جلوتر است
نکتهای که بیشتر پوشش رسانهای گرفته، جهش GLM-5.3 در GDPval-AA v2 است؛ ارزیابی مستقل Artificial Analysis برای کارهای دانشی و حرفهای واقعی. امتیاز مدل از ۱۵۲۴ به ۱۷۷۰ رسیده، یعنی تنها پشت سر Claude Opus 5 با ۱۸۵۵ قرار میگیرد و از Kimi K3 با ۱۶۶۸ هم بیش از صد واحد جلوتر است. این یکی از معدود شواهد مستقلی است که نشان میدهد جهش GLM-5.3 صرفاً یک ادعای بازاریابی نیست.
عددی که بیشترین بازتاب را در ویدیوها و شبکههای اجتماعی داشته، امتیاز ۷۳ از ۸۰ (۹۱٫۲۵ درصد) در KingBench 3 است؛ نتیجهای که AICodeKing در یک ارزیابی زودهنگام و شخصی از مدل گزارش کرده است. طبق همین گزارش، GLM-5.2 روی همان بنچمارک ۶۰ از ۸۰ گرفته بود، در حالی که Claude Fable 5 با ۶۶، Qwen3.8 Max با ۶۵ و Claude Opus 4.8 با ۶۴ امتیاز رتبههای بعدی را دارند.
اما KingBench 3 را نباید در کنار بنچمارکهای رسمی و مستقل با همان سطح اعتبار قرار داد. این ارزیابی مجموعهای ثابت از هشت وظیفهی کدنویسی و شبیهسازی است که یک سازندهی محتوا آن را طراحی و اجرا کرده، نه یک استاندارد صنعتی یا leaderboard مستقل و قابلبازتولید مانند ارزیابیهای Artificial Analysis. بنابراین بهتر است از آن فقط بهعنوان یک سیگنال اولیه و غیررسمی از عملکرد مدل یاد کرد، نه مدرکی برای برتری مطلق GLM-5.3.
قیمت رسمی API برای GLM-5.3 با GLM-5.2 یکسان مانده است.
نوع توکن
قیمت
ورودی
۱٫۴۰ دلار به ازای هر یک میلیون توکن
ورودی کششده
۰٫۲۶ دلار به ازای هر یک میلیون توکن
خروجی
۴٫۴۰ دلار به ازای هر یک میلیون توکن
برای کاربرانی که ترجیح میدهند از طریق اشتراک ماهانه به GLM-5.3 دسترسی داشته باشند، Z.ai سرویس GLM Coding Plan را ارائه میکند. این سرویس در بازطراحی اخیر به سیستم سهمیه مبتنی بر اعتبار (Credit) تغییر کرده و پلنهای آن از ۱۸ دلار در ماه شروع میشوند.
از عرضهی GLM-5.3 بیش از یک هفته میگذرد؛ بنابراین بازخوردهای فعلی بیشتر تجربههای شخصی کاربران در انجمنهایی مثل ردیت ZaiGLM هستند تا نتیجهی ارزیابیهای مستقل و کنترلشده. بخشی از کاربران از افزایش استقلال مدل، کیفیت کدنویسی و پیشرفت آن نسبت به GLM-5.2 در ابزارهایی مثل OpenCode و ZCode رضایت دارند و میگویند مدل بهتر و پیوستهتر کار را تا پایان پیش میبرد.
در مقابل، شکایت اصلی گروه دیگری از کاربران به مصرف بالای توکن و اتمام سریع سهمیه برمیگردد؛ نکتهای که با یافتههای Artificial Analysis دربارهی پرحرفی بیشتر GLM-5.3 همخوانی دارد. برخی کاربران هم گفتهاند مدل گاهی کد را اجرا میکند، اما نتیجه به یک دور اصلاح دیگر نیاز دارد یا تستهایی مینویسد که بهاندازهی کافی مؤثر نیستند.
GLM-5.3 با وجود پیشرفتهایش، همچنان یک مدل زبانی است و امکان تولید اطلاعات نادرست یا خطای منطقی در آن وجود دارد. بخش زیادی از اعداد اولیهی این عرضه، از ارزیابیهای خود Z.ai میآیند و تنها بخش کوچکی، مثل GDPval-AA v2 و شاخص Intelligence Index، از منبعی مستقل تأیید شده است.
همچنین نباید فراموش کرد که «عملکرد عامل هوش مصنوعی» یک معیار یکپارچه نیست. مدلی مثل GLM-5.3 ممکن است در کشف آسیبپذیری یا اتوماسیون گردشکار بسیار خوب عمل کند، اما در ساخت اکسپلویت کامل یا برخی وظایف بلندمدت کدنویسی همچنان از رقبای بسته عقب بماند
برای کارهایی که با کد اصلی، دادههای حساس یا تصمیمگیری برای کاربران واقعی سروکار دارند، نظارت انسانی همچنان ضروری است.
اگر حوزهی اصلی فعالیت شما به توسعهی نرمافزار، رفع خطا، کار با مخزنهای بزرگ یا اجرای وظایف چندمرحلهای توسط عامل کدنویسی مربوط میشود، مدل GLM-5.3 بهویژه به دلیل برخورداری از پنجرهی زمینهی یکمیلیونتوکنی و قیمت API ارزانتر نسبت به بسیاری از مدلهای ردهبالا، ارزش بررسی دارد. در مقابل، از آنجا که این مدل ذاتا متنی است، گزینهی مناسبی برای پردازش تصاویر یا تحلیل مستقیم اسکرینشاتها به شمار نمیرود. همچنین برای کسانی که به کمترین میزان نظارت انسانی نیاز دارند، نمیتوان تنها بر پایهی آمارهای Z.ai نتیجه گرفت که این مدل از تمام مدلهای بسته بهتر عمل میکند.
GLM-5.3 نمونهی خوبی از اهمیت روزافزون Post-training در مدلهای زبانی است. Z.ai بدون تغییر مدل پایه توانسته در چند بنچمارک کدنویسی و عاملمحور جهشهای بزرگ ثبت کند و همزمان قابلیتهای امنیت سایبری مدل را بهطور محسوس بالا ببرد؛ جهشی که حالا با امتیاز ۶۰ در شاخص مستقل Artificial Analysis و جهش قابلتوجه در GDPval-AA v2 هم تا حدی تأیید شده است.
GLM-5.3 در ساخت اکسپلویت کامل و برخی بنچمارکهای کدنویسی بلندمدت هنوز پشت سر Claude و GPT-5.6 Sol است، وزنهایش هنوز منتشر نشده و طبق دادههای مستقل، نسبت به نسل قبل پرحرفتر شده است. ارزش اصلی این مدل شاید نه در یک رکورد واحد، بلکه در ترکیب عملکرد قوی در عاملهای کدنویسی، قیمت نسبتاً پایین و تمرکز ویژه روی امنیت دفاعی باشد. وقتی وزنهای مدل هم منتشر شوند، آن نقطه، آزمون واقعی و مستقل ادعاهای امروز GLM-5.3 خواهد بود.
خانواده ما
دیدگاهها