Китайская Z.ai собиралась открыть веса GLM-5.3, но отложила релиз на две недели после оценки её кибервозможностей. На тесте CyberGym модель набрала 84,5%, немного опередив закрытую Mythos 5 от Anthropic с 83,8%. При этом превращать найденные уязвимости в рабочие эксплоиты американская модель пока умеет значительно лучше.
Что произошло:
14 августа 2026 года Z.ai (международный бренд Zhipu AI) представила GLM-5.3 — новую open-weight модель с 743 миллиардами параметров, из которых около 40 миллиардов активны на токен. Архитектура та же, что у GLM-5.2: весь прирост производительности получен за счёт масштабирования пост-тренинга, без обучения новой базовой модели. Публичный релиз весов отложен на две недели.
На тесте CyberGym, оценивающем способность ИИ находить и валидировать уязвимости в исходном коде, GLM-5.3 набрала 84,5%. Это выше, чем 83,8% у закрытой Mythos 5 от Anthropic и 83,6% у GPT-5.6 Sol от OpenAI. Результаты основаны на данных самой Z.ai и не прошли независимую верификацию.
Сильна в защите, слабее в атаке:
GLM-5.3 не показывает такого же преимущества на всех этапах эксплуатации. На тесте ExploitBench, измеряющем способность превращать найденные уязвимости в рабочие эксплоиты, модель набрала 54,4% — в 2,2 раза выше, чем у предшественницы GLM-5.2 (24,4%), но значительно ниже Mythos 5 (78%) и GPT-5.6 Sol (76,5%).
В ходе задания с ограничением по времени GLM-5.3 выполнила 105 задач по разработке атак за два часа, тогда как Mythos 5 справилась со 181 задачей.
2 436 уязвимостей, включая 45-летние:
Z.ai обнаружила 2 436 уязвимостей в 269 open-source проектах, сотрудничая с командами безопасности NSFOCUS, CyberKunlun, DARKNAVY и исследователями из университетов Цинхуа и Нанькай. Из находок 1 097 оценены как критические или высокие. Самая старая уязвимость была внедрена в 1981 году, средний срок жизни бага до обнаружения составил 26,6 лет.
Z.ai оценила потенциальную стоимость находок примерно в ¥30 млн (~$4,4 млн), сопоставив их с выплатами и ценами на рынках bug bounty и vulnerability acquisition. На момент релиза 53 уязвимости были публично раскрыты, 2 383 находятся под эмбарго.
Среди находок — «потенциально серьёзная уязвимость» в Cursor, AI-редакторе кода. По данным Z.ai, Cursor недавно приобретён SpaceX; VentureBeat запросил комментарий у Cursor и на момент публикации ожидал ответа.
Почему задержали релиз:
В отличие от GLM-5.2, чьи веса появились на HuggingFace под лицензией MIT в течение дней после запуска, GLM-5.3 выйдет в открытый доступ примерно 28 августа — после завершения оценки безопасности. По словам компании, это первый случай в истории GLM, когда задержка связана именно с новыми киберспособностями модели, а не с экспортным давлением или политикой платформы.
В июле британский AISI показал, что GLM-5.2 уже приблизилась к закрытым frontier-моделям в киберзадачах: разрыв оценивался примерно в 4–7 месяцев. Расчётная стоимость 100-миллионного token-budget прогона GLM-5.2 в симулированном cyber range составляла около $46 против ~$85 у сопоставимых закрытых моделей. AISI отдельно отмечает, что их тестовые среды не включают ряд защит реальных сетей — например, active defenders.
Чувствительные функции кибербезопасности будут доступны только через программу «доверенного доступа» для верифицированных пользователей.
Новый предел open-weight гонки:
История GLM-5.3 показывает новый предел open-weight гонки. Пока открытые модели отставали от frontier-систем на полгода и больше, публикация весов воспринималась прежде всего как способ ускорить экосистему. Когда разрыв сокращается до нескольких месяцев, вместе с преимуществами открытого доступа распространяются и возможности, которые разработчик после релиза уже не может отозвать.
Open Source Shield:
Z.ai запустила инициативу Open Source Shield для аудита open-source проектов и предоставления защитного доступа к модели. Мейнтейнеры могут отправить свои GitHub-репозитории для автоматического поиска уязвимостей и координированного патчинга.
«Открытый мир не может иметь только открытые поверхности атаки, — написала компания в X. — У него должен быть и открытый щит».
Бенчмарки кодирования:
Помимо кибербезопасности, GLM-5.3 показала наивысший результат среди open-weight моделей на Terminal-Bench 3.0 — 28,3 балла (GLM-5.2 набирала 4,6), опередив Kimi K3 от Moonshot AI (17,4). На DeepSWE 1.1 модель набрала 66,9 балла (против 46,2 у GLM-5.2).
Однако на Terminal-Bench 3.0 закрытые модели остаются впереди: GPT-5.6 Sol — 34,6, Claude Fable 5 — 33,7. На DeepSWE 1.1 GPT-5.6 Sol набирает 72,7, Fable 5 — 69,7.
Контекст:
Z.ai — не первая китайская компания, заявившая о возможностях уровня Mythos. В июне 2026 года компания в сфере кибербезопасности 360 объявила, что её система Tulongfeng достигла аналогичных показателей, но эти утверждения также не получили независимого подтверждения.
GLM-5.3 продолжает успех GLM-5.2, который стал популярен среди зарубежных разработчиков благодаря возможностям, приближающимся к ведущим американским моделям, при более низкой стоимости.
Похожие материалы
Қытайлық GLM-5.3 осалдықтарды іздеу тестінде Mythos 5-тен озып шықты — және өз салмақтарының шығарылымын кейінге қалдырды
авг. 19, 2026
Nvidia ЖИ-агенттердің жаппай тапсырмалары үшін Nemotron 3.5 Lightning шығарды
авг. 13, 2026
Nvidia выпустила Nemotron 3.5 Lightning для массовых задач ИИ-агентов
авг. 13, 2026