Китайская Z.ai (бывшая Zhipu AI) выпустила GLM-5.3. Главная новость не в бенчмарках, а в том, что модель уже нашла «потенциально серьёзную уязвимость» в Cursor, AI-редакторе кода, который недавно купила SpaceX. Об этом написал в X developer advocate Z.ai по имени Lou. Компания подтверждает: кибервозможности модели выросли быстрее, чем ожидали сами разработчики.
Что за модель и почему она важна
GLM-5.3 построена на той же базовой модели, что и GLM-5.2 с 743 млрд параметров. Z.ai не обучала новую основу, а масштабировала пост-тренинг: больше сред, больше задач, больше вычислительных мощностей для reinforcement learning. «Мы сделали для GLM-5.3 только масштабирование пост-тренинга», - написали в компании в техническом анонсе.
Такой подход делает GLM-5.3 тестом: насколько далеко можно продвинуть модель фронтирного масштаба без дорогого цикла предобучения. По заявлению Z.ai, результаты показывают заметный запас прочности.
Среда обучения теперь напоминает полноценную инженерную работу, а не изолированные упражнения. Агент получает доступ к кодовым базам, документации, вычислительным кластерам и результатам экспериментов, потом должен диагностировать проблему, изменить систему, запустить опыты и показать измеримое улучшение. Некоторые задачи приближены к нескольким дням работы опытного инженера.
Цифры на бенчмарках
На Terminal-Bench 3.0 модель выросла с 4,6 до 28,3 балла, на DeepSWE v1.1 - с 46,2 до 66,9, на AutomationBench - с 26,2 до 48,2. На Agents' Last Exam CLI улучшение скромнее: с 23,8 до 28,5.
Цифры: GLM-5.3 - 28,3 на Terminal-Bench 3.0 (было 4,6), 66,9 на DeepSWE v1.1 (было 46,2), 48,2 на AutomationBench (было 26,2). Для сравнения: GPT-5.6 Sol набирает 34,6, Claude Fable 5 - 33,7.
Лидером по всем тестам модель не стала. В таблице Z.ai у GPT-5.6 Sol на Terminal-Bench 3.0 - 34,6, у Claude Fable 5 - 33,7. На DeepSWE v1.1 GLM-5.3 получает 66,9 против 72,7 у GPT-5.6 Sol и 69,7 у Fable 5.
Компания делает ставку на эффективность, а не только на позицию в рейтинге. На собственном Z.ai Code Bench при максимальном режиме рассуждений GLM-5.3 достигает 34,5%, расходуя около 75 000 выходных токенов на задачу. GLM-5.2 показывала 23,4% при 96 000 токенов. При высоком уровне усилий GLM-5.3 набирает 31,4% при 50 000 токенов, тогда как Claude Opus 4.8 - 29,5% при 120 000.
Code Bench это приватная оценка самой Z.ai, так что цифры стоит считать заявленными, а не независимыми. Но снижение расхода токенов при росте числа завершённых задач напрямую влияет на компании, которые разворачивают агентов для кода: длинные циклы быстро раздувают стоимость и задержки.
Кибервозможности выросли быстрее ожиданий
Необычная часть релиза - кибербезопасность. Z.ai добавила в пост-тренинг среды для поиска уязвимостей, ожидая, что модель станет лучше находить ошибки в коде. Вместо этого, по словам компании, способности стали продвигаться дальше по цепочке эксплуатации.
«По мере масштабирования пост-тренинга кибервозможности развились быстрее, чем мы ожидали», - Z.ai.
На CyberGym, тесте поиска и проверки уязвимостей по исходному коду, GLM-5.3 набирает 84,5% против 77,2% у GLM-5.2. Это чуть выше заявленных результатов GPT-5.6 Sol (83,6%) и Mythos 5 (83,8%).
На ExploitBench преимущество слабее: 54,4% против 24,4% у GLM-5.2, но далеко от 76,5% у GPT-5.6 Sol и 78% у Mythos 5. На ExploitGym модель за двухчасовой бюджет завершает 105 задач, за шестичасовой - 130, тогда как GLM-5.2 справлялась с 29 и 39. Fable 5 доходит до 181 и 247, GPT-5.6 Sol - до 216 и 293.
Важнее направления, чем позиция в рейтинге. Z.ai говорит, что работа с командами безопасности в Китае дала 2 436 находок уязвимостей в 269 проектах после экспертной проверки и дедупликации. Из них 1 097 помечены как критические или высокой степени серьёзности, 53 раскрыты публично, 2 383 оставались под эмбарго на момент релиза.
Reuters сообщило, что Z.ai вводит ограничения вокруг самых продвинутых функций модели, включая подход «доверенного доступа» для чувствительных сценариев. Та же дилемма, что у закрытых лабораторий: агентные возможности, полезные для разработки, работают и как инструмент автономного исследования уязвимостей.
Что изменится для разработчиков
GLM-5.3 требует сменить способ вызова. Модель поддерживает три уровня усилий рассуждений: низкий, высокий и максимальный. Максимальный стоит по умолчанию и рекомендован для кода. Но в отличие от прошлых версий, мышление теперь нельзя отключить.
Приложения, которые отправляют thinking.type: «disabled», должны поменять значение на «enabled» и указать уровень усилий до переключения на GLM-5.3. Иначе запрос упадёт. Для части продакшн-систем это миграция, а не замена имени модели.
Путь от GLM-4.5 до GLM-5.3
Z.ai движется к агентной разработке быстро. GLM-4.5 в июле 2025 года объединила рассуждения, код и агентов. GLM-4.6 в сентябре расширила контекст до 200 000 токенов. GLM-5 в феврале 2026 года выросла до 744 млрд параметров с 40 млрд активных и ввела инфраструктуру «slime» для асинхронного reinforcement learning.
В июне GLM-5.2 принесла стабильный контекст в 1 млн токенов, открытые веса под лицензией MIT и поддержку более 20 сред кодинга. Цена API: 1,40 доллара за миллион входных токенов и 4,40 доллара за миллион выходных. Z.ai также привлекла около 4 млрд долларов через размещение акций в Гонконге.
Логика серии прослеживается: GLM-4.5 соединила рассуждения, код и агентов; GLM-5 увеличила фундамент; GLM-5.2 занялась длинным контекстом; GLM-5.3 пытается выжать больше из той же основы за счёт пост-тренинга.
Цены и доступность
GLM-5.3 доступна через GLM Coding Plan и среду ZCode. Индивидуальные тарифы: Lite - 12,60 доллара в месяц за 10 000 кредитов в неделю, Pro - 56 долларов, Max - 117,60 доллара. Командные места - 88 и 188 долларов за пользователя в месяц.
Z.ai перевела Coding Plan на балльную систему, которая раздельно учитывает входные, кешированные и выходные токены. Запросы вне пиковых часов в будни расходуют 50% обычных баллов.
Общих цен API для GLM-5.3 компания пока не дала. Открытые веса планируется выпустить через две недели после запуска, когда закончатся оценка безопасности и ужесточение. До этого модель доступна только в GLM Coding Plan и ZCode.
Что это значит для бизнеса
Для компаний во Владивостоке и на Дальнем Востоке релиз полезен двумя выводами. Первый: сильных агентов для кода можно получать без нового цикла обучения гигантской модели, масштабированием пост-тренинга. Это снижает цену обновлений и ускоряет их выход. Второй: чем автономнее агент, тем важнее решить, где он будет работать и кто им управляет, особенно когда речь про безопасность.
Внедрение искусственного интеллекта в разработку и бизнес-процессы теперь упирается не в выбор модели, а в настройку окружения, метрик и контроля. Нейросети для бизнеса, которые пишут код и проверяют системы на уязвимости, требуют той же дисциплины, что и обычные сотрудники: понятные задачи, проверка результатов, ограничение доступа. Автоматизация бизнес-процессов с такими агентами даёт эффект только при продуманной схеме. Посчитать, где агенты окупятся в вашей компании, поможет бесплатный аудит.