В четверг китайская Zhipu выложила GLM-5.3 и заявила: качество кодинга выросло на 50% по сравнению с GLM-5.2, и всё это без нового обучения модели. База та же, изменилось только дообучение. Параллельно Alibaba наконец открыла веса Qwen3.8-Max, а Anthropic тихо начала встраивать невидимые метки во весь текст Claude. Три новости, и у каждой есть оговорка.

GLM-5.3: весь прирост от дообучения

Zhipu не запускала новый pretraining. GLM-5.3 использует ту же базу, что GLM-5.2, а заявленные gains идут от расширенного пост-тренинга: больше длинных задач, больше типов окружений, дольше сам прогон. Компания отчитывается о 50-процентном скачке в кодинге, первом месте среди open-source моделей на Terminal Bench 3.0 и Agents' Last Exam. Качество кода и агентных задач, по её словам, приближается к Claude Fable 5.

Это уже второй такой случай за две недели. DeepSeek V4-Flash дала семикратный рост на DeepSWE от повторного дообучения без изменения архитектуры на 284 млрд параметров. Zhipu сделала то же самое с 50-процентным приростом на неизменной базе. Если результаты подтвердятся независимыми тестами, вывод для отрасли простой: запас роста моделей теперь в методах обучения, а не в масштабе. Методы дешевле, и их сложнее защитить капиталом.

Ключевые факты: GLM-5.3 набрала 84,5% на CyberGym против 83,8% у Mythos 5 и 83,6% у GPT-5.6 Sol. На ExploitBench результат скромнее: 54,4% против 78 и 76,5. Команды безопасности с помощью модели нашли 2 436 уязвимостей в 269 open-source проектах, часть из которых живёт 40 лет.

Кибербезопасность: обошла Mythos 5, но не догнала

Zhipu специально обучала GLM-5.3 на данных и средах для поиска уязвимостей в софте. На бенчмарке CyberGym, где модель должна находить и подтверждать дефекты безопасности по исходному коду, GLM-5.3 показала 84,5%. Это выше, чем у Mythos 5 (83,8%) и GPT-5.6 Sol (83,6%). Китайская open-weight лаборатория заявляет результат выше, чем у самой сильной модели Anthropic, на тесте безопасности.

Обратная сторона в том же отчёте, и Zhipu опубликовала её сама. На ExploitBench, который измеряет, насколько далеко модель продвигается по лестнице эксплуатации, GLM-5.3 получает 54,4% против 78 у Mythos и 76,5 у Sol. С поиском и проверкой уязвимостей модель справляется. Сборка рабочих цепочек атак заметно слабее. Этот разрыв и есть главное: заголовок про CyberGym не стоит читать как паритет.

Zhipu также сообщает, что команды безопасности нашли с помощью модели 2 436 уязвимостей в 269 open-source проектах, часть из которых живёт 40 лет. Цифра от самой Zhipu, независимо не проверена, но хотя бы проверяема: компания ведёт публичный реестр.

Alibaba: веса вышли, но не те

Alibaba опубликовала Qwen3.8-2.4T-A95B на Hugging Face и ModelScope. Это первый Max-класс Qwen с открытыми весами, и релиз закрывает обещание от 3 августа, которое уже вышло за заявленный срок. Существование репозитория подтвердил даже блог инженеров Nvidia, где описан запуск модели на стойке GB300.

Дальше начинаются оговорки. Опубликованные веса только текстовые и, по данным сообщества, не несут обещанный API-версией контекст на миллион токенов. Модель выходит под новой лицензией с разделением выручки, а не под стандартной разрешительной, и это стоит учитывать, если вы планируете строить на ней бизнес. Главное: Qwen3.8-27B, компактную модель, которую ждали разработчики, никто не выложил. Нет репозитория, нет карточки, нет новой даты. Сторонние трекеры помечают её как задержанную.

27B была релизом, который имел бы значение. Оценки сообщества: квант Q4 займёт 16-17 ГБ и запустится на одной видеокарте 4090. Модель на 2,4 трлн параметров это артефакт для дата-центра. 27B можно было реально поставить себе.

Claude начал помечать всё

Anthropic подтвердила: модели, вышедшие с 2 августа, встраивают невидимый ватермарк в сгенерированный текст и добавляют подписанные метаданные C2PA в файлы SVG, PNG и JPG. Метка стоит на API, в Claude, Claude Code, Claude Cowork и Claude Tag. Отказаться нельзя, действует по всему миру, включая страны вне ЕС.

Причина - требования статьи 50 европейского AI Act, которые вступили в силу 2 августа. Около 200 компаний подписали сопровождающий кодекс практик, включая Microsoft, Google, Meta и OpenAI. OpenAI, по данным СМИ, технически умеет ставить ватермарки годами и не внедрила их, а xAI не подписал ничего.

«Если вы боялись, что ваш репозиторий теперь статистически приписывается Claude, механика успокаивает лучше заголовков. Если вы надеялись получить реальное отслеживание происхождения AI-кода для аудита, этого почти наверняка нет.»

Вывод авторов The World of AI по итогам независимых тестов

Реакция громкая: на Reddit люди переживают, что их поймают за использованием Claude на работе или учёбе. Но для разработчиков механика важнее шума. Ватермарк работает на статистических паттернах текста, ему нужен объём. Проза Claude Code: планы, описания коммитов, описания PR, объяснения в чате, это обычный текст, метка там должна держаться. Код - слабый случай: он жёстко ограничен, часто короткий, и один проход форматирования переписывает его достаточно, чтобы сломать метку на уровне токенов. Правка одной строки или тема коммита не дотягивают до порога, который Anthropic сама называет слишком малым текстом для надёжного определения.

Anthropic не опубликовала тесты того, как метка переживает обычный рабочий процесс с пулл-реквестами, и признаёт, что редактирование, парафраз, перевод и смешивание с другим текстом её ослабляют. Независимые тесты показали: агрессивный парафраз с изменением и слов, и синтаксиса метку убивает.

Что это значит для бизнеса

Три новости складываются в один тренд: открытые веса перестали быть бинарным выбором. Теперь вопросы другие: выложены ли веса на самом деле, совпадает ли файл с моделью из API и что лицензия разрешает при вашей выручке. Две лаборатории за две недели показали большие приросты от дообучения на неизменных базах, значит следующее улучшение моделей будет дешевле, чем учила эпоха масштабирования.

Для бизнеса во Владивостоке и на Дальнем Востоке это рабочие новости: open-source модели приходят сюда без санкционных задержек, и их можно развернуть локально. Но перед внедрением искусственного интеллекта стоит проверить, что именно вы получаете: веса из открытого репозитория могут отличаться от API-версии, а лицензия с разделением выручки меняет экономику проекта. Внедрение искусственного интеллекта и автоматизация с помощью ИИ начинаются с аудита модели и её лицензии, а не с покупки API-подписки.

Внедрите искусственный интеллект в свой бизнес

Новости нейросетей показывают: открытые модели дают прирост от дообучения и становятся доступнее, но каждая оговорка в релизе меняет экономику внедрения. Мы помогаем компаниям во Владивостоке с внедрением искусственного интеллекта: подбираем модели, проверяем лицензии, считаем стоимость запуска. От аудита до продакшена.

Получить бесплатный AI-аудит