Китайская Zhipu неделю прятала свою новую модель под именем Ox Alpha. 26 августа она раскрыла имя: это GLM-5.3-Flash, модель на 320 миллиардов параметров с открытыми весами и ценой от 0,15 доллара за миллион токенов.
Ox Alpha шесть дней сидела наверху сторонних рейтингов использования, а кто её сделал, никто не знал. Оказалось, это GLM-5.3-Flash: 320 миллиардов параметров, из них активны только 18, и собрана она в схеме mixture-of-experts. Это первая модель линейки, которая нативно принимает текст, картинки и видео, а контекст тянет до миллиона токенов.
Цена главное: 0,15 доллара за миллион входных токенов, то есть десятая часть тарифа флагмана GLM-5.3, а при временной скидке двадцатая. По кодингу и агентным задачам Flash опережает GLM-5.2, а на внутреннем бенчмарке подбирается к Claude Opus 4.8. Веса по лицензии MIT в тот же день ушли на Hugging Face.
Инженеры называют её первой open-source frontier моделью на гибридном sparse-attention с линейным вниманием, там же Manifold-Constrained Hyper-Connections и механизм IndexPool, снижающий задержку на длинном контексте. Модель учили на 30 триллионах мультимодальных токенов, и всё это, по словам Zhipu, работает на китайских чипах.
Стелс-подход: почему анонимно
Интереснее способ релиза. Zhipu выложила модель анонимно как Ox Alpha с 20 августа, бесплатно и без анонса. Шесть дней разработчики молотили её, независимые бенчмарки копились, а сообщество верно вычислило и имя, и происхождение до того, как компания сказала слово. Так она получила честные данные о реальном использовании. В феврале похожий трюк сработал с Pony Alpha, оказавшейся флагманом GLM-5.
Сестринская модель ушла в отрыв
Забавна история и с соседями по линейке. GLM-5.3 вышел 14 августа как сильнейшая открытая модель для кодинга с приростом 50% от пост-обучения, но его веса до сих пор не выложили, лицензия не раскрыта, а пользоваться им можно только через платный план. Младший GLM-5.3-Flash отдал веса в день анонса по самой свободной лицензии.
Внутри одной линейки видно, что анонс и лицензия это разные вещи. Проверка перед выпуском модели, которую учили искать уязвимости, это нормальная причина подождать, но разрыв между обещанием и реальностью бывает огромным.
Что это даёт бизнесу
Здесь модель ничего не держит, и это удобно проверить. Веса MIT лежат на Hugging Face, API стоит 0,15 доллара за миллион токенов, а те, кто уже тестировал Ox Alpha, имеют готовые результаты. Такую модель разумно брать на классификацию, извлечение данных, обработку документов и агентные циклы, где тысячи вызовов и флагман избыточен. Фразу про подход к Claude Opus 4.8 стоит читать как повод протестировать, а не как приказ мигрировать, это заявление вендора.
Командам во Владивостоке и на Дальнем Востоке, которые хотят урезать расходы на API, открытый код и дешёвый инференс дают приличную замену.