В начале недели DeepSeek выпустила V4-Flash в публичную бету, и маленькая модель обошла собственный флагман на всех девяти бенчмарках. Alibaba следом открыла веса Qwen 3.8-Max на 2,4 трлн параметров, впервые за год. OpenAI назвала следующее семейство моделей, Astra, без даты релиза, заявив, что оно решило десять математических задач, которые никто не мог решить десятилетие. Три лаборатории, семь дней, три стратегии, которые почти исключают друг друга.

DeepSeek V4-Flash: ставка на совместимость

V4-Flash-0731 обходит V4-Pro-Preview, более крупную и дорогую модель того же семейства, на всех девяти агентных и кодовых бенчмарках, которые DeepSeek опубликовала. Terminal Bench 2.1 вырос до 82,7 против 72,1, DeepSWE подскочил с 7,3 до 54,4.

Ключевые цифры: архитектура не менялась. Та же модель на 284 млрд параметров (mixture-of-experts), тот же размер. DeepSeek переделала только пост-тренинг, и семикратный рост на DeepSWE получен без увеличения масштаба.

Главный ход не в бенчмарках. V4-Flash нативно поддерживает Responses API от OpenAI и адаптирована под Codex: одна настройка подключает её к Codex CLI, десктопному приложению ChatGPT и расширению для VS Code. DeepSeek не зовёт разработчиков уходить из инструментов OpenAI, она предлагает себя как более дешёвый движок внутри них. Входные токены стоят около 0,14 доллара за миллион.

Оговорка обязательна: все бенчмарки запускала сама DeepSeek на внутреннем харнесе, который она не выпустила, два теста проприетарные и их никто другой запустить не может. Сравнение с собственным превью честное, яблоки с яблоками. Сравнение с моделями других вендоров не проверено.

Qwen 3.8-Max: ставка на открытость

Флагман Alibaba: 2,4 трлн параметров, 95 млрд активных, контекст на миллион токенов, встроенное зрение. Цены 2 и 6 долларов за миллион токенов, кеш за 0,25 доллара. Alibaba заявляет 93,0 на PaperBench, выше GPT-5.6 Sol и Claude Opus 4.8, и 86,6 на Terminal Bench 2.1.

Новость здесь лицензия, а не запуск. Весь год Alibaba держала сильнейшие модели закрытыми, а сейчас открывает веса на Max-масштабе впервые: и для 3.8-Max, и для меньшего чекпоинта 3.8-27B, который выйдет в ближайшие дни. Именно 27B большинство команд сможет запустить у себя: чекпоинт на 2,4 трлн параметров это артефакт дата-центра, а не рабочей станции. Акции Alibaba выросли на 7 процентов в Гонконге.

Демонстрации Alibaba впечатляют, если они подтвердятся: десять с лишним дней саморазвивающейся разработки от пустого репозитория до продакшена, 500 итераций оптимизации дизайна чипов, год симулированной стратегии e-commerce. Оговорки тоже копятся: бенчмарки не проверены независимо, один агрегатор ставит Qwen 3.8-Max на 31-е место из 215, хотя первое по рассуждению. Условия лицензии ещё не опубликованы, и именно они решают, означает ли открытый вес открытость без коммерческих ограничений.

OpenAI Astra: заявка на потолок

Релиз OpenAI релизом не был. Компания подтвердила название следующего семейства в третьем абзаце поста о математике, без продукта и даты. Внутренняя версия Astra, по заявлению, нашла новые решения десяти задач математики и теоретической информатики, открытых минимум десять лет: геометрия больших размерностей, теория групп, квантовая сложность, упаковка сфер, теория кодирования. Одна конструкция доказывает существование non-sofic групп, отвечая на вопрос, который Громов поставил в 1999 году.

От пресс-релиза это отличает формализация: OpenAI описала логику в верификаторе Lean и опубликовала, так что доказательства проверяются машиной. Обычные запуски открываются таблицей бенчмарков, этот открылся артефактами, которые эксперты могут проверить сами. Astra описана как несколько агентов, координирующих работу над одной задачей часами или днями. Дататы релиза, цены и доступности нет, OpenAI не сказала, станет ли Astra GPT-6. Anthropic ответила в течение часов, заявив, что Fable решила пять сопоставимых задач.

Честная оговорка: десять доказательств это реальный и узкий результат. Математика область, где проверка особенно чистая, поэтому демонстрация такая эффективная. Про то, как модель работает с вашей кодовой базой, это ничего не говорит, и проверить это никто за пределами OpenAI не может.

Три ставки, одна неделя

DeepSeek конкурирует стоимостью переключения. Снизить цену может каждый, а вот модель, работающая нативно внутри инструментов конкурента, убирает трение, которое обычно защищает экосистему, и ответить на это сложнее.

Alibaba конкурирует распространением. Выпустить модель фронтирного уровня по 2 и 6 долларов, отдать веса и стать основой, на которой строят другие. Две недели назад так же поступил Moonshot с Kimi K3 на 2,8 трлн параметров. Китайские лаборатории ставят скоординированно: быть везде важнее, чем быть лучшим.

OpenAI конкурирует потолком. Аргумент Astra не в том, что её можно скачать или она доступна по цене, а в том, что она сделала то, чего никто не делал, и это проверяемо. Такой аргумент рассчитан на правительства и крупные компании, а не на разработчиков, сравнивающих цены за токен.

Обратите внимание, кто здесь открыт. Две модели, которые можно скачать, китайские. Американская без даты релиза и с закрытыми весами. Полтора года назад эта фраза звучала бы наоборот.

Что это значит для бизнеса

За неделю рынок получил три сигнала. Модель за 0,14 доллара за миллион токенов работает внутри инструментов OpenAI, значит агентные пайплайны на формате Responses API можно переключить на неё минимальными правками. Открытые веса Qwen 3.8-Max означают, что через несколько дней появится чекпоинт 3.8-27B, который реально запустить на собственном сервере, без передачи данных наружу. А заявление OpenAI про Astra показывает, куда движется верхний сегмент: проверяемые результаты вместо маркетинговых таблиц.

Практический совет для компаний во Владивостоке и на Дальнем Востоке: сейчас выгодный момент считать экономику задач на новых моделях. Внедрение искусственного интеллекта и автоматизация с помощью ИИ дешевеют не потому, что кто-то объявил скидку, а потому, что появились открытые и совместимые альтернативы. Проверяйте на своей нагрузке, сколько стоит завершённая задача в V4-Flash, Qwen 3.8-27B и текущей модели, которую вы используете. Чужие бенчмарки для этого не нужны.

Внедрите искусственный интеллект в свой бизнес

Новости openai, новости deepseek и открытые модели Qwen меняют экономику автоматизации. Появились дешёвые совместимые модели и открытые веса, которые можно запустить на своём сервере. Мы помогаем компаниям во Владивостоке с внедрением искусственного интеллекта: подбираем модели под нагрузку, считаем стоимость задач, строим агентные пайплайны. От аудита до полного запуска.

Получить бесплатный AI-аудит