DeepSeek V4 Flash возглавила рейтинги и получила от разработчиков звание «настоящего монстра». Когда компания Composio прогнала модель через восемь агентных сред на тридцати сложных задачах, результат оказался скромнее: 53,8% выполненных сценариев. И почти сразу DeepSeek объявила о росте цен на API до 1100%.

Лидер бенчмарков на реальных задачах

Composio тестировала V4 Flash в восьми разных харнессах, включая Claude Code, Codex и OpenCode. Задачи подбирали специально трудные: многошаговые сценарии с живыми инструментами вроде Gmail, GitHub, Slack и Google Sheets. Из 240 запусков прошли 129, а все тридцать воркфлоу полностью осилил только каждый пятый харнесс.

Разрыв между бенчмарками и практикой объясняется не качеством модели, а окружением. Одна и та же модель показывала заметно разные результаты в зависимости от харнесса, конфигурации инструментов, кеширования, повторов и провайдера. Для бизнеса вывод простой: способ запуска модели решает не меньше, чем сама модель.

«Безумные» цифры adoption и новая ценовая политика

V4 Flash вышла в открытую бету 31 июля, V4 Pro стала общедоступной 13 августа. Flash с 284 млрд параметров заточена под объём и скорость, Pro с 1,6 трлн параметров под сложные сценарии. С момента запуска Flash занимает первое место по использованию на OpenRouter.

«Цифры adoption у первой версии V4 Flash были безумными, в дискуссиях её недооценивали. Новая версия набирает столько же, сколько GLM 5.2, так что это настоящий монстр, и её будут использовать массово».

Нейтан Ламберт, ML-исследователь

Теперь DeepSeek меняет модель ценообразования. Рост тарифов доходит до 1100% в зависимости от модели, типа токенов и времени суток. Flash подорожала на 57-371%: 22 цента за миллион входных токенов и 66 центов за выходные в непиковые часы, 44 цента и 1,32 доллара в пиковые. Pro выросла на 51-355%: 66 центов и 1,98 доллара вне пика, 1,32 и 3,96 доллара в пик.

Скидка 50% в непиковые часы рассчитана на гибкое планирование нагрузки: 17 часов из 24 стоят вдвое дешевле. Аналитик Greyhound Research Санчит Гогия называет это не простым повышением цен, а «ценовой архитектурой, где время инференса становится экономической переменной». Работу, которая может подождать, вроде пакетной оценки или ночной генерации синтетических данных, выгодно переносить в дешёвые часы. Интерактивным агентам и живым операциям такая гибкость недоступна.

Почему повышение цен не отменяет преимущества

Технический аналитик Карми Леви называет шаг «самоубийственным для платформы, которая ищет доверие»: рост цен съедает главный козырь DeepSeek. Но по всем ценовым метрикам модель остаётся значительно дешевле конкурентов от OpenAI, Anthropic, Google и xAI.

DeepSeek придётся делать ставку на производительность и безопасность, а не только на цену. Клиенты получат меньше свободы в подсчётах, но возможность обосновать использование модели для конкретных задач сохраняется. «Преимущество со временем будет размываться, но пока бизнес-кейс собрать легко», говорит Леви.

Где V4 Flash уместна в enterprise

Инженер Meta Наман Ахуя собрал на V4 Flash агента для умного дома: модель координирует термостат, охранную систему Ring и замки, когда владелец уходит. Его вывод: как только модель начинает выполнять действия, надёжность важнее интеллекта. Нужны структурированные ответы инструментов, проверка, что действие прошло, обработка ошибок и чёткие границы полномочий.

В корпоративном контексте архитектура та же: тикеты, базы данных, CRM и API вместо домашних устройств. Гогия добавляет: у Flash нет накопленной истории корпоративных внедрений, «модель массовая по трафику, но не доказанная по контрактам». Документация DeepSeek для популярных агентных сред прямо предупреждает, что встроенные настройки V4 требуют override для стабильной работы.

Основатель EmpirioLabs Адам Даллул советует не гнаться за флагманами: для перевода сайта на другие языки большая модель не нужна, хватит дешёвого суб-агента. Многие компании уже строят внутренние бенчмарки, чтобы маршрутизировать задачи: рутину отдавать Flash, сложные и рискованные решения флагманам. Релевантная метрика смещается со стоимости токена на стоимость успешно завершённого сценария.

Главный вывод: дешёвый инференс не означает дешёвую и безопасную автоматизацию. Когда модель выполняет действия, надёжность, проверка и контроль доступа становятся важнее интеллекта. «Неудачный текстовый ответ неудобен, а неудачное действие в рабочем процессе имеет реальные последствия», говорит Ахуя.

Что это значит для бизнеса

История V4 Flash подтверждает: выбор модели это только часть внедрения. Результат определяют харнесс, провайдер, права доступа и схемы проверки. Компаниям во Владивостоке и на Дальнем Востоке, которые присматриваются к дешёвым моделям, стоит начинать с пилота на изолированных задачах с понятными метриками и запасной моделью на случай сбоя.

Внедрение искусственного интеллекта в бизнес-процессы выгоднее строить вокруг задачи, а не вокруг модели: рутинные операции отдавать дешёвым нейросетям для бизнеса, сложные и рискованные решения оставлять флагманам. Ии агенты для бизнеса, которые работают с CRM или внутренними системами, требуют проверки действий и контроля полномочий до запуска. Автоматизация бизнес-процессов на таких моделях окупается, когда цена считается за завершённый сценарий, а не за токен. Разобрать, какие задачи в вашей компании стоит отдать модели, а какие оставить людям, поможет бесплатный аудит.