Двенадцатого июля DeepSeek объявила о снижении цен на модель V4-Pro на 75%. Для компаний, которые строят AI-продукты, это звучит как праздник. Но, как выясняется, дешёвые модели не решают главной проблемы: агентские AI-системы потребляют в десятки и сотни раз больше токенов, чем обычные чат-боты. И чем активнее бизнес использует AI-агентов, тем быстрее маржа уходит в минус.
Простая аналогия: чат-бот превращает один вопрос пользователя в один вызов модели. AI-агент превращает тот же вопрос в цепочку планирования, поиска, использования инструментов, проверки, обобщения и принятия решений. Пользователь видит один ответ. Поставщик платит за весь цикл.
Группа авторов из VentureBeat назвала это «проблемой 100x»: один и тот же запрос от пользователя может стоить в сотню раз дороже, если его обрабатывает агент, а не чат-бот. На длинных рабочих процессах множитель ещё выше. Падение цен на модели помогает, но не решает проблему архитектуры, при которой один промпт превращается в десятки платных операций.
Амплификация токенов: что это такое
В однозаходном чат-боте одно сообщение пользователя порождает один вызов модели. Соотношение входящих токенов к оплачиваемым - около 1:5.
В многошаговом AI-агенте, развёрнутом в поддержке клиентов, продажах, финансах, юридической проверке и разработке, это соотношение стабильно достигает 1:700 и выше. Каждый шаг цикла тащит за собой накопленный разговор, результаты работы инструментов и цепочки рассуждений. Ничего не отбрасывается.
Простой запрос «о чём спрашивал наш лучший клиент на прошлой неделе?» задействует семь платных операций:
- Промпт пользователя (~50 токенов)
- Системный промпт и описания инструментов (~3 000 токенов, повторяется каждый вызов)
- Поиск в базе знаний (~5 000 токенов контекста)
- Вызов модели №1 - выбор инструмента (8 000 / 200)
- Исполнение инструмента (~4 000 токенов)
- Вызов модели №2 - обобщение (12 000 / 400)
- Вызов модели №3 - решение о следующем шаге (12 400 / 100)
Одна фраза - около 35 000 входящих токенов. От 10 до 40 центов за запрос на frontier-модели. Умножаем на миллион запросов в месяц - получаем шестизначный счёт.
Почему это ломает SaaS-модель
Основная модель ценообразования enterprise AI - подписка за рабочее место: плати за пользователя в месяц, получай AI-агента, фиксируй маржу. Эта модель предполагает, что стоимость одного пользователя предсказуема.
Амплификация токенов ломает это допущение. Продвинутый пользователь, который запускает 50 агентских запросов в день, может стоить в инференсе больше, чем приносит по тарифу 40 долларов за место. Несколько вендоров уже приватно сообщают об отрицательной валовой марже на тяжёлых пользователях.
«Для моей команды стоимость вычислений намного превышает зарплаты сотрудников». - Брайан Катаназаро, вице-президент по глубокому обучению, Nvidia
Симптомы начали просачиваться в публичное поле. Bloomberg на этой неделе задокументировал разрыв между маркетинговыми демо Salesforce Agentforce и тем, что реально получают клиенты. Это типичный разрыв, который возникает, когда обещанный функционал технически возможен, но экономически невыгоден при текущей цене подписки.
Стратегический вывод не в том, что AI дорогой. Вывод в том, что доминирующая бизнес-модель AI-нативных компаний не выдерживает контакта с агентскими нагрузками.
Оркестрация агентов - новый ров
Технические решения известны и сходятся. Они не новы, но критичны для выживания:
- Cost-aware routing. Небольшая модель-классификатор решает, какой уровень (Haiku, Sonnet, Opus) обрабатывает каждый запрос. Хорошо настроенные роутеры сокращают счета на 60% без потери качества.
- Кеширование промптов. Anthropic, OpenAI и Google дают скидки 75-90% на кешированные префиксы.
- Дисциплина контекста. Обрезка выводов инструментов, очистка цепочек рассуждений и ограничение глубины агента - чтобы он не уходил в кроличью нору.
- Спекулятивное декодинг. Для self-hosted развёртываний эта техника даёт 2-3-кратную эффективную пропускную способность на тех же GPU.
«Компании, которые используют оркестрационное управление, сообщают о более высоком росте продуктивности - целостный слой оркестрации даёт в шесть раз больший эффект, чем compliance-подходы». - IBM
Компании, которые строят этот слой хорошо, начинают всё больше напоминать не операторов микросервисов, а финансовые торговые системы: каждое решение о маршрутизации имеет цену, каждый путь - свой P&L, каждый клиент - на метризованном бюджете.
Что это значит для бизнеса
Четыре действия отличат компании, у которых ещё будет маржа через 24 месяца, от тех, у кого её не будет:
- Сделать стоимость инференса метрикой первого класса. Отслеживать на фичу, на клиента, на класс запросов - так же, как отслеживали облачные расходы с середины 2010-х.
- Бюджетировать как медиабайер. Установить лимит стоимости на тысячу запросов на фичу. Превышение - алерт. Инженерия не будет следить за этим сама.
- Относиться к роутеру как к ядру инфраструктуры, а не как к оптимизации. Это новый балансировщик нагрузки.
- Аудировать промпты ежеквартально. Системный промпт на 4 000 токенов, который рос органически полгода - это шестизначный счёт в замедленной съёмке.
Структурный сдвиг под агентским AI не в том, что он дорогой. Как сегодняшнее снижение цен DeepSeek подчёркивает, стоимость одного токена на frontier-моделях падает втрое в год, и кривая не замедляется.
Сдвиг в том, что амплификация обгоняет снижение цен. Срезать стоимость токена на 75% не помогает компании, чьи агенты делают в 700 раз больше токенов на запрос пользователя, чем предполагала модель ценообразования. Впервые с начала облачной эры архитектурные решения снова стали финансовыми решениями в реальном времени. Переработка промпта - это событие маржи. Плохо связанный агентский цикл - это сбой с привязанной кредитной картой.
Компании, которые переживут следующие 24 месяца AI-инфраструктурного ценообразования, будут не теми, кто запускает самую дешёвую модель. Они будут теми, чьи агенты достаточно умны и знают, сколько стоит их мышление.
Как это касается бизнеса во Владивостоке и на Дальнем Востоке
Для предпринимателей в регионе вывод простой: внедрение искусственного интеллекта в бизнес-процессы сейчас упирается не в стоимость API, а в архитектуру. Нейросети для бизнеса становятся доступнее по цене токена, но если вы строите AI-агентов без контроля затрат, маржа уйдёт в минус быстрее, чем окупится автоматизация.
Хорошая новость: инструменты вроде cost-aware routing и кеширования промптов доступны уже сегодня. Главное - не копировать слепо SaaS-модель ценообразования, а считать реальную стоимость каждого агентского запроса до запуска. Автоматизация с помощью ии и внедрение AI-агентов принесут прибыль, только если вы понимаете экономику каждого вызова модели.